WorldSample: 基于世界建模的闭环真实机器人强化学习
TLDR
WorldSample利用世界模型进行合成数据增强和策略节奏学习,使真实机器人RL成功率提升28%,训练步骤减少59%。
评分理由
The paper presents a novel closed-loop framework that integrates real rollouts with a post-trained world model to generate high-fidelity synthetic transitions, addressing high interaction costs. Strengths include significant empirical gains on manipulation tasks and a principled method (PPL) to mitigate hallucination noise. Weaknesses are limited task scope and potential sensitivity to world model quality, though the abstract does not discuss failure cases.
Read-first 评分解释
综合优先阅读分 44,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 53。
研究版图角色
排序敏感性
稳定性:volatile;排名波动范围:431。
关键词评分
深度分析
创新点
- 用于真实机器人强化学习的物理 rollout、世界模型生成与策略改进之间的闭环真实-合成循环
- 策略节奏学习(PPL),通过样本选择与调度来调节训练过程,平衡数据增强与价值高估及幻觉噪声
- 基于真实 rollout 后训练的世界模型,生成高保真合成转移,减少视觉幻觉
方法
WorldSample 是一种数据增强框架,利用在真实机器人 rollout 上后训练的世界模型生成合成转移,形成真实-合成循环。它引入策略节奏学习(PPL)在 RL 训练过程中选择和调度这些合成样本,减轻价值高估和幻觉噪声。在真实机器人的接触密集和精确操作任务上进行了评估,并与基线进行了比较。
关键结果
与基线相比,WorldSample 将策略成功率提高了 28%,训练步骤减少了 59%,同时将世界模型的视觉保真度(PSNR)提高了 19.4dB,SSIM 提高了 0.47,优于仅使用演示的后训练。