WMPO:基于世界模型的视觉-语言-动作策略优化
TLDR
WMPO用像素世界模型实现VLA机器人无真实环境交互的在线策略强化学习,提升样本效率与性能。
评分理由
The paper introduces a novel framework that combines world models with on-policy GRPO for VLA robots, showing strong results in simulation and real-world settings. However, the abstract lacks details on world model architecture and potential limitations of relying on pretrained VLA features.
Read-first 评分解释
综合优先阅读分 63.3,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 48。
研究版图角色
前沿论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:170。
关键词评分
深度分析
创新点
- 基于世界模型的视觉-语言-动作(VLA)策略优化,无需真实环境交互即可实现在线策略强化学习
- 基于像素的世界模型预测与预训练VLA特征对齐,生成想象轨迹
- 将在线策略GRPO(组相对策略优化)应用于VLA强化学习,性能优于离线策略方法
方法
WMPO训练一个基于像素的世界模型,预测未来的观测和奖励,并将想象轨迹与预训练VLA模型的特征对齐。然后,策略完全在世界模型内使用在线策略GRPO进行优化,避免了真实机器人交互。该框架在仿真和真实机器人环境中使用标准操作基准进行评估。
关键结果
WMPO显著提高了样本效率,并相比基线取得了更强的整体性能。它还展现出涌现的自我纠正行为,并表现出强大的泛化和终身学习能力。
局限性
- 世界模型的不准确性可能导致策略利用模型误差,从而可能造成仿真到现实的差距
- 对预训练VLA特征的依赖可能限制其在缺乏此类特征的领域的适用性
- 在线策略GRPO可能需要仔细的超参数调优,并且由于像素级预测可能计算成本高昂