Hi-WM: 人在世界模型中的可扩展机器人后训练
TLDR
Hi-WM利用世界模型作为可纠正基底,通过人在环后训练提升机器人策略在真实任务上的表现。
评分理由
The paper presents a novel framework combining human intervention within a world model for efficient post-training, with strong real-world evaluation on manipulation tasks. However, the abstract lacks details on the world model architecture and generalization beyond the tested tasks.
Read-first 评分解释
综合优先阅读分 53.8,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 42。
研究版图角色
前沿论文桥接论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:252。
关键词评分
深度分析
创新点
- 提出Human-in-the-World-Model (Hi-WM)框架,利用学习到的世界模型作为可重复使用的可纠正基底,针对失败进行策略改进,使人类可以直接在模型中进行干预,而非在真实世界中。
- 引入中间状态缓存,支持回滚和分支,使得单个失败状态可被重复用于多个纠正延续,从而在易失败行为周围产生密集的监督信号。
- 证明世界模型不仅可以作为生成器或评估器,还可以作为可扩展机器人后训练的有效纠正基底。
方法
Hi-WM是一个后训练框架,首先将预训练策略在学习到的世界模型内进行闭环 rollout。当rollout变得不正确或易失败时,人类直接在模型中进行干预,提供简短的纠正动作。系统缓存中间状态并支持回滚和分支,使得单个失败状态可以产生多个纠正延续。生成的纠正轨迹被添加回训练集进行后训练。评估在三个真实世界操作任务(刚性和可变形物体)以及两个策略主干上进行,与基础策略和世界模型闭环基线进行比较。
关键结果
Hi-WM在真实世界成功率上平均比基础策略提高37.9个百分点,比世界模型闭环基线提高19.0个百分点。世界模型评估与真实世界性能强相关(r = 0.953)。
局限性
- 该方法依赖于学习到的世界模型的准确性和泛化能力;任何模型缺陷都可能影响纠正rollout的质量。
- 仍然需要人类干预(尽管在模型内),这可能限制扩展到大量失败案例的可扩展性。
- 评估仅限于三个操作任务和两个策略主干;尚未证明更广泛的适用性。