LUMOS:基于语言条件的世界模型模仿学习
TLDR
该论文围绕“LUMOS: Language-Conditioned Imitation Learning with World Models”研究世界模型相关问题。
评分理由
Fallback reasoning generated from available title and abstract metadata: We introduce LUMOS, a language-conditioned multi-task imitation learning framework for robotics. LUMOS learns skills by practicing them over many long-horizon rollouts in the latent space of a learned world model and transfers these skills zero-shot to a real...
Read-first 评分解释
综合优先阅读分 52.3,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。
研究版图角色
前沿论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:653。
深度分析
创新点
- 基于语言条件的模仿学习框架,通过在所学世界模型的潜在空间中进行练习来学习技能
- 在潜在空间中进行在策略学习,以缓解离线模仿学习中常见的策略诱导分布偏移
- 使用少于1%的事后语言标注从非结构化游戏数据中学习,同时在测试时仍可通过语言命令进行控制
- 在训练中结合潜在规划与基于图像和语言的事后目标重标注
- 在多个时间步上优化在世界模型潜在空间中定义的内在奖励,以减少协变量偏移
- 首个在离线世界模型内为真实机器人学习语言条件连续视觉运动控制的方法
方法
LUMOS从带有稀疏语言标注的离线非结构化游戏数据中学习世界模型。在训练过程中,它在世界模型的潜在空间中进行在策略推演,利用事后目标重标注(图像和语言)和内在奖励来缓解分布偏移。然后将学习到的策略零样本迁移到真实机器人上,用于语言条件控制。
关键结果
在长视野CALVIN基准测试中,LUMOS在链式多任务评估上优于先前具有可比方法的学习方法。它还展示了将语言条件视觉运动控制零样本迁移到真实机器人的能力。
局限性
- 依赖于从离线数据学习世界模型,这在高度多样化的环境中可能难以获取或泛化
- 真实世界验证仅限于单一机器人设置和特定任务,更广泛的泛化性尚未验证
- 少于1%语言标注的要求可能仍依赖于非结构化游戏数据的质量和覆盖范围