WoW:通过具身交互迈向全知世界模型
TLDR
WoW是一个140亿参数生成式世界模型,通过机器人交互训练,在物理因果性和物体恒存性上达最先进水平。
评分理由
The paper presents a novel approach grounding world models in embodied interaction, with large-scale training and a new benchmark. Strengths include strong empirical results and a closed-loop action framework; weaknesses are acknowledged stochastic instabilities and potential limitations in generalizing beyond robot interaction data.
Read-first 评分解释
综合优先阅读分 68.6,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 57。
研究版图角色
前沿论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:157。
关键词评分
深度分析
创新点
- 在200万条真实机器人交互轨迹上训练一个140亿参数的生成式世界模型,将物理直觉扎根于因果丰富的交互中。
- SOPHIA,一种使用视觉语言模型智能体评估DiT生成的视频输出并迭代优化语言指令以约束输出趋向物理真实性的方法。
- 联合训练一个逆动力学模型,将优化后的计划转化为可执行的机器人动作,从而闭合想象到行动的闭环。
- WoWBench,一个专注于视频中物理一致性和因果推理的新基准。
方法
WoW是一个在200万条机器人交互轨迹上训练的140亿参数生成式世界模型。它使用扩散变换器(DiT)进行视频生成,并配备一个视觉语言模型智能体(SOPHIA),该智能体评估输出并迭代优化语言指令以提高物理真实性。联合训练一个逆动力学模型,将优化后的计划转化为机器人动作。该模型在新引入的WoWBench基准上使用人工和自主评估指标进行评估。
关键结果
WoW在WoWBench的物理一致性和因果推理方面达到了最先进性能,展示了在物理因果性、碰撞动力学和物体恒存性方面的强大能力。
局限性
- 模型对物理的理解是可能结果的概率分布,导致随机不稳定性。
- 模型表现出物理幻觉,表明在物理因果性方面的扎根不完善。
技术栈
DiT (Diffusion Transformer)SOPHIA (Vision-Language Model Agent)Inverse Dynamics ModelWoWBench