Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

WoW:通过具身交互迈向全知世界模型

arXiv 25.9 2025 68.6 method, application

TLDR

WoW是一个140亿参数生成式世界模型,通过机器人交互训练,在物理因果性和物体恒存性上达最先进水平。

评分理由

The paper presents a novel approach grounding world models in embodied interaction, with large-scale training and a new benchmark. Strengths include strong empirical results and a closed-loop action framework; weaknesses are acknowledged stochastic instabilities and potential limitations in generalizing beyond robot interaction data.

Read-first 评分解释

综合优先阅读分 68.6,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 57。

近期性 8%
86.7

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2025

主题相关性 42%
81.4

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

方法质量 25%
80

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基准、评估、指标

可复现性 25%
30

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:无

研究版图角色

前沿论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:157。

关键词评分

world model
10
generative world model
9
interactive world model
9
video world model
8
world dynamics prediction
8
world simulator
7
model-based reinforcement learning world model
6

深度分析

创新点

  • 在200万条真实机器人交互轨迹上训练一个140亿参数的生成式世界模型,将物理直觉扎根于因果丰富的交互中。
  • SOPHIA,一种使用视觉语言模型智能体评估DiT生成的视频输出并迭代优化语言指令以约束输出趋向物理真实性的方法。
  • 联合训练一个逆动力学模型,将优化后的计划转化为可执行的机器人动作,从而闭合想象到行动的闭环。
  • WoWBench,一个专注于视频中物理一致性和因果推理的新基准。

方法

WoW是一个在200万条机器人交互轨迹上训练的140亿参数生成式世界模型。它使用扩散变换器(DiT)进行视频生成,并配备一个视觉语言模型智能体(SOPHIA),该智能体评估输出并迭代优化语言指令以提高物理真实性。联合训练一个逆动力学模型,将优化后的计划转化为机器人动作。该模型在新引入的WoWBench基准上使用人工和自主评估指标进行评估。

关键结果

WoW在WoWBench的物理一致性和因果推理方面达到了最先进性能,展示了在物理因果性、碰撞动力学和物体恒存性方面的强大能力。

局限性

  • 模型对物理的理解是可能结果的概率分布,导致随机不稳定性。
  • 模型表现出物理幻觉,表明在物理因果性方面的扎根不完善。

技术栈

DiT (Diffusion Transformer)SOPHIA (Vision-Language Model Agent)Inverse Dynamics ModelWoWBench

标签