Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

世界行动模型:综述

arXiv 2026 65.9 survey

TLDR

综述阐明世界行动模型是区别于视频生成器的具身预测行动模型,并提供分类与设计权衡分析。

评分理由

Strengths include a clear taxonomy and unified discussion of key properties like interactability and causality. Weaknesses: as a survey, it lacks novel experiments or empirical contributions, and the abstract does not detail specific real-world evaluations.

Read-first 评分解释

综合优先阅读分 65.9,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 58。

近期性 6%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

引用影响力 18%
94.2

使用 OpenAlex 形态的引用元数据作为文献关注度信号,并与论文本身质量分开处理。 归一化引用分位:0.94211446

主题相关性 29%
82.9

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

方法质量 18%
70

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:分析、评估

可复现性 18%
38

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:GitHub

引用速度 12%
0

引用速度按发表年限估算年均引用,降低旧论文天然占优的偏差。 年均引用:0.00

研究版图角色

基础论文前沿论文桥接论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:438。

关键词评分

world model
10
generative world model
9
video world model
9
world dynamics prediction
9
interactive world model
8
world simulator
7
model-based reinforcement learning world model
6

深度分析

创新点

  • 阐明了世界行动模型(World Action Models)、视频生成模型、基于动作的视频世界模型、视觉-语言-行动策略(Vision-Language-Action policies)以及广义世界模型之间的边界。
  • 通过两个互补视角组织现有工作:每种方法生成的内容(渲染的未来、潜在的未来、无视频生成的动作推理)以及按预测基质、骨干网络、动作耦合和部署机制进行分解。
  • 提供了跨方法的可交互性、因果性、持续性、物理合理性和泛化性的统一讨论。
  • 识别出一致的设计模式:WAMs是预测行动方法,在表征丰富性与计算、内存、延迟和动作标签成本之间进行权衡。
  • 强调了领域趋势:方法生成更少的未来内容,同时保留控制所需的信息。

方法

该综述对世界行动模型进行了全面的文献回顾,基于两个互补视角进行分类:它们生成的未来类型(渲染的、潜在的或无视频生成的动作推理)以及按预测基质、骨干网络、动作耦合和部署机制的分解。随后讨论了关键属性,如可交互性、因果性、持续性、物理合理性和泛化性,接着分析了数据、评估和开放挑战。

关键结果

该综述识别出一致的设计模式:世界行动模型不仅仅是带有动作头的视频生成器,而是预测行动方法,在表征丰富性与计算、内存、延迟和动作标签成本之间进行权衡。它观察到领域趋势:方法生成更少的未来内容,同时保留控制所需的信息。

局限性

  • 该领域的快速扩展可能使综述的分类不完整或迅速过时。
  • 所提出的分类法和边界虽然具有澄清作用,但由于该领域的模糊性,仍可能涉及主观判断。

标签

world action modelsembodied AIvideo generationworld modelssurveyROCV