Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

将预见转化为行动:世界动作模型中表示对齐的重新利用

arXiv 2026 62.3 method, application

TLDR

提出AGRA,将视频扩散特征与语义表示对齐,提升世界动作模型中的动作基础,用于机器人操作。

评分理由

The paper identifies a key representation mismatch in World Action Models and provides a novel alignment objective (AGRA) with empirical validation on real-world tasks. Strengths include clear problem diagnosis and practical improvement; weakness is limited scope to manipulation tasks without broader RL or simulator evaluation.

Read-first 评分解释

综合优先阅读分 62.3,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 41。

近期性 6%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

引用影响力 18%
94

使用 OpenAlex 形态的引用元数据作为文献关注度信号,并与论文本身质量分开处理。 归一化引用分位:0.93957045

方法质量 18%
90

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:分析、基线、评估、实验、结果

主题相关性 29%
58.6

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

可复现性 18%
38

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:代码

引用速度 12%
0

引用速度按发表年限估算年均引用,降低旧论文天然占优的偏差。 年均引用:0.00

研究版图角色

基础论文前沿论文桥接论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:411。

关键词评分

world model
9
video world model
8
generative world model
7
world dynamics prediction
6
interactive world model
5
model-based reinforcement learning world model
4
world simulator
2

深度分析

创新点

  • 发现世界动作模型中的表示不匹配:为视觉重建优化的隐藏状态并未天然组织成适用于低级动作控制的形式
  • 提出AGRA(动作基础表示对齐)目标,将中间视频扩散特征与来自基础视觉编码器的空间一致语义表示对齐
  • 证明AGRA提升了物体定位精度、功能理解能力以及对任务无关区域扰动的鲁棒性,从而改善了分布内性能和分布外泛化

方法

本文使用世界动作模型(WAMs),该模型利用视频生成模型在生成控制动作之前建模未来场景演化。通过动作头注意力分析和因果干预诊断失败原因,揭示了表示不匹配。提出AGRA,一种动作基础表示对齐目标,通过将中间视频扩散特征与来自基础视觉编码器的空间一致语义表示对齐来正则化世界-动作接口。在真实世界操作任务上进行评估。

关键结果

AGRA在基线世界动作模型基础上持续提升了分布内性能和分布外泛化,具体改善了物体定位精度和功能理解,并使策略对任务无关区域的扰动更加鲁棒。

技术栈

Video generation modelsDiffusion featuresFoundation visual encoderAction decoder

标签

World Action ModelsRepresentation AlignmentRobot ManipulationVideo GenerationAction DecoderCausal InterventionCVAI