将预见转化为行动:世界动作模型中表示对齐的重新利用
TLDR
提出AGRA,将视频扩散特征与语义表示对齐,提升世界动作模型中的动作基础,用于机器人操作。
评分理由
The paper identifies a key representation mismatch in World Action Models and provides a novel alignment objective (AGRA) with empirical validation on real-world tasks. Strengths include clear problem diagnosis and practical improvement; weakness is limited scope to manipulation tasks without broader RL or simulator evaluation.
Read-first 评分解释
综合优先阅读分 62.3,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 41。
研究版图角色
基础论文前沿论文桥接论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:411。
关键词评分
深度分析
创新点
- 发现世界动作模型中的表示不匹配:为视觉重建优化的隐藏状态并未天然组织成适用于低级动作控制的形式
- 提出AGRA(动作基础表示对齐)目标,将中间视频扩散特征与来自基础视觉编码器的空间一致语义表示对齐
- 证明AGRA提升了物体定位精度、功能理解能力以及对任务无关区域扰动的鲁棒性,从而改善了分布内性能和分布外泛化
方法
本文使用世界动作模型(WAMs),该模型利用视频生成模型在生成控制动作之前建模未来场景演化。通过动作头注意力分析和因果干预诊断失败原因,揭示了表示不匹配。提出AGRA,一种动作基础表示对齐目标,通过将中间视频扩散特征与来自基础视觉编码器的空间一致语义表示对齐来正则化世界-动作接口。在真实世界操作任务上进行评估。
关键结果
AGRA在基线世界动作模型基础上持续提升了分布内性能和分布外泛化,具体改善了物体定位精度和功能理解,并使策略对任务无关区域的扰动更加鲁棒。
技术栈
Video generation modelsDiffusion featuresFoundation visual encoderAction decoder