Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

统一世界模型:耦合视频与动作扩散用于大规模机器人数据集预训练

arXiv 25.4 2025 79.3 method

TLDR

UWM在统一Transformer中耦合视频与动作扩散,用于大规模机器人数据集预训练,实现策略与动力学学习。

评分理由

The paper presents a novel framework that integrates video and action diffusion, demonstrating strong empirical results on both simulated and real-world tasks. Its strengths include leveraging action-free video data and achieving better generalization than imitation learning; a weakness is that the abstract does not detail limitations or comparisons to other world model approaches.

Read-first 评分解释

综合优先阅读分 79.3,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 56。

近期性 8%
86.7

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2025

可复现性 25%
85

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:有;数据:无;命中信号:代码、数据集、GitHub

主题相关性 42%
80

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

方法质量 25%
70

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:数据集、实验、结果

研究版图角色

前沿论文方法锚点复现锚点

排序敏感性

稳定性:volatile;排名波动范围:4。

关键词评分

world model
10
generative world model
9
video world model
9
interactive world model
8
world dynamics prediction
8
world simulator
7
model-based reinforcement learning world model
5

深度分析

创新点

  • 统一框架,在单个Transformer架构中耦合视频和动作扩散,每种模态具有独立的扩散时间步
  • 通过控制模态特定的扩散时间步,灵活表示策略、前向动力学、逆动力学和视频生成器
  • 在大规模多任务机器人数据集上利用动力学和动作预测进行有效预训练,产生比模仿学习更具泛化性和鲁棒性的策略
  • 通过独立控制模态特定的扩散时间步,从无动作视频数据中学习,提升微调策略性能

方法

统一世界模型(UWM)在一个统一的Transformer架构中集成了动作扩散过程和视频扩散过程,其中独立的扩散时间步控制每种模态。通过控制每个扩散时间步,UWM可以灵活地表示策略、前向动力学、逆动力学或视频生成器。该模型在大规模多任务机器人数据集上进行预训练,同时进行动力学和动作预测,并且可以通过独立的时间步控制利用无动作视频数据。

关键结果

UWM能够在大规模多任务机器人数据集上进行有效预训练,产生比模仿学习更具泛化性和鲁棒性的策略。此外,它通过独立控制模态特定的扩散时间步,促进了从无动作视频数据中学习,进一步提升了微调策略的性能。

标签