Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

Motus:统一潜在动作世界模型

arXiv 25.12 2025 57.6 method

TLDR

Motus通过MoT架构和光流统一理解、视频生成与动作,在仿真和真实任务中取得领先性能。

评分理由

The paper presents a novel unified architecture that integrates multiple modalities and modeling modes, with strong empirical results in both simulated and real-world settings. However, the abstract lacks detailed ablation studies and clarity on the limitations of the approach.

Read-first 评分解释

综合优先阅读分 57.6,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 51。

近期性 8%
86.7

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2025

主题相关性 42%
72.9

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

方法质量 25%
50

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:实验

可复现性 25%
30

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:无

研究版图角色

前沿论文

排序敏感性

稳定性:volatile;排名波动范围:446。

关键词评分

world model
10
generative world model
8
video world model
8
interactive world model
7
world dynamics prediction
7
world simulator
6
model-based reinforcement learning world model
5

深度分析

创新点

  • 统一潜在动作世界模型,将理解、视频生成和动作整合到单一系统中
  • 混合Transformer(MoT)架构,包含三个专家(理解、视频生成、动作)
  • UniDiffuser风格调度器,支持多种建模模式(世界模型、VLA、逆动力学、视频生成、视频-动作联合预测)之间的灵活切换
  • 利用光流学习潜在动作,提取像素级“增量动作”
  • 三阶段训练流程和六层数据金字塔,用于大规模动作预训练

方法

Motus采用混合Transformer(MoT)架构,包含三个专家(理解、视频生成、动作)和UniDiffuser风格调度器,以灵活切换建模模式。它利用光流学习潜在动作,并采用三阶段训练流程和六层数据金字塔,提取像素级“增量动作”以实现大规模动作预训练。

关键结果

Motus在仿真环境(相比X-VLA提升15%,相比Pi0.5提升45%)和真实场景(提升11%~48%)中均取得了优于现有最先进方法的性能,证明了所有功能和先验的统一建模显著有利于下游机器人任务。

技术栈

Mixture-of-Transformer (MoT)UniDiffuserOptical Flow

标签