Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

$\mu_0$: 一种可扩展的3D交互轨迹世界模型

arXiv 2026 61.1 method, system

TLDR

μ0从视频预测3D交互轨迹,无需动作标签实现可扩展机器人学习。

评分理由

该论文提出了一种新颖的世界模型:它预测3D轨迹而不是像素或动作,从而提供了一种紧凑且不依赖具体具身形态的表示。其优势在于可以通过自动轨迹提取,从多样化视频源扩展训练;但由于只关注显著交互点,可能会遗漏细粒度动态。

Read-first 评分解释

综合优先阅读分 61.1,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 46。

近期性 6%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

引用影响力 18%
93.3

使用 OpenAlex 形态的引用元数据作为文献关注度信号,并与论文本身质量分开处理。 归一化引用分位:0.93310138

方法质量 18%
80

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基线、评估、实验、结果

主题相关性 29%
65.7

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

可复现性 18%
30

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:无

引用速度 12%
0

引用速度按发表年限估算年均引用,降低旧论文天然占优的偏差。 年均引用:0.00

研究版图角色

基础论文前沿论文桥接论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:430。

关键词评分

world model
10
interactive world model
8
world dynamics prediction
8
generative world model
7
world simulator
6
model-based reinforcement learning world model
5
video world model
2

深度分析

创新点

  • 3D交互轨迹世界模型,预测显著交互点的平滑3D轨迹,而非密集像素或具身特定动作
  • TraceExtract系统,通过关键点选择、全局对齐轨迹和分层语言描述自动从多样视频源提取3D监督
  • 使用B样条控制点表示和预测未来轨迹的模块化轨迹专家
  • 具身无关的运动接口,无需动作标签即可实现跨具身迁移
  • 无动作预训练,性能与使用动作监督的VLA模型(如π0)竞争

方法

μ0结合预训练的视觉-语言骨干网络与模块化轨迹专家,该专家通过B样条控制点表示每个查询并预测未来3D轨迹。训练数据由TraceExtract系统生成,该系统自动从多样视频源选择关键点、构建全局对齐轨迹,并将运动片段与分层语言描述关联。评估包括对基线的2D和3D轨迹预测,以及下游轨迹条件策略在机器人具身上的性能。

关键结果

μ0在2D和3D轨迹预测上均优于基线,包括轨迹预测模型和分词化VLM方法。尽管是无动作预训练,轨迹条件策略的性能与使用动作监督预训练的VLA模型(如π0)竞争。

标签

world model3D tracesrobot learningembodiment-agnosticvideo predictioninteraction pointsROCV