Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

小米机器人-U0:基于世界基础模型的统一具身合成

arXiv 2026 41.6 method, application

TLDR

一个380亿参数的多模态自回归模型,用于统一具身合成,在场景生成和视频任务上达到最先进水平。

评分理由

The paper presents a large-scale model that unifies several embodied generation tasks, showing strong empirical results on benchmarks and human evaluations. However, the abstract lacks details on architecture, training data, and ablation studies, making it difficult to assess the novelty and contributions fully.

Read-first 评分解释

综合优先阅读分 41.6,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 32。

近期性 6%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

方法质量 18%
80

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基准、评估、指标、结果

可复现性 18%
46

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:检查点、代码

主题相关性 29%
45.7

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

引用影响力 18%
0

使用 OpenAlex 形态的引用元数据作为文献关注度信号,并与论文本身质量分开处理。 引用数:0

引用速度 12%
0

引用速度按发表年限估算年均引用,降低旧论文天然占优的偏差。 年均引用:0.00

研究版图角色

前沿论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:461。

关键词评分

world model
8
generative world model
7
video world model
6
world simulator
5
interactive world model
3
world dynamics prediction
2
model-based reinforcement learning world model
1

深度分析

创新点

  • 统一具身合成框架,将具身生成视为基础图像和视频生成的扩展,联合优化文本到图像生成、图像编辑、具身场景生成、具身迁移和具身视频生成。
  • 首个支持跨多种机器人具身的高质量多视角场景生成的模型。
  • 结构化的、可控的具身迁移,能够进行细粒度编辑,同时保持多视角一致性和交互动态。
  • 在适配具身场景时保留了预训练世界基础模型的泛化能力,避免了通常牺牲视觉知识的问题。

方法

一个380亿参数的多模态自回归模型,将多个具身生成任务作为基础图像和视频生成的扩展进行联合优化。该方法在适配机器人数据时保留了预训练世界基础模型的泛化能力,避免了具身性能与大规模视觉知识之间的常见权衡。

关键结果

该模型在具身场景生成和迁移的人工评估中超越了GPT-Image-2.0,在World Arena基准上排名第一用于具身视频生成,并将pi_0.5在具有挑战性的真实世界操作任务上的分布外成功率从36.9%提升至63.2%。

标签