Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

GigaBrain-0: 一种基于世界模型的视觉-语言-动作模型

arXiv 25.10 2025 66.6 method, application

TLDR

GigaBrain-0利用世界模型生成的数据训练VLA机器人,减少真实数据需求并提升泛化能力。

评分理由

The paper presents a novel approach leveraging world models for data generation, which reduces reliance on expensive real-world data and shows strong generalization in real-world tasks. However, the abstract lacks details on the world model architecture and potential limitations of synthetic data.

Read-first 评分解释

综合优先阅读分 66.6,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 51。

近期性 8%
86.7

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2025

主题相关性 42%
72.9

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

方法质量 25%
70

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基线、实验

可复现性 25%
46

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:工件、GitHub

研究版图角色

前沿论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:115。

关键词评分

world model
10
generative world model
9
world simulator
8
video world model
8
world dynamics prediction
7
interactive world model
5
model-based reinforcement learning world model
4

深度分析

创新点

  • 利用世界模型生成的数据(视频生成、real2real迁移、人类迁移、视角迁移、sim2real迁移)训练VLA模型,减少对真实机器人数据的依赖。
  • 引入RGBD输入建模和具身思维链(CoT)监督,用于空间推理和长程任务执行。
  • 提出GigaBrain-0-Small,一种针对NVIDIA Jetson AGX Orin等边缘设备优化的轻量级变体。

方法

GigaBrain-0是一种视觉-语言-动作(VLA)基础模型,训练数据由世界模型生成,包括视频生成、real2real、人类迁移、视角迁移和sim2real迁移。模型使用RGBD输入和具身思维链监督来推理空间几何、物体状态和长程依赖关系。在实际的灵巧操作、长程操作和移动操作任务上进行了评估,通过与先前VLA系统的比较隐含了基线。

关键结果

GigaBrain-0在外观(纹理、颜色)、物体放置和相机视角的变化下实现了优越的泛化能力,在灵巧操作、长程操作和移动操作任务上取得了显著的现实世界性能提升。

局限性

  • 依赖世界模型生成的数据可能引入领域差距或伪影,影响现实世界迁移。
  • 该方法仍需要一些真实机器人数据(尽管显著减少),且世界模型生成所有任务变体的可扩展性尚未完全解决。
  • 轻量级变体GigaBrain-0-Small相比完整模型可能容量或性能有所降低。

技术栈

world modelsvideo generationreal2real transferhuman transferview transfersim2real transferRGBDChain-of-Thought (CoT)NVIDIA Jetson AGX Orin

标签