Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

EnerVerse:为机器人操作构想具身未来空间

AgiBot 2025 59.6 method, system, application

TLDR

EnerVerse是一个生成式机器人基础模型,利用视频扩散预测未来具身空间以进行操作,在仿真和真实任务中达到最先进水平。

评分理由

Strengths include a novel chunk-wise autoregressive video diffusion framework, multi-view representation for 3D grounding, and a data engine reducing sim-to-real gap. Weaknesses are limited detail on the policy head and scope of real-world evaluation.

Read-first 评分解释

综合优先阅读分 59.6,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 51。

近期性 8%
86.7

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2025

主题相关性 42%
72.9

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

方法质量 25%
50

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:数据集

可复现性 25%
38

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:数据集

研究版图角色

前沿论文

排序敏感性

稳定性:volatile;排名波动范围:375。

关键词评分

generative world model
9
video world model
9
world model
8
world dynamics prediction
8
world simulator
7
interactive world model
6
model-based reinforcement learning world model
4

深度分析

创新点

  • 分块自回归视频扩散框架,用于预测未来具身空间
  • 稀疏上下文记忆,用于长期推理
  • 多视角视频表示,以应对运动模糊和3D定位挑战
  • 结合生成式建模与4D高斯泼溅的数据引擎流水线,形成自我强化的数据循环
  • 策略头EnerVerse-A,重用第一个去噪步骤的特征并预测动作块

方法

EnerVerse采用分块自回归视频扩散框架,根据指令预测未来的具身空间,并通过稀疏上下文记忆增强长期推理。它采用多视角视频表示来建模3D机器人世界,并使用结合生成式建模与4D高斯泼溅的数据引擎(EnerVerse-D)以减少仿真到现实的差距。策略头(EnerVerse-A)通过重用第一个去噪步骤的特征并预测动作块,将4D世界表示转化为物理动作。

关键结果

EnerVerse在仿真和真实世界任务中均达到最先进性能,在单个RTX 4090上每个8步动作块约需280毫秒的效率。

标签