Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

在Veo世界模拟器中评估Gemini Robotics策略

arXiv 25.12 2025 65.1 system, application

TLDR

使用前沿视频模型Veo作为生成式世界模拟器,全面评估机器人策略(常规、分布外、安全场景)。

评分理由

Strengths: novel comprehensive evaluation framework using video models, enabling OOD and safety testing. Weaknesses: limited to one video model, and evaluation is simulated rather than real-world; abstract lacks details on quantitative results.

Read-first 评分解释

综合优先阅读分 65.1,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 56。

近期性 8%
86.7

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2025

主题相关性 42%
80

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

方法质量 25%
60

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:评估

可复现性 25%
38

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:检查点

研究版图角色

前沿论文

排序敏感性

稳定性:volatile;排名波动范围:295。

关键词评分

world model
9
world simulator
9
generative world model
9
video world model
9
interactive world model
8
world dynamics prediction
7
model-based reinforcement learning world model
5

深度分析

创新点

  • 使用视频模型进行策略评估的全谱系:常规性能、分布外泛化以及物理/语义安全探测。
  • 基于前沿视频基础模型Veo构建的生成式评估系统,针对机器人动作条件化和多视图一致性进行了优化。
  • 集成生成式图像编辑和多视图补全,沿多个泛化轴合成逼真的场景变化。
  • 证明该系统能够预测策略的相对性能,确定泛化轴的影响,并进行红队测试以发现安全违规行为。

方法

该系统基于前沿视频基础模型Veo构建,针对机器人动作条件化和多视图一致性进行了优化。它集成了生成式图像编辑和多视图补全,以合成真实世界场景的逼真变化。该系统通过1600多次真实世界评估进行了验证,涉及双机械臂操作器的八个Gemini Robotics策略检查点和五个任务。

关键结果

该系统保留了基础视频模型的能力,能够准确模拟编辑后的场景,从而能够准确预测常规和分布外条件下策略的相对性能,确定泛化轴的影响,并进行红队测试以发现安全违规行为。

局限性

  • 系统的性能取决于底层Veo视频模型的能力。
  • 评估仅限于八个策略检查点和双机械臂操作器的五个任务。

标签