Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

ChronoDreamer: 动作条件的世界模型作为机器人规划的在线模拟器

arXiv 25.12 2025 68.8 method

TLDR

ChronoDreamer是一个用于机器人操作的动作条件世界模型,使用时空Transformer预测未来视频和接触,并利用VLM进行安全规划。

评分理由

The paper introduces a novel contact representation via depth-weighted Gaussian splat images and integrates a vision-language model for collision-aware rejection sampling, which are strengths. However, it lacks real-world experiments and quantitative evaluation, relying solely on simulation and qualitative results.

Read-first 评分解释

综合优先阅读分 68.8,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 59。

近期性 8%
86.7

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2025

主题相关性 42%
84.3

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

方法质量 25%
60

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:数据集、结果

可复现性 25%
46

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:代码、数据集

研究版图角色

前沿论文

排序敏感性

稳定性:volatile;排名波动范围:215。

关键词评分

world model
10
world simulator
9
interactive world model
9
video world model
9
generative world model
8
world dynamics prediction
8
model-based reinforcement learning world model
6

深度分析

创新点

  • 用于接触丰富机器人操作的动作条件世界模型,利用自我中心RGB、接触图、动作和关节状态
  • 深度加权高斯溅射图像,将3D接触力编码为与视觉骨干兼容的相机对齐格式
  • 使用MaskGIT风格掩码预测训练的时空Transformer,用于联合预测视频、接触分布和关节角度
  • 基于LLM的评判器,通过评估预测展开的碰撞可能性对不安全动作进行拒绝采样

方法

ChronoDreamer使用一个通过MaskGIT风格掩码预测训练的时空Transformer,从自我中心RGB帧、接触图、动作和关节状态的历史中联合预测未来的视频帧、接触分布和关节角度。接触被编码为深度加权高斯溅射图像,将3D力渲染成相机对齐格式。在推理时,视觉语言模型评估预测展开的碰撞可能性,以对不安全动作进行拒绝采样。该模型在DreamerBench上进行训练和评估,DreamerBench是一个使用Project Chrono生成的仿真数据集,提供同步的RGB、接触溅射、本体感知和物理标注。

关键结果

定性结果表明,该模型在非接触运动期间保持空间一致性并生成合理的接触预测,而基于LLM的评判器有效区分碰撞与非碰撞轨迹。

标签