Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

TraceGen:三维轨迹空间中的世界建模实现跨具身视频学习

arXiv 25.11 2025 57.9 method

TLDR

TraceGen在三维轨迹空间中从跨具身视频学习世界模型,实现少样本机器人任务学习与快速推理。

评分理由

Strengths include a novel symbolic representation, large-scale pretraining, and strong few-shot real-world results. Weaknesses: limited detail on task diversity and potential limitations of trace-space abstraction.

Read-first 评分解释

综合优先阅读分 57.9,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 39。

近期性 8%
86.7

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2025

方法质量 25%
80

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:评估、指标、结果

主题相关性 42%
55.7

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

可复现性 25%
30

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:无

研究版图角色

前沿论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:240。

关键词评分

world model
10
world dynamics prediction
8
generative world model
7
model-based reinforcement learning world model
5
world simulator
4
video world model
3
interactive world model
2

深度分析

创新点

  • 引入了一种紧凑的三维“轨迹空间”表示,统一了跨具身、环境和任务的场景级轨迹。
  • TraceGen,一个在轨迹空间而非像素空间中预测未来运动的世界模型,抽象了外观,同时保留了操作所需的几何结构。
  • TraceForge,一个将异构的人类和机器人视频转换为一致的三维轨迹的数据管道,生成了包含12.3万段视频和180万个观测-轨迹-语言三元组的大规模语料库。

方法

TraceGen是一个世界模型,通过TraceForge管道将跨具身视频转换为统一的三维轨迹空间,并在该大规模语料库上进行训练。模型在这种符号表示中预测未来运动,抽象了视觉外观,同时保留了几何结构。训练使用了12.3万段视频和180万个观测-轨迹-语言三元组,得到的运动先验仅需五个演示即可适应目标任务。

关键结果

使用五个目标机器人视频,TraceGen在四个任务上达到80%的成功率,推理速度比最先进的基于视频的世界模型快50-600倍。仅使用手持手机拍摄的五段未标定的人类演示视频,它在真实机器人上达到67.5%的成功率。

局限性

  • 使用人类视频时成功率从80%降至67.5%,表明仍存在具身差距。
  • 该方法依赖于从视频中准确提取三维轨迹,可能对重建质量敏感。
  • 评估仅限于四个任务,未展示对更复杂或多样化任务的泛化能力。
  • 每个任务需要五个演示,仍属于小样本设置,而非零样本。
  • 轨迹空间表示可能丢失某些操作任务中有用的细粒度外观线索。

标签