TraceGen:三维轨迹空间中的世界建模实现跨具身视频学习
TLDR
TraceGen在三维轨迹空间中从跨具身视频学习世界模型,实现少样本机器人任务学习与快速推理。
评分理由
Strengths include a novel symbolic representation, large-scale pretraining, and strong few-shot real-world results. Weaknesses: limited detail on task diversity and potential limitations of trace-space abstraction.
Read-first 评分解释
综合优先阅读分 57.9,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 39。
研究版图角色
前沿论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:240。
关键词评分
深度分析
创新点
- 引入了一种紧凑的三维“轨迹空间”表示,统一了跨具身、环境和任务的场景级轨迹。
- TraceGen,一个在轨迹空间而非像素空间中预测未来运动的世界模型,抽象了外观,同时保留了操作所需的几何结构。
- TraceForge,一个将异构的人类和机器人视频转换为一致的三维轨迹的数据管道,生成了包含12.3万段视频和180万个观测-轨迹-语言三元组的大规模语料库。
方法
TraceGen是一个世界模型,通过TraceForge管道将跨具身视频转换为统一的三维轨迹空间,并在该大规模语料库上进行训练。模型在这种符号表示中预测未来运动,抽象了视觉外观,同时保留了几何结构。训练使用了12.3万段视频和180万个观测-轨迹-语言三元组,得到的运动先验仅需五个演示即可适应目标任务。
关键结果
使用五个目标机器人视频,TraceGen在四个任务上达到80%的成功率,推理速度比最先进的基于视频的世界模型快50-600倍。仅使用手持手机拍摄的五段未标定的人类演示视频,它在真实机器人上达到67.5%的成功率。
局限性
- 使用人类视频时成功率从80%降至67.5%,表明仍存在具身差距。
- 该方法依赖于从视频中准确提取三维轨迹,可能对重建质量敏感。
- 评估仅限于四个任务,未展示对更复杂或多样化任务的泛化能力。
- 每个任务需要五个演示,仍属于小样本设置,而非零样本。
- 轨迹空间表示可能丢失某些操作任务中有用的细粒度外观线索。