$\mu_0$: 一种可扩展的3D交互轨迹世界模型
TLDR
μ0从视频预测3D交互轨迹,无需动作标签实现可扩展机器人学习。
评分理由
该论文提出了一种新颖的世界模型:它预测3D轨迹而不是像素或动作,从而提供了一种紧凑且不依赖具体具身形态的表示。其优势在于可以通过自动轨迹提取,从多样化视频源扩展训练;但由于只关注显著交互点,可能会遗漏细粒度动态。
Read-first 评分解释
综合优先阅读分 61.1,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 46。
研究版图角色
基础论文前沿论文桥接论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:430。
关键词评分
深度分析
创新点
- 3D交互轨迹世界模型,预测显著交互点的平滑3D轨迹,而非密集像素或具身特定动作
- TraceExtract系统,通过关键点选择、全局对齐轨迹和分层语言描述自动从多样视频源提取3D监督
- 使用B样条控制点表示和预测未来轨迹的模块化轨迹专家
- 具身无关的运动接口,无需动作标签即可实现跨具身迁移
- 无动作预训练,性能与使用动作监督的VLA模型(如π0)竞争
方法
μ0结合预训练的视觉-语言骨干网络与模块化轨迹专家,该专家通过B样条控制点表示每个查询并预测未来3D轨迹。训练数据由TraceExtract系统生成,该系统自动从多样视频源选择关键点、构建全局对齐轨迹,并将运动片段与分层语言描述关联。评估包括对基线的2D和3D轨迹预测,以及下游轨迹条件策略在机器人具身上的性能。
关键结果
μ0在2D和3D轨迹预测上均优于基线,包括轨迹预测模型和分词化VLM方法。尽管是无动作预训练,轨迹条件策略的性能与使用动作监督预训练的VLA模型(如π0)竞争。