通过分离前向和逆向动力学预训练实现解耦的机器人学习
TLDR
DeFI解耦前向与逆向动力学预训练,分别用于视频预测和潜在动作推断,在基准和真实任务上达到最优。
评分理由
The paper presents a novel framework that separates visual forward dynamics (video prediction) and inverse dynamics (action inference) to leverage action-free videos, showing strong empirical results. However, the abstract does not detail limitations or comparisons to other world model approaches, and the term 'world model' is not explicitly used.
Read-first 评分解释
综合优先阅读分 39,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 41。
研究版图角色
前沿论文
排序敏感性
稳定性:volatile;排名波动范围:245。
关键词评分
深度分析
创新点
- 解耦前向(视频生成)和逆向(动作预测)动力学预训练,以利用无动作网络视频
- 通用前向动力学模型(GFDM)在多样人类和机器人视频上预训练以进行未来预测
- 通用逆向动力学模型(GIDM)通过自监督学习从未标注视频转换中推断潜在动作
- 将GFDM和GIDM集成到统一架构中,用于下游任务的端到端微调
方法
DeFI预训练两个独立模型:GFDM用于前向动力学(视频生成),基于人类和机器人视频;GIDM用于逆向动力学(潜在动作推断),使用自监督学习未标注视频转换。预训练模型随后集成到统一架构中,并在下游机器人任务上进行端到端微调。
关键结果
DeFI在CALVIN ABC-D上平均任务长度为4.51,在SimplerEnv-Fractal上成功率为51.2%,真实世界部署成功率为81.3%,显著优于先前方法。