Demo-JEPA:面向单次跨本体模仿的联合嵌入预测架构
TLDR
Demo-JEPA利用基于JEPA的世界模型,通过预测视觉演示的未来潜在轨迹,实现一次性跨本体模仿。
评分理由
The paper presents a novel framework that decouples demonstration intent from embodiment-specific actions, leveraging a world model for latent trajectory prediction. Strengths include strong empirical results on both simulated and real-world tasks, while weaknesses may include limited discussion of failure cases or scalability to more complex embodiments.
Read-first 评分解释
综合优先阅读分 46.4,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 29。
研究版图角色
基础论文前沿论文桥接论文
排序敏感性
稳定性:volatile;排名波动范围:310。
关键词评分
深度分析
创新点
- 将演示意图与具身特定执行解耦
- 使用基于JEPA的世界模型将源视觉演示转换为与目标兼容的未来潜在轨迹
- 避免动作级别的对应,仅需视觉演示和目标智能体自身的交互经验
- 单次跨具身模仿
方法
Demo-JEPA基于JEPA世界模型构建。它将源视觉演示转换为共享预测表示空间中与目标兼容的未来潜在轨迹。然后,目标智能体将这些潜在轨迹作为子目标,通过在其自身学习的前向动力学下进行规划来实现它们,仅需视觉演示和目标智能体自身的交互经验。
关键结果
在RLBench和真实世界操作任务上的实验表明,Demo-JEPA与专门领域内规划器性能相当,并能泛化到先前方法失败的未见任务和具身配置上。