Delta-JEPA: 通过潜在差异解码学习动作敏感的世界模型
TLDR
Delta-JEPA通过从潜在差异解码动作来学习动作敏感的世界模型,避免像素重建并改进连续控制中的规划。
评分理由
The paper introduces a novel method to prevent action-insensitive representations in world models by supervising latent displacements, which is simple and effective. However, it is only evaluated on simulated continuous-control tasks, lacking real-world validation.
Read-first 评分解释
综合优先阅读分 43,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。
研究版图角色
前沿论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:330。
关键词评分
深度分析
创新点
- 潜在差异动作解码器(LDAD),从连续观测之间的潜在位移重建动作,而非从拼接的端点嵌入重建。
- 位移级监督,正则化转移几何以防止表示坍缩,并鼓励动作可区分的潜在变化。
- 无重建的世界模型(Delta-JEPA),仅使用潜在预测和动作重建,避免像素重建和分布匹配正则化器。
方法
Delta-JEPA是一种端到端无重建的世界模型,结合了潜在前向预测和潜在差异动作解码器(LDAD),该解码器经过训练从连续观测之间的潜在位移重建动作。它仅使用潜在预测和动作重建损失进行训练,无需像素重建或分布匹配。该模型在四个视觉连续控制任务上,与基于JEPA和表示学习的基线世界模型进行了评估,并通过消融实验比较了基于位移与端点拼接的解码方式。
关键结果
Delta-JEPA在四个视觉连续控制任务上,相比基于JEPA和表示学习的基线世界模型改进了规划性能。基于位移的动作解码始终比端点拼接更有效,动作敏感性分析显示出更清晰的动作条件潜在响应。