时间距离JEPA:面向潜在世界模型预测控制的规划感知表示学习
TLDR
提出TD-JEPA,从无奖励轨迹中挖掘时间距离成本,以改进JEPA的潜在世界模型预测控制。
评分理由
Strengths include a novel method for mining temporal cost from offline logs, improving planning and representation, with strong empirical results on multiple benchmarks. Weaknesses: limited to specific environments, no explicit discussion of limitations or generalization.
Read-first 评分解释
综合优先阅读分 45.6,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 40。
研究版图角色
前沿论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:572。
关键词评分
深度分析
创新点
- 从无奖励轨迹中挖掘有向时间成本,使用同轨迹步序作为正样本、跨轨迹对作为启发式负样本,并加入匹配规划器范围的展开一致性项。
- 协同设计学习成本与规划时部署:挖掘的时间距离在进展为拓扑性质时作为规划成本,在接触几何占主导时作为改进潜在欧几里得规划的表示信号。
- 通过从离线日志中注入时间进展结构,缩小JEPA世界模型规划器的训练-规划差距,无需奖励信号。
方法
TD-JEPA保留LeWM编码器-预测器骨干,并从无奖励离线轨迹中挖掘有向时间成本。同轨迹步序提供正样本,跨轨迹对作为启发式负样本,展开一致性项使预测与规划器范围对齐。挖掘的成本要么直接作为规划成本(拓扑任务),要么作为改进欧几里得规划的表示信号(接触主导任务)。在锁定评估下与LeWM及同期RC-aux基线在Two-Room、OGB-Cube和Push-T上进行对比。
关键结果
在锁定评估下,TD-JEPA的挖掘成本将Two-Room成功率提升至100.0%(对比LeWM的97.4%),而同一时间训练检查点上的共享欧几里得规划在OGB-Cube上比LeWM提高14.2个百分点,并改善了Push-T;在每一个环境中均达到或超越两者。消融实验证实有向头、跨轨迹负样本和展开一致性均有贡献。
局限性
- 挖掘的时间距离成本仅在进展为拓扑性质时直接用作规划成本;在接触主导任务中,仍使用欧几里得规划,成本主要作为表示信号。
- 跨轨迹负样本是启发式的,可能限制所学时间成本的质量。
- 评估仅限于三个环境(Two-Room、OGB-Cube、Push-T)和锁定表示协议,可能无法反映完全微调或更广泛任务多样性下的性能。