INTACT:面向无搜索世界模型的同构意图到动作学习
TLDR
INTACT学习端到端同构意图到动作映射,实现无搜索世界模型,在LeWM任务上取得高成功率。
评分理由
Strengths include a novel isomorphic architecture that eliminates test-time search and strong empirical results on LeWM benchmarks. Weaknesses are the lack of real-world application and limited discussion of limitations.
Read-first 评分解释
综合优先阅读分 37.9,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 35。
研究版图角色
前沿论文
排序敏感性
稳定性:volatile;排名波动范围:179。
关键词评分
深度分析
创新点
- 无搜索意图到动作接口:INTACT直接映射意图到动作,无需测试时搜索,使用分布性动作律的条件均值作为策略。
- 同构架构:通过四槽语法和共享参数,使局部和目标运动意图处理在结构上完全相同,并通过同一预测器诱导动作律语义。
- 非对称端点梯度:将物理后继作为基础,锚定未来目标,无需逐点潜在匹配或全局线性动力学即可统一表示学习与控制。
- 完整无损转移:从RGB证据到动作有效潜在意图坐标,以及从意图族到对应动作律族的完整转移。
- 单轮零搜索训练在LeWM任务上取得高成功率,可选局部CEM大幅减少候选采样同时优于纯CEM。
方法
INTACT是一种端到端JEPA,从带有动作标签、无奖励的轨迹中学习。它使用具有共享参数的四槽语法同构地处理局部和目标运动意图,并通过非对称端点梯度将物理后继作为基础、将未来目标固定为锚点。模型产生分布性动作律,条件均值直接用作无搜索策略,同时保留采样以实现多样性或验证。
关键结果
在四个官方LeWM任务上,单轮零搜索INTACT模型分别达到85.78%、100.00%、97.67%和97.89%的成功率。基于Direct计划的可选局部CEM使用384个候选序列(较9,000个减少23.44倍)达到96.86%的宏平均成功率,比纯CEM提升16.00个百分点。共享四任务编码器达到89.39%的E5 Direct宏平均,且预测-专家动作族kNN与Direct成功率的相关系数为r=0.954。Direct推理时间为2.9–5.5毫秒。
技术栈
JEPAkNNCEM