Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

INTACT:面向无搜索世界模型的同构意图到动作学习

arXiv 2026 37.9 method

TLDR

INTACT学习端到端同构意图到动作映射,实现无搜索世界模型,在LeWM任务上取得高成功率。

评分理由

Strengths include a novel isomorphic architecture that eliminates test-time search and strong empirical results on LeWM benchmarks. Weaknesses are the lack of real-world application and limited discussion of limitations.

Read-first 评分解释

综合优先阅读分 37.9,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 35。

近期性 6%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

方法质量 18%
60

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:指标、结果

主题相关性 29%
50

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

可复现性 18%
38

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:代码

引用影响力 18%
0

使用 OpenAlex 形态的引用元数据作为文献关注度信号,并与论文本身质量分开处理。 引用数:0

引用速度 12%
0

引用速度按发表年限估算年均引用,降低旧论文天然占优的偏差。 年均引用:0.00

研究版图角色

前沿论文

排序敏感性

稳定性:volatile;排名波动范围:179。

关键词评分

world model
9
world dynamics prediction
8
interactive world model
6
model-based reinforcement learning world model
5
generative world model
4
world simulator
2
video world model
1

深度分析

创新点

  • 无搜索意图到动作接口:INTACT直接映射意图到动作,无需测试时搜索,使用分布性动作律的条件均值作为策略。
  • 同构架构:通过四槽语法和共享参数,使局部和目标运动意图处理在结构上完全相同,并通过同一预测器诱导动作律语义。
  • 非对称端点梯度:将物理后继作为基础,锚定未来目标,无需逐点潜在匹配或全局线性动力学即可统一表示学习与控制。
  • 完整无损转移:从RGB证据到动作有效潜在意图坐标,以及从意图族到对应动作律族的完整转移。
  • 单轮零搜索训练在LeWM任务上取得高成功率,可选局部CEM大幅减少候选采样同时优于纯CEM。

方法

INTACT是一种端到端JEPA,从带有动作标签、无奖励的轨迹中学习。它使用具有共享参数的四槽语法同构地处理局部和目标运动意图,并通过非对称端点梯度将物理后继作为基础、将未来目标固定为锚点。模型产生分布性动作律,条件均值直接用作无搜索策略,同时保留采样以实现多样性或验证。

关键结果

在四个官方LeWM任务上,单轮零搜索INTACT模型分别达到85.78%、100.00%、97.67%和97.89%的成功率。基于Direct计划的可选局部CEM使用384个候选序列(较9,000个减少23.44倍)达到96.86%的宏平均成功率,比纯CEM提升16.00个百分点。共享四任务编码器达到89.39%的E5 Direct宏平均,且预测-专家动作族kNN与Direct成功率的相关系数为r=0.954。Direct推理时间为2.9–5.5毫秒。

技术栈

JEPAkNNCEM

标签