Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

学习用于规划的不变视觉表示:基于联合嵌入预测世界模型

arXiv 26.2 2026 60.5 method

TLDR

通过添加双模拟编码器忽略慢特征,提升潜在预测世界模型鲁棒性,在含干扰物的导航任务中验证。

评分理由

The paper identifies a real limitation of JEPA models and proposes a principled solution using bisimulation. However, evaluation is limited to a simple navigation task with synthetic distractors, lacking real-world or complex benchmarks.

Read-first 评分解释

综合优先阅读分 60.5,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 38。

近期性 8%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

方法质量 25%
80

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基线、基准、评估

主题相关性 42%
54.3

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

可复现性 25%
38

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:代码

研究版图角色

前沿论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:337。

关键词评分

world model
9
world dynamics prediction
8
model-based reinforcement learning world model
7
interactive world model
5
video world model
4
generative world model
3
world simulator
2

深度分析

创新点

  • 在联合嵌入预测世界模型的预测目标中增加双模拟编码器,以强制执行与控制相关的状态等价性
  • 将潜在空间大小相比DINO-WM缩小最多10倍,同时保持对慢特征的鲁棒性
  • 证明对预训练视觉编码器(DINOv2、SimDINOv2、iBOT)的选择具有无关性

方法

该模型扩展了联合嵌入预测架构(JEPA),通过引入一个双模拟编码器,将具有相似转移动态的状态映射到邻近的潜在表示,从而抑制背景变化和干扰物等慢特征。在测试时背景变化和视觉干扰物下的简单导航任务上进行了评估,并与DINO-WM基线进行了比较。

关键结果

在所有基准测试中,所提出的模型在潜在空间比DINO-WM小10倍的情况下,持续提高了对慢特征的鲁棒性。

局限性

  • 评估仅限于简单的导航任务,尚未验证在更复杂环境中的泛化能力
  • 摘要未讨论双模拟编码器的潜在失败案例或对超参数的敏感性
  • 鲁棒性仅针对特定类型的背景变化和干扰物进行了测试,未探索更广泛或更极端的变化

标签