Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

WMNav:将视觉-语言模型融入世界模型以实现目标物体导航

arXiv 25.3 2025 65.3 method

TLDR

WMNav将VLM融入世界模型进行目标物体导航,预测未来状态并使用好奇心价值图提升成功率和探索效率。

评分理由

The paper presents a novel framework combining VLMs with world models for navigation, with strong empirical results on standard benchmarks (HM3D, MP3D). However, the abstract lacks detailed discussion of limitations and does not explicitly address several keyword concepts like generative or interactive world models.

Read-first 评分解释

综合优先阅读分 65.3,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 30。

近期性 8%
86.7

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2025

可复现性 25%
81

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:有;数据:无;命中信号:数据集、GitHub

方法质量 25%
80

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基准、数据集、评估

主题相关性 42%
42.9

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

研究版图角色

前沿论文方法锚点复现锚点

排序敏感性

稳定性:volatile;排名波动范围:501。

关键词评分

world model
10
world dynamics prediction
7
model-based reinforcement learning world model
6
interactive world model
3
world simulator
2
generative world model
1
video world model
1

深度分析

创新点

  • 使用视觉-语言模型(VLM)进行目标物体导航的完全模块化世界模型设计,通过预测未来状态减少危险交互。
  • 在线维护的好奇心价值图作为世界模型记忆的一部分,为导航策略提供动态配置。
  • 类人思维过程,通过基于世界模型计划与观察之间的反馈差异做出决策,缓解模型幻觉。
  • 两阶段动作提议策略:先广泛探索,后精确定位,以提高效率。

方法

WMNav将视觉-语言模型融入世界模型框架进行目标物体导航。它使用在线维护的好奇心价值图作为记忆,并采用两阶段动作提议策略(先广泛探索后精确定位)。系统预测未来状态,并利用世界模型计划与观察之间的反馈差异来减少幻觉。在HM3D和MP3D数据集上进行评估,与零样本基准比较,使用成功率(SR)和SPL。

关键结果

WMNav超越了现有的零样本基准,在HM3D上实现了SR +3.2%和SPL +3.2%的绝对提升,在MP3D上实现了SR +13.5%和SPL +1.1%的绝对提升。

局限性

  • 模型幻觉得到缓解但未完全消除;该框架仍依赖反馈差异机制来减轻其影响。
  • 评估仅限于HM3D和MP3D数据集;未展示对其他环境的泛化能力。
  • 框架对VLM推理的依赖可能引入计算开销,尽管摘要中未明确量化。

标签