Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

三思而后行:受世界模型启发的自动驾驶多模态定位

arXiv 25.12 2025 39.1 method, application

TLDR

受世界模型启发的自动驾驶视觉定位框架,通过推理未来空间状态消除自然语言指令歧义。

评分理由

The paper introduces a novel integration of world model principles for spatial reasoning in autonomous driving, supported by strong empirical results across multiple benchmarks and a new dataset. However, the abstract lacks discussion of limitations and the world model is narrowly applied to grounding rather than general simulation.

Read-first 评分解释

综合优先阅读分 39.1,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 28。

近期性 6%
86.7

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2025

方法质量 18%
80

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基线、基准、数据集、评估

可复现性 18%
46

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:代码、数据集

主题相关性 29%
40

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

引用影响力 18%
0

使用 OpenAlex 形态的引用元数据作为文献关注度信号,并与论文本身质量分开处理。 引用数:0

引用速度 12%
0

引用速度按发表年限估算年均引用,降低旧论文天然占优的偏差。 年均引用:0.00

研究版图角色

前沿论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:378。

关键词评分

world model
10
world dynamics prediction
7
generative world model
5
world simulator
3
interactive world model
2
video world model
1
model-based reinforcement learning world model
0

深度分析

创新点

  • 受世界模型启发,在做出定位决策前先推理未来空间状态
  • 空间感知世界模型(SA-WM),将场景提炼为指令感知的潜在状态并展开未来潜在状态
  • 超图引导的解码器,层次化融合潜在状态与多模态输入以捕获高阶空间依赖关系
  • DrivePilot数据集,其语义标注由检索增强生成(RAG)和思维链(CoT)提示的大语言模型流水线生成

方法

ThinkDeeper使用空间感知世界模型(SA-WM),将当前场景提炼为指令感知的潜在状态,并展开一系列未来潜在状态。然后,超图引导的解码器将这些状态与多模态输入进行层次化融合,以捕获高阶空间依赖关系,实现鲁棒定位。该模型在六个基准上进行了评估,包括Talk2Car、DrivePilot、MoCAD和RefCOCO/+/g。

关键结果

ThinkDeeper在Talk2Car排行榜上排名第一,并在DrivePilot、MoCAD和RefCOCO/+/g基准上超越了最先进的基线方法。它在具有挑战性的场景(长文本、多智能体、模糊性)中表现出强大的鲁棒性和效率,即使在仅使用50%数据训练时仍能保持优越性能。

标签