三思而后行:受世界模型启发的自动驾驶多模态定位
TLDR
受世界模型启发的自动驾驶视觉定位框架,通过推理未来空间状态消除自然语言指令歧义。
评分理由
The paper introduces a novel integration of world model principles for spatial reasoning in autonomous driving, supported by strong empirical results across multiple benchmarks and a new dataset. However, the abstract lacks discussion of limitations and the world model is narrowly applied to grounding rather than general simulation.
Read-first 评分解释
综合优先阅读分 39.1,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 28。
研究版图角色
排序敏感性
稳定性:volatile;排名波动范围:378。
关键词评分
深度分析
创新点
- 受世界模型启发,在做出定位决策前先推理未来空间状态
- 空间感知世界模型(SA-WM),将场景提炼为指令感知的潜在状态并展开未来潜在状态
- 超图引导的解码器,层次化融合潜在状态与多模态输入以捕获高阶空间依赖关系
- DrivePilot数据集,其语义标注由检索增强生成(RAG)和思维链(CoT)提示的大语言模型流水线生成
方法
ThinkDeeper使用空间感知世界模型(SA-WM),将当前场景提炼为指令感知的潜在状态,并展开一系列未来潜在状态。然后,超图引导的解码器将这些状态与多模态输入进行层次化融合,以捕获高阶空间依赖关系,实现鲁棒定位。该模型在六个基准上进行了评估,包括Talk2Car、DrivePilot、MoCAD和RefCOCO/+/g。
关键结果
ThinkDeeper在Talk2Car排行榜上排名第一,并在DrivePilot、MoCAD和RefCOCO/+/g基准上超越了最先进的基线方法。它在具有挑战性的场景(长文本、多智能体、模糊性)中表现出强大的鲁棒性和效率,即使在仅使用50%数据训练时仍能保持优越性能。