DeepSight: 通过潜在状态预测实现长时域世界建模的端到端自动驾驶
TLDR
提出驾驶世界模型,预测潜在BEV特征以进行长时域未来状态建模,在Bench2drive上达到SOTA。
评分理由
The paper introduces a novel approach for long-horizon world modeling in autonomous driving by predicting latent semantic features in BEV space, which is a clear strength. However, the evaluation is limited to a single closed-loop benchmark (Bench2drive) and lacks real-world driving tests, and the method's reliance on BEV space may limit generalizability.
Read-first 评分解释
综合优先阅读分 55.8,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 28。
研究版图角色
基础论文前沿论文桥接论文复现锚点
排序敏感性
稳定性:volatile;排名波动范围:474。
关键词评分
深度分析
创新点
- 在鸟瞰图(BEV)空间中并行预测连续未来帧的潜在语义特征,以实现长时域世界建模
- 一种高效且自适应的文本推理机制,利用社会知识和推理能力提升长尾场景下的驾驶性能
方法
本文提出了一种驾驶世界模型,该模型在BEV空间中并行预测连续未来帧的潜在语义特征,从而实现对未来世界状态的长时域建模。同时引入了一种高效且自适应的文本推理机制,利用额外的社会知识和推理能力。该方法在闭环Bench2drive基准上进行了评估,取得了最先进的结果。
关键结果
所提出的方法在闭环Bench2drive基准上取得了最先进的结果。
技术栈
VLMBEVBench2drive