World4Drive:基于意图感知的物理潜在世界模型的端到端自动驾驶
TLDR
World4Drive利用视觉基础模型构建潜在世界模型,实现无需感知标注的端到端自动驾驶规划。
评分理由
The paper presents a novel framework that leverages vision foundation models to create a latent world model, enabling self-supervised planning without manual perception annotations. Strengths include state-of-the-art results on both open-loop and closed-loop benchmarks, while weaknesses are not explicitly discussed in the abstract, and reliance on simulated closed-loop evaluation may limit real-world generalization claims.
Read-first 评分解释
综合优先阅读分 60.4,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 49。
研究版图角色
排序敏感性
稳定性:volatile;排名波动范围:312。
关键词评分
深度分析
创新点
- 利用视觉基础模型构建潜在世界模型的无感知标注端到端自动驾驶框架
- 生成并评估多模态规划轨迹的意图感知物理潜在世界模型
- 基于预测未来状态评估和选择最佳轨迹的世界模型选择模块
方法
World4Drive首先提取场景特征,包括驾驶意图和由视觉基础模型提供的富含空间语义先验的世界潜在表示。然后,它基于当前场景特征和驾驶意图生成多模态规划轨迹,并在潜在空间中预测多个意图驱动的未来状态。最后,它引入了一个世界模型选择模块来评估和选择最佳轨迹。该框架通过自监督对齐实际未来观测与从潜在空间重建的预测观测,实现了无需感知标注的端到端规划。
关键结果
World4Drive在开环nuScenes和闭环NavSim基准测试上均取得了最先进的性能,无需手动感知标注,L2误差相对降低18.1%,碰撞率降低46.7%,训练收敛速度提升3.75倍。