Latent-WAM:面向端到端自动驾驶的潜在世界动作建模
TLDR
Latent-WAM利用空间感知和动态信息的潜在世界表示实现高效端到端自动驾驶,在NAVSIM v2和HUGSIM上达到最优。
评分理由
The paper introduces novel modules (SCWE and DLWM) that effectively address key limitations of prior world-model planners, with strong empirical results on two benchmarks using a compact model. However, the evaluation is limited to simulated environments, and real-world validation is absent.
Read-first 评分解释
综合优先阅读分 61.6,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 40。
研究版图角色
前沿论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:290。
关键词评分
深度分析
创新点
- 空间感知压缩世界编码器(SCWE),从基础模型中提取几何知识,并通过可学习查询将多视图图像压缩为紧凑的场景标记
- 动态潜在世界模型(DLWM),采用因果Transformer,基于历史视觉和运动表示自回归地预测未来世界状态
- 通过空间感知和动态信息的潜在世界表示实现强大的轨迹规划,解决了表示压缩不充分、空间理解有限和时间动态利用不足的问题
方法
Latent-WAM包含两个核心模块:空间感知压缩世界编码器(SCWE),利用基础模型提取几何知识,并通过可学习查询将多视图图像压缩为紧凑的场景标记;动态潜在世界模型(DLWM),采用因果Transformer,基于历史视觉和运动表示自回归地预测未来世界状态。该框架以端到端方式训练用于轨迹规划,在NAVSIM v2和HUGSIM基准上评估,与先前无感知方法进行比较。
关键结果
Latent-WAM取得了最先进的结果:NAVSIM v2上EPDMS为89.3,HUGSIM上HD-Score为28.9,以显著更少的训练数据和紧凑的1.04亿参数模型,超越了先前最佳的无感知方法3.2 EPDMS。