DrivingGPT:利用多模态自回归变换器统一驾驶世界建模与规划
TLDR
利用交错图像和动作令牌的自回归预测统一驾驶世界建模与规划
评分理由
The paper introduces a novel multimodal autoregressive approach that jointly handles world modeling and planning, outperforming baselines on nuPlan and NAVSIM. Strengths include unifying simulation and planning in a single framework; weaknesses include limited discussion of generalization beyond driving and potential scalability issues.
Read-first 评分解释
综合优先阅读分 65.6,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 57。
研究版图角色
前沿论文
排序敏感性
稳定性:volatile;排名波动范围:299。
关键词评分
深度分析
创新点
- 将驾驶世界建模与规划统一为单一序列建模问题
- 引入基于交错图像和动作令牌的多模态驾驶语言
- 使用标准下一个令牌预测的自回归变换器进行联合世界建模与规划
方法
DrivingGPT采用多模态自回归变换器,将交错图像和动作令牌作为统一序列处理。该模型通过在大规模驾驶数据上进行标准下一个令牌预测训练,实现了动作条件视频生成和端到端轨迹规划。
关键结果
DrivingGPT在nuPlan和NAVSIM基准测试中,在动作条件视频生成和端到端规划任务上均优于强基线。
技术栈
Autoregressive TransformerMultimodal TokenizationNext-Token Prediction