Vega:通过自然语言指令学习驾驶
TLDR
该论文围绕“Vega: Learning to Drive with Natural Language Instructions”研究世界模型相关问题。
评分理由
Fallback reasoning generated from available title and abstract metadata: Vision-language-action models have reshaped autonomous driving to incorporate languages into the decision-making process. However, most existing pipelines only utilize the language modality for scene descriptions or reasoning and lack the flexibility to follow diverse user instructions for personalized...
Read-first 评分解释
综合优先阅读分 53.4,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。
研究版图角色
前沿论文复现锚点
排序敏感性
稳定性:volatile;排名波动范围:600。
深度分析
创新点
- 构建了一个大规模驾驶数据集(InstructScene),包含约10万个场景,标注了多样化的驾驶指令及相应轨迹
- 提出了一个统一的视觉-语言-世界-动作模型(Vega),结合了用于视觉和语言的自回归范式与用于世界建模和动作的扩散范式
- 使用联合注意力进行模态交互,并为不同模态使用独立投影层以增强能力
方法
作者首先构建了InstructScene数据集,包含约10万个驾驶场景,标注了多样化的指令和轨迹。然后提出了Vega模型,该模型采用自回归范式处理视觉输入和语言指令,采用扩散范式生成未来预测(世界建模)和轨迹(动作)。联合注意力实现了模态间的交互,并使用不同模态的独立投影层以提高能力。
关键结果
大量实验表明,Vega实现了卓越的规划性能,并表现出强大的指令跟随能力,为更智能和个性化的驾驶系统铺平了道路。