Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

Vega:通过自然语言指令学习驾驶

arXiv 26.3 2026 53.4 method, benchmark, application

TLDR

该论文围绕“Vega: Learning to Drive with Natural Language Instructions”研究世界模型相关问题。

评分理由

Fallback reasoning generated from available title and abstract metadata: Vision-language-action models have reshaped autonomous driving to incorporate languages into the decision-making process. However, most existing pipelines only utilize the language modality for scene descriptions or reasoning and lack the flexibility to follow diverse user instructions for personalized...

Read-first 评分解释

综合优先阅读分 53.4,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。

近期性 8%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

可复现性 25%
81

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:有;数据:无;命中信号:数据集、GitHub

方法质量 25%
60

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:数据集、实验

主题相关性 42%
23.5

将配置的研究关键词与标题、摘要、标签和分析文本进行匹配。 匹配关键词数:5

研究版图角色

前沿论文复现锚点

排序敏感性

稳定性:volatile;排名波动范围:600。

深度分析

创新点

  • 构建了一个大规模驾驶数据集(InstructScene),包含约10万个场景,标注了多样化的驾驶指令及相应轨迹
  • 提出了一个统一的视觉-语言-世界-动作模型(Vega),结合了用于视觉和语言的自回归范式与用于世界建模和动作的扩散范式
  • 使用联合注意力进行模态交互,并为不同模态使用独立投影层以增强能力

方法

作者首先构建了InstructScene数据集,包含约10万个驾驶场景,标注了多样化的指令和轨迹。然后提出了Vega模型,该模型采用自回归范式处理视觉输入和语言指令,采用扩散范式生成未来预测(世界建模)和轨迹(动作)。联合注意力实现了模态间的交互,并使用不同模态的独立投影层以提高能力。

关键结果

大量实验表明,Vega实现了卓越的规划性能,并表现出强大的指令跟随能力,为更智能和个性化的驾驶系统铺平了道路。

标签