DynVLA:学习自动驾驶中动作推理的世界动态
TLDR
DynVLA通过动态分词器预测紧凑世界动态,实现自动驾驶中基于物理的动作推理。
评分理由
The paper presents a novel CoT paradigm that compresses future world dynamics into tokens, decoupling ego and environment dynamics, and validates it on multiple benchmarks including a real-world dataset. Strengths include compact representation and empirical gains; weaknesses are domain specificity and lack of comparison to broader world model frameworks.
Read-first 评分解释
综合优先阅读分 50.5,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 18。
研究版图角色
排序敏感性
稳定性:volatile;排名波动范围:582。
关键词评分
深度分析
创新点
- 引入Dynamics CoT,一种新的思维链范式,在动作生成前预测紧凑的世界动态。
- 提出动态分词器(Dynamics Tokenizer),将未来演化压缩成少量动态令牌。
- 在交互密集场景中解耦自我中心和环境中心动态,实现更准确的世界动态建模。
- 通过监督微调(SFT)和强化微调(RFT)训练模型在动作前生成动态令牌。
方法
DynVLA是一种驾驶视觉-语言-动作(VLA)模型,采用Dynamics CoT:首先使用动态分词器将未来世界演化压缩成一组紧凑的动态令牌,然后将这些令牌解耦为自我中心和环境中心组件。模型通过SFT和RFT训练,在动作预测之前生成动态令牌,从而实现基于物理的决策,同时保持低延迟推理。在NAVSIM、Bench2Drive和大型内部数据集上进行评估,并与文本CoT和视觉CoT基线进行比较。
关键结果
DynVLA在NAVSIM、Bench2Drive和内部数据集上均一致优于文本CoT和视觉CoT方法,验证了Dynamics CoT在自动驾驶中的有效性和实用价值。