CoWorld-VLA:在多专家世界模型中思考自动驾驶
TLDR
CoWorld-VLA采用多专家世界模型与四种令牌,引导自动驾驶动作规划,在NAVSIM v1上表现优异。
评分理由
The paper introduces a novel multi-expert world reasoning framework that explicitly conditions action planning on complementary world tokens, which is a strength. However, it is only evaluated on the NAVSIM v1 benchmark without real-world deployment or generalization analysis, limiting its demonstrated impact.
Read-first 评分解释
综合优先阅读分 66.1,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 40。
研究版图角色
基础论文前沿论文桥接论文方法锚点复现锚点
排序敏感性
稳定性:volatile;排名波动范围:449。
关键词评分
深度分析
创新点
- 用于自动驾驶的多专家世界推理框架,其中世界表示作为显式条件引导动作规划
- 四种专家令牌:语义交互、几何结构、动态演化、自车轨迹令牌
- 基于扩散的分层多专家融合规划器,与场景上下文耦合进行联合去噪,生成连续自车轨迹
方法
CoWorld-VLA通过多源监督提取互补的世界信息,并将其编码为VLA中的专家令牌,提供规划器可访问的条件信号。它构建了四种令牌,分别建模交互意图、空间结构、未来时间动态和行为目标。在动作生成过程中,采用基于扩散的分层多专家融合规划器,该规划器在整个联合去噪过程中与场景上下文耦合,以生成连续的自车轨迹。
关键结果
CoWorld-VLA在NAVSIM v1基准测试的未来场景生成和规划方面均取得了有竞争力的结果,展示了在碰撞避免和轨迹准确性方面的强大性能。消融研究验证了专家令牌的互补性及其作为规划条件的有效性。
技术栈
VLADiffusion modelsWorld modelsMulti-expert fusionHierarchical planning