OmniDrive:一种由LLM编排的多智能体世界模型,具有统一潜在协同压缩,用于多视角驾驶视频生成
TLDR
一种由大语言模型编排的多智能体世界模型,用于可控多视角驾驶视频生成,采用统一潜在共压缩。
评分理由
The paper introduces a novel architecture (DRIVE-CHOREO) that uses multiple LLM agents to coordinate multi-view video generation, achieving state-of-the-art consistency and downstream utility. Strengths include addressing key tensions in driving world models and strong empirical results on nuScenes; weaknesses are limited to a single dataset and no explicit interactive or RL-based evaluation.
Read-first 评分解释
综合优先阅读分 64.7,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 47。
研究版图角色
排序敏感性
稳定性:volatile;排名波动范围:423。
关键词评分
深度分析
创新点
- 由LLM编排的多智能体世界模型,包含三个专门智能体(Director、Cartographer、Auditor),用于可控多视角驾驶视频生成
- 通过视角-时间排列的统一潜在共压缩,在3-D VAE的卷积感受野内强制跨相机几何一致性
- 共享符号中间语言(WorldScript),在潜在标记层面对齐语言、几何和像素,解决异构控制注入和后处理跨视图融合问题
方法
该方法使用三个Qwen2.5-VL智能体:Director解析用户意图为结构化WorldScript,Cartographer将其转化为空间锚定的布局标记,Auditor提供跨视图批评作为辅助监督。这些智能体共同生成位置感知的标记序列,通过3-D VAE中的视角-时间排列与多视角视频进行共压缩。模型在nuScenes数据集上训练和评估,基线包括最先进的方法,指标包括多视图一致性、BEV mAP、FVD和NDS。
关键结果
DRIVE-CHOREO在nuScenes上实现了最先进的多视图一致性和BEV mAP 21.6,以及具有竞争力的FVD 45.7。仅使用模型合成数据训练的检测器在真实验证集上获得了+2.4 NDS的提升,验证了下游实用性。