Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

OmniDrive:一种由LLM编排的多智能体世界模型,具有统一潜在协同压缩,用于多视角驾驶视频生成

arXiv 2026 64.7 method, application

TLDR

一种由大语言模型编排的多智能体世界模型,用于可控多视角驾驶视频生成,采用统一潜在共压缩。

评分理由

The paper introduces a novel architecture (DRIVE-CHOREO) that uses multiple LLM agents to coordinate multi-view video generation, achieving state-of-the-art consistency and downstream utility. Strengths include addressing key tensions in driving world models and strong empirical results on nuScenes; weaknesses are limited to a single dataset and no explicit interactive or RL-based evaluation.

Read-first 评分解释

综合优先阅读分 64.7,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 47。

近期性 6%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

引用影响力 18%
95.3

使用 OpenAlex 形态的引用元数据作为文献关注度信号,并与论文本身质量分开处理。 归一化引用分位:0.95274583

方法质量 18%
80

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基线、数据集、指标、验证

主题相关性 29%
67.1

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

可复现性 18%
46

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:代码、数据集

引用速度 12%
0

引用速度按发表年限估算年均引用,降低旧论文天然占优的偏差。 年均引用:0.00

研究版图角色

基础论文前沿论文桥接论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:423。

关键词评分

generative world model
10
world model
9
video world model
9
world simulator
7
world dynamics prediction
6
interactive world model
4
model-based reinforcement learning world model
2

深度分析

创新点

  • 由LLM编排的多智能体世界模型,包含三个专门智能体(Director、Cartographer、Auditor),用于可控多视角驾驶视频生成
  • 通过视角-时间排列的统一潜在共压缩,在3-D VAE的卷积感受野内强制跨相机几何一致性
  • 共享符号中间语言(WorldScript),在潜在标记层面对齐语言、几何和像素,解决异构控制注入和后处理跨视图融合问题

方法

该方法使用三个Qwen2.5-VL智能体:Director解析用户意图为结构化WorldScript,Cartographer将其转化为空间锚定的布局标记,Auditor提供跨视图批评作为辅助监督。这些智能体共同生成位置感知的标记序列,通过3-D VAE中的视角-时间排列与多视角视频进行共压缩。模型在nuScenes数据集上训练和评估,基线包括最先进的方法,指标包括多视图一致性、BEV mAP、FVD和NDS。

关键结果

DRIVE-CHOREO在nuScenes上实现了最先进的多视图一致性和BEV mAP 21.6,以及具有竞争力的FVD 45.7。仅使用模型合成数据训练的检测器在真实验证集上获得了+2.4 NDS的提升,验证了下游实用性。

技术栈

Qwen2.5-VL3-D VAEnuScenes

标签

autonomous drivingworld modelmulti-agentvideo generationlatent representationLLMCVAI