Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

桥接场景生成与规划:通过统一视觉与运动表示的世界模型驾驶

arXiv 26.3 2026 72.7 method, application

TLDR

WorldDrive通过统一驾驶世界模型中的视觉和运动表示,将场景生成与实时规划耦合。

评分理由

Strengths include a novel trajectory-conditioned world model that bridges scene generation and planning, with a future-aware rewarder. Weaknesses: the abstract lacks explicit real-world validation or benchmark results, making empirical support unclear.

Read-first 评分解释

综合优先阅读分 72.7,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 49。

近期性 8%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

可复现性 25%
81

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:有;数据:无;命中信号:代码、GitHub

主题相关性 42%
70

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

方法质量 25%
60

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基准、实验

研究版图角色

前沿论文复现锚点

排序敏感性

稳定性:volatile;排名波动范围:90。

关键词评分

world model
10
world dynamics prediction
9
generative world model
8
model-based reinforcement learning world model
7
video world model
6
interactive world model
5
world simulator
4

深度分析

创新点

  • 轨迹感知驾驶世界模型(Trajectory-aware Driving World Model),该模型基于轨迹词汇表,强制视觉动态与运动意图之间的一致性,从而能够生成以特定轨迹为条件的多样且合理的未来场景。
  • 将世界模型中的视觉和运动编码器迁移到下游的多模态规划器(Multi-modal Planner),确保驾驶策略基于由场景生成预优化的成熟表示。
  • 未来感知奖励器(Future-aware Rewarder),从冻结的世界模型中提取未来潜在表示,以实时评估和选择最优轨迹。

方法

WorldDrive是一个通过统一视觉和运动表示来耦合场景生成和实时规划的整体框架。它引入了一个轨迹感知驾驶世界模型(Trajectory-aware Driving World Model),该模型使用轨迹词汇表强制视觉动态与运动意图之间的一致性。视觉和运动编码器被迁移到多模态规划器(Multi-modal Planner),同时未来感知奖励器(Future-aware Rewarder)利用冻结世界模型的前瞻能力来评估和选择最优轨迹。该框架在NAVSIM、NAVSIM-v2和nuScenes基准上进行了评估。

关键结果

WorldDrive在纯视觉方法中实现了领先的规划性能,同时保持了高保真的动作控制视频生成能力,证明了统一视觉和运动表示对于鲁棒自动驾驶的有效性。

标签