Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

DriVerse: 基于多模态轨迹提示与运动对齐的驾驶仿真导航世界模型

ACM MM 25 2025 52.2 method

TLDR

该论文围绕“DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment”研究世界模型相关问题。

评分理由

Fallback reasoning generated from available title and abstract metadata: Collecting multi-view driving scenario videos to enhance the performance of 3D visual perception tasks presents significant challenges and incurs substantial costs, making generative models for realistic data an appealing alternative. Yet, the videos generated by recent works suffer...

Read-first 评分解释

综合优先阅读分 52.2,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。

近期性 8%
86.7

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2025

可复现性 25%
81

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:有;数据:无;命中信号:数据集、GitHub

方法质量 25%
50

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:数据集

主题相关性 42%
29.4

将配置的研究关键词与标题、摘要、标签和分析文本进行匹配。 匹配关键词数:6

研究版图角色

前沿论文复现锚点

排序敏感性

稳定性:volatile;排名波动范围:471。

深度分析

创新点

  • 多控制辅助分支蒸馏
  • 分辨率渐进采样

方法

DiVE是一种基于扩散变换器的生成框架,利用统一的交叉注意力机制和SketchFormer对鸟瞰图布局和文本描述进行精确的多模态控制,并引入一种不增加额外参数的视图膨胀注意力机制以保证跨视角一致性。此外,它引入了多控制辅助分支蒸馏以简化多条件无分类器引导,以及分辨率渐进采样——一种无需训练的加速策略,通过交错分辨率缩放来降低延迟。

关键结果

在nuScenes数据集上,DiVE在多视角视频生成中达到了最先进性能,生成具有出色时间和跨视角一致性的逼真输出,同时实现了2.62倍加速且质量损失极小。

标签