DriVerse: 基于多模态轨迹提示与运动对齐的驾驶仿真导航世界模型
TLDR
该论文围绕“DriVerse: Navigation World Model for Driving Simulation via Multimodal Trajectory Prompting and Motion Alignment”研究世界模型相关问题。
评分理由
Fallback reasoning generated from available title and abstract metadata: Collecting multi-view driving scenario videos to enhance the performance of 3D visual perception tasks presents significant challenges and incurs substantial costs, making generative models for realistic data an appealing alternative. Yet, the videos generated by recent works suffer...
Read-first 评分解释
综合优先阅读分 52.2,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。
研究版图角色
排序敏感性
稳定性:volatile;排名波动范围:471。
深度分析
创新点
- 多控制辅助分支蒸馏
- 分辨率渐进采样
方法
DiVE是一种基于扩散变换器的生成框架,利用统一的交叉注意力机制和SketchFormer对鸟瞰图布局和文本描述进行精确的多模态控制,并引入一种不增加额外参数的视图膨胀注意力机制以保证跨视角一致性。此外,它引入了多控制辅助分支蒸馏以简化多条件无分类器引导,以及分辨率渐进采样——一种无需训练的加速策略,通过交错分辨率缩放来降低延迟。
关键结果
在nuScenes数据集上,DiVE在多视角视频生成中达到了最先进性能,生成具有出色时间和跨视角一致性的逼真输出,同时实现了2.62倍加速且质量损失极小。