DiVE: 基于视频扩散Transformer的高效多视角驾驶场景生成
TLDR
DriVerse通过显式轨迹引导和运动对齐,从单张图像和轨迹生成多视角驾驶视频,在真实数据集上超越先前模型。
评分理由
Strengths include novel trajectory tokenization and motion alignment for temporal consistency, achieving strong results on real-world benchmarks with minimal training. Weaknesses are limited scope to driving scenes and lack of interactivity or downstream task evaluation.
Read-first 评分解释
综合优先阅读分 59.3,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 43。
研究版图角色
前沿论文
排序敏感性
稳定性:volatile;排名波动范围:216。
关键词评分
深度分析
创新点
- 两种互补形式的显式轨迹引导:利用预定义趋势词汇将轨迹标记化为文本提示,以及将三维轨迹转换为二维空间运动先验
- 轻量级运动对齐模块,增强动态像素的帧间一致性
方法
DriVerse是一种基于视频扩散Transformer的生成模型,从单张图像和未来轨迹模拟导航驱动驾驶场景。它引入双形式轨迹引导:将轨迹标记化为文本提示以实现语言集成,并将三维轨迹转换为二维空间运动先验以控制静态内容。添加轻量级运动对齐模块以改善动态物体的时间连贯性。该模型在极少额外数据下训练,并在nuScenes和Waymo数据集上评估。
关键结果
DriVerse在nuScenes和Waymo数据集上的未来视频生成任务中均优于专用模型。