MiLA:面向自动驾驶的多视角高保真长时视频生成世界模型
TLDR
MiLA通过粗到精和去噪模块生成长达一分钟的高保真驾驶视频,在nuScenes上达到SOTA。
评分理由
The paper proposes a novel framework for long-term video generation in autonomous driving, addressing error accumulation with coarse-to-refine and denoising modules. Strengths include state-of-the-art results on nuScenes, but weaknesses are limited evaluation to a single dataset and lack of real-world deployment or interactive capabilities.
Read-first 评分解释
综合优先阅读分 59.3,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 43。
研究版图角色
前沿论文
排序敏感性
稳定性:volatile;排名波动范围:214。
关键词评分
深度分析
创新点
- 用于稳定视频生成和纠正动态物体畸变的粗到精(Coarse-to-Re(fine))方法
- 时间渐进去噪调度器
- 联合去噪与校正流模块
方法
MiLA是一个用于长时视频生成的框架,采用粗到精(Coarse-to-Re(fine))方法稳定生成过程并纠正动态物体畸变。它集成了时间渐进去噪调度器和联合去噪与校正流模块。该模型在nuScenes数据集上进行训练和评估,达到了最先进的性能。
关键结果
MiLA在nuScenes数据集上的视频生成质量达到了最先进的性能。