DriveCtrl: 条件化的仿真到真实驾驶视频生成
TLDR
DriveCtrl是一个基于深度条件的仿真到真实视频生成框架,能在保留标注的同时生成逼真驾驶视频。
评分理由
The paper addresses the domain gap in sim-to-real driving video generation with a structure-aware adapter and scalable pipeline. However, it lacks novelty in world model concepts and the evaluation metric is not fully detailed.
Read-first 评分解释
综合优先阅读分 40.5,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 0。
研究版图角色
基础论文前沿论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:236。
关键词评分
深度分析
创新点
- 基于深度条件的可控仿真到真实驾驶视频生成框架(DriveCtrl),构建于预训练视频基础模型之上
- 结构感知适配器,能够在保留源仿真场景布局和运动模式的同时实现深度引导生成
- 可扩展的数据生成流水线,支持三种条件信号(结构深度、参考数据集风格、文本提示),同时保留帧级标注
- 驾驶视频真实感评分(DVRS),一种基于驾驶领域知识的评估指标,用于评估生成视频的真实性
方法
DriveCtrl基于预训练的视频基础模型,并引入结构感知适配器进行深度引导生成。它使用可扩展的数据生成流水线,将仿真视频转换为与目标真实数据集视觉风格匹配的逼真驾驶片段,支持结构深度、参考数据集风格和文本提示的条件控制,同时保留帧级标注。该框架通过提出的DVRS指标以及标准的真实性、时间质量和感知任务性能指标进行评估。
关键结果
DriveCtrl在真实性、时间质量和感知任务性能方面持续优于基础模型和竞争替代方案,显著缩小了驾驶视频生成的仿真到真实差距。