Causal-rCM:一种统一的教师强制与自我强制开放方案,用于自回归扩散蒸馏在流式视频生成与交互式世界模型中的应用
TLDR
将rCM扩散蒸馏扩展到自回归视频扩散,通过teacher-forcing和self-forcing实现SOTA流式视频生成和交互世界模型。
评分理由
The paper presents a novel unified recipe combining teacher-forcing and self-forcing for diffusion distillation in autoregressive video generation, achieving state-of-the-art performance and 10x faster convergence. However, it relies solely on synthetic data, lacking real-world validation, and the abstract cuts off, leaving some details unclear.
Read-first 评分解释
综合优先阅读分 59.5,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 54。
研究版图角色
排序敏感性
稳定性:volatile;排名波动范围:504。
关键词评分
深度分析
创新点
- 将先进的扩散蒸馏框架rCM扩展到自回归视频扩散。
- 证明teacher-forcing CM是self-forcing DMD作为初始化策略的最佳补充。
- 首次实现基于teacher-forcing的连续时间一致性模型(sCM/MeanFlow)用于自回归视频扩散,通过自定义掩码FlashAttention-2 JVP内核实现,相比离散时间CM收敛速度提升10倍。
- 提出Causal-rCM,一个统一、可扩展的算法-基础设施开源方案,用于扩散蒸馏和因果训练。
- 在仅使用合成数据训练的情况下,在逐帧和逐块设置中均实现了最先进的流式视频生成性能。
- 将Causal-rCM应用于Cosmos 3(一个先进的通用世界基础模型),实现交互式世界模型。
方法
本文将rCM扩散蒸馏框架扩展到自回归视频扩散,利用teacher-forcing(离线前向散度因果训练)和self-forcing(在线策略反向散度精炼)。通过自定义掩码FlashAttention-2 JVP内核实现连续时间一致性模型(sCM/MeanFlow)的高效训练。该方法在流式视频生成(逐帧和逐块)以及动作条件世界模型上进行评估,仅使用合成数据进行训练。
关键结果
蒸馏后的2步因果Wan2.1-1.3B模型在仅1或2个采样步骤下达到VBench-T2V分数84.63,实现了最先进的流式视频生成性能。