真正实时的长视频生成模型
TLDR
Helios是首个14B自回归扩散模型,在单张H100上实现19.5 FPS的实时长视频生成,无需标准加速或抗漂移启发式方法。
评分理由
The paper presents strong empirical results in real-time long video generation with novel training strategies for drifting and efficiency optimizations. However, it does not frame the work as a world model or address world dynamics prediction, limiting relevance to the specified keywords.
Read-first 评分解释
综合优先阅读分 43.6,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 0。
研究版图角色
前沿论文复现锚点
排序敏感性
稳定性:volatile;排名波动范围:517。
关键词评分
深度分析
创新点
- 对长视频漂移具有鲁棒性,无需常用的抗漂移启发式方法(如自强制、错误库或关键帧采样)
- 无需标准加速技术(如KV-cache、稀疏/线性注意力或量化)即可实现实时生成
- 无需并行或分片框架即可进行训练,在80 GB GPU内存中实现图像扩散规模的批量大小,同时可容纳多达四个14B模型
- 统一的输入表示,原生支持T2V、I2V和V2V任务
- 训练策略在训练过程中显式模拟漂移,并从根源上消除重复运动
- 大幅压缩历史上下文和噪声上下文,并减少采样步数以提高效率
- 基础设施级别的优化,加速推理和训练,同时降低内存消耗
方法
Helios是一个14B自回归扩散模型,具有统一的输入表示,支持文本到视频、图像到视频和视频到视频任务。它采用训练策略在训练过程中模拟漂移以减轻长视频漂移,并通过压缩历史上下文和噪声上下文以及减少采样步数来提高效率。基础设施优化加速了推理和训练,同时降低了内存消耗。
关键结果
Helios在单张NVIDIA H100 GPU上以19.5 FPS的速度实现分钟级视频生成,质量与强基线相当,并在短视频和长视频生成上持续优于先前方法。
技术栈
autoregressive diffusion modelunified input representationtraining strategies for drifting simulationcontext compressioninfrastructure optimizations