Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

真正实时的长视频生成模型

arXiv 26.3 2026 43.6 method

TLDR

Helios是首个14B自回归扩散模型,在单张H100上实现19.5 FPS的实时长视频生成,无需标准加速或抗漂移启发式方法。

评分理由

The paper presents strong empirical results in real-time long video generation with novel training strategies for drifting and efficiency optimizations. However, it does not frame the work as a world model or address world dynamics prediction, limiting relevance to the specified keywords.

Read-first 评分解释

综合优先阅读分 43.6,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 0。

近期性 8%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

可复现性 25%
81

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:有;数据:无;命中信号:代码、GitHub

方法质量 25%
60

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基线、实验

主题相关性 42%
0

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

研究版图角色

前沿论文复现锚点

排序敏感性

稳定性:volatile;排名波动范围:517。

关键词评分

world model
0
world simulator
0
generative world model
0
interactive world model
0
video world model
0
world dynamics prediction
0
model-based reinforcement learning world model
0

深度分析

创新点

  • 对长视频漂移具有鲁棒性,无需常用的抗漂移启发式方法(如自强制、错误库或关键帧采样)
  • 无需标准加速技术(如KV-cache、稀疏/线性注意力或量化)即可实现实时生成
  • 无需并行或分片框架即可进行训练,在80 GB GPU内存中实现图像扩散规模的批量大小,同时可容纳多达四个14B模型
  • 统一的输入表示,原生支持T2V、I2V和V2V任务
  • 训练策略在训练过程中显式模拟漂移,并从根源上消除重复运动
  • 大幅压缩历史上下文和噪声上下文,并减少采样步数以提高效率
  • 基础设施级别的优化,加速推理和训练,同时降低内存消耗

方法

Helios是一个14B自回归扩散模型,具有统一的输入表示,支持文本到视频、图像到视频和视频到视频任务。它采用训练策略在训练过程中模拟漂移以减轻长视频漂移,并通过压缩历史上下文和噪声上下文以及减少采样步数来提高效率。基础设施优化加速了推理和训练,同时降低了内存消耗。

关键结果

Helios在单张NVIDIA H100 GPU上以19.5 FPS的速度实现分钟级视频生成,质量与强基线相当,并在短视频和长视频生成上持续优于先前方法。

技术栈

autoregressive diffusion modelunified input representationtraining strategies for drifting simulationcontext compressioninfrastructure optimizations

标签