Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

LongLive:实时交互式长视频生成

arXiv 25.9 2025 35.5 method

TLDR

LongLive是采用帧级自回归设计、KV-recache和流式长调优的实时交互式长视频生成框架。

评分理由

The paper presents a novel framework for long video generation that addresses efficiency and interactivity, achieving real-time performance. However, the abstract lacks quantitative quality comparisons and detailed evaluation metrics.

Read-first 评分解释

综合优先阅读分 35.5,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 0。

近期性 8%
86.7

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2025

可复现性 25%
73

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:有;数据:无;命中信号:GitHub

方法质量 25%
40

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:无

主题相关性 42%
0

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

研究版图角色

前沿论文复现锚点

排序敏感性

稳定性:volatile;排名波动范围:143。

关键词评分

world model
0
world simulator
0
generative world model
0
interactive world model
0
video world model
0
world dynamics prediction
0
model-based reinforcement learning world model
0

深度分析

创新点

  • 用于实时交互式长视频生成的帧级自回归(AR)设计
  • KV-recache机制,用新提示刷新缓存状态以实现平滑且一致的提示切换
  • 流式长调优,实现长视频训练并对齐训练和推理(train-long-test-long)
  • 短窗口注意力与帧级注意力汇聚(frame sink)相结合,在保持长程一致性的同时实现更快的生成

方法

LongLive采用因果、帧级自回归设计,集成了KV-recache机制、流式长调优以及带有帧级注意力汇聚的短窗口注意力。它在仅32 GPU天内微调了一个1.3B参数的短视频片段模型,使其能够生成长达分钟的视频。

关键结果

LongLive在单个NVIDIA H100上保持20.7 FPS,在VBench上对短和长视频均取得了强劲性能,支持在单个H100 GPU上生成长达240秒的视频,并进一步支持INT8量化推理,仅带来轻微质量损失。

标签