递归自回归扩散:全局记忆与局部注意力
TLDR
提出RAD框架,利用LSTM实现递归自回归扩散,改善长视频生成的记忆与一致性。
评分理由
The paper introduces a novel integration of RNN (LSTM) into diffusion transformers for long video generation, addressing forgetting and spatiotemporal inconsistencies. Strengths include a consistent training-inference procedure and improved memory retention. Weaknesses are the limited evaluation on game datasets (Memory Maze, Minecraft) and lack of comparison to broader world model benchmarks.
Read-first 评分解释
综合优先阅读分 38,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 37。
研究版图角色
前沿论文
排序敏感性
稳定性:volatile;排名波动范围:199。
关键词评分
深度分析
创新点
- 将基于LSTM的递归神经网络引入扩散变换器框架,用于视频生成中的长期记忆保留。
- 提出递归自回归扩散(RAD)框架,采用逐帧自回归记忆更新与检索,消除训练-推理差距和窗口间缺乏重叠的问题。
- 证明结合注意力的LSTM在扩散模型中与TTT和Mamba2等最先进RNN模块性能相当。
方法
该方法将LSTM集成到扩散变换器中,形成RAD框架,在训练和推理过程中一致地执行逐帧自回归记忆更新与检索。实验在Memory Maze和Minecraft数据集上进行长视频生成。
关键结果
RAD在Memory Maze和Minecraft上实现了优越的长视频生成性能,优于现有扩散-RNN方法,并证实了LSTM在序列建模中的效率。
技术栈
Diffusion TransformerLSTMAttentionTTTMamba2Recurrent Autoregressive Diffusion (RAD)