教视频生成器记住:为视线外的状态演化引出动态记忆
TLDR
ReMind通过面向记忆的数据和课程训练激发视频生成器的动态记忆,在STEVO-Bench上达到最优。
评分理由
The paper introduces a novel framework to address the limitation of video world models freezing hidden states during interruptions, with a comprehensive data mixture and curriculum. Strengths include a clear problem definition and strong empirical results, but the abstract lacks detailed baseline comparisons and explicit limitations.
Read-first 评分解释
综合优先阅读分 55.4,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 45。
研究版图角色
基础论文前沿论文桥接论文
排序敏感性
稳定性:volatile;排名波动范围:352。
关键词评分
深度分析
创新点
- ReMind框架,通过面向记忆的数据、事件感知训练和缓存适配,激发视频扩散Transformer的动态记忆行为。
- 基于100+动态事件分类的相机标注训练混合数据,包括VLM筛选的真实视频、生成的困难动态、合成相机循环和记忆中断增强。
- 帧图表示,包含保护锚点、退化区间和显式时间间隔,用于结构化训练片段。
- 节点结构化课程,包括节点丢弃、噪声记忆、前沿延续和参考缓存训练,强制模型在中断时检索相关过去状态。
- PM-RoPE,一种相机相位RoPE扩展,以单注意力成本实现时空检索,同时保留预训练路径。
方法
ReMind基于100+动态事件分类构建训练混合数据,使用VLM筛选的真实视频、生成的困难动态、合成相机循环和记忆中断增强。每个片段转换为带有保护锚点、退化区间和时间间隔的帧图。节点结构化课程(节点丢弃、噪声记忆、前沿延续、参考缓存训练)强制模型在中断时检索相关过去状态,PM-RoPE扩展RoPE以单注意力成本实现时空检索。
关键结果
ReMind在STEVO-Bench和恢复任务上取得最佳总体分数。通用图像到视频评估确认该课程避免了灾难性遗忘。
技术栈
Video Diffusion TransformerKV-cachePM-RoPEVLMFrame GraphNode-structured Curriculum