RELIC:具有长时记忆的交互式视频世界模型
TLDR
RELIC是140亿参数交互式视频世界模型,具长时记忆,从单图实现实时记忆感知探索。
评分理由
Strengths: addresses three key challenges simultaneously, uses novel memory-efficient self-forcing paradigm, achieves real-time 16 FPS. Weaknesses: trained on synthetic Unreal Engine data, not real-world; limited to 5-second training horizon extended via teacher model; no evaluation on real-world benchmarks mentioned.
Read-first 评分解释
综合优先阅读分 62.2,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 52。
研究版图角色
前沿论文
排序敏感性
稳定性:volatile;排名波动范围:304。
关键词评分
深度分析
创新点
- 统一框架,同时解决实时长时流式处理、一致的空间记忆和精确的用户控制
- 紧凑的相机感知记忆结构,使用压缩的历史潜在标记(在KV缓存中编码相对动作和绝对相机位姿),实现隐式3D一致内容检索
- 内存高效的自强制范式,支持对长时间教师和长时间学生自展开进行全上下文蒸馏,将生成能力扩展到原始5秒训练视野之外
方法
RELIC基于自回归视频扩散蒸馏技术。它使用高度压缩的历史潜在标记(在KV缓存中编码相对动作和绝对相机位姿)来表示长时记忆。微调双向教师视频模型以生成超出原始5秒视野的序列,然后使用内存高效的自强制范式将其转换为因果学生生成器,进行全上下文蒸馏。该模型是一个140亿参数的Transformer,在精心策划的虚幻引擎渲染数据集上训练。
关键结果
RELIC实现了16 FPS的实时生成,同时与先前工作相比,展示了更准确的动作跟随、更稳定的长时流式处理和更鲁棒的空间记忆检索。
技术栈
autoregressive video-diffusion distillationKV cache14B-parameter transformerUnreal Engine-rendered dataset