Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

RELIC:具有长时记忆的交互式视频世界模型

arXiv 25.12 2025 62.2 method, system

TLDR

RELIC是140亿参数交互式视频世界模型,具长时记忆,从单图实现实时记忆感知探索。

评分理由

Strengths: addresses three key challenges simultaneously, uses novel memory-efficient self-forcing paradigm, achieves real-time 16 FPS. Weaknesses: trained on synthetic Unreal Engine data, not real-world; limited to 5-second training horizon extended via teacher model; no evaluation on real-world benchmarks mentioned.

Read-first 评分解释

综合优先阅读分 62.2,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 52。

近期性 8%
86.7

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2025

主题相关性 42%
74.3

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

方法质量 25%
50

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:数据集

可复现性 25%
46

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:代码、数据集

研究版图角色

前沿论文

排序敏感性

稳定性:volatile;排名波动范围:304。

关键词评分

world model
10
interactive world model
10
video world model
10
generative world model
9
world simulator
8
world dynamics prediction
5
model-based reinforcement learning world model
0

深度分析

创新点

  • 统一框架,同时解决实时长时流式处理、一致的空间记忆和精确的用户控制
  • 紧凑的相机感知记忆结构,使用压缩的历史潜在标记(在KV缓存中编码相对动作和绝对相机位姿),实现隐式3D一致内容检索
  • 内存高效的自强制范式,支持对长时间教师和长时间学生自展开进行全上下文蒸馏,将生成能力扩展到原始5秒训练视野之外

方法

RELIC基于自回归视频扩散蒸馏技术。它使用高度压缩的历史潜在标记(在KV缓存中编码相对动作和绝对相机位姿)来表示长时记忆。微调双向教师视频模型以生成超出原始5秒视野的序列,然后使用内存高效的自强制范式将其转换为因果学生生成器,进行全上下文蒸馏。该模型是一个140亿参数的Transformer,在精心策划的虚幻引擎渲染数据集上训练。

关键结果

RELIC实现了16 FPS的实时生成,同时与先前工作相比,展示了更准确的动作跟随、更稳定的长时流式处理和更鲁棒的空间记忆检索。

技术栈

autoregressive video-diffusion distillationKV cache14B-parameter transformerUnreal Engine-rendered dataset

标签