Alaya-EVOKE:从线性扩展监督到无尽世界
TLDR
Evoke 提出外部化状态与线性扩展监督的交互式世界模型,实现长时程生成与响应式少步学生推理。
评分理由
The paper introduces a novel architecture that decouples persistent world state from the denoiser context and uses a redesigned teacher for long-horizon supervision, addressing key scalability and interaction trade-offs. However, the abstract lacks explicit real-world benchmarks or datasets, making empirical validation unclear from the visible text.
Read-first 评分解释
综合优先阅读分 38.8,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 49。
研究版图角色
前沿论文
排序敏感性
稳定性:volatile;排名波动范围:315。
关键词评分
深度分析
创新点
- 将持久世界状态外部化到相机索引的世界状态库中,仅检索与视角相关的信息,从而在会话长度增长时保持去噪器上下文有界。
- 重新设计教师模型以进行长时程监督:使用分块分组、选定远帧检索和线性注意力全局状态相结合的稀疏注意力,实现内存/计算线性扩展并暴露内容漂移。
- 在教师模型中采用逐块条件控制,以在整个序列中实现提示词更改和事件控制。
- 在自强制展开下使用30秒分布匹配目标,将长时程能力迁移到无需无分类器引导的三步学生模型。
方法
Evoke 将持久世界状态分离到外部、相机索引的库中,仅检索与视角相关的信息,从而保持去噪器上下文有界。教师模型使用结合分块分组、远帧检索和线性注意力全局状态的稀疏注意力,以线性成本提供长时程监督。通过自强制展开的分布匹配目标,将这些能力迁移到无需无分类器引导即可运行的三步学生模型。
关键结果
Evoke 在 WBench 上取得最先进性能,并在 VBench-Long 和 VBench-2.0 上保持竞争力。在单块 H200 上、384×640 分辨率下,每个 1.5 秒块生成耗时 2.11 秒,支持开放式连续生成。