ABot-World-0:在单桌面GPU上实现无限交互世界展开
TLDR
ABot-World-0在单个桌面GPU上实现实时动作条件视频世界模型与长程交互。
评分理由
The paper presents a novel approach for real-time interactive video generation with long-horizon consistency using distillation and LongForcing. However, its reliance on specific data sources and infrastructure may limit generalizability, and the evaluation is limited to a few benchmarks.
Read-first 评分解释
综合优先阅读分 47,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 61。
研究版图角色
排序敏感性
稳定性:volatile;排名波动范围:579。
关键词评分
深度分析
创新点
- 动作条件视频世界模型,用于单桌面GPU上的实时长程闭环交互。
- WorldExplorer智能体驱动数据收集,基于训练反馈进行指导。
- 统一标注管道,包含14项确定性质量检查和VLM评估,实现同步动作与文本标签。
- 通过教师强制、ODE蒸馏和LongForcing将双向教师逐步蒸馏为因果学生,以缓解自回归漂移。
- 统一的键盘动作接口,支持场景漫游和第三人称角色交互。
- 参考角色记忆,在长时间展开中保持身份一致性。
- 协同设计的流式推理栈,包含轻量级VAE解码器、高效注意力、内存感知调度和低比特DiT推理。
方法
模型在来自AAA游戏、模拟引擎和互联网视频的多源数据上训练。WorldExplorer根据训练反馈进行智能体驱动数据收集,统一管道执行确定性质量检查、VLM评估和同步动作-文本标注。通过教师强制、ODE蒸馏以及新颖的LongForcing技术,将双向动作条件教师逐步蒸馏为因果学生,以对齐长时间自展开;原始键盘动作和参考角色记忆确保可控交互和身份一致性。部署采用协同设计的流式推理栈,包含轻量级VAE解码器、高效注意力机制、内存感知调度和低比特DiT推理。
关键结果
ABot-World-0在单个NVIDIA RTX 5090桌面GPU上以高达16 FPS流式输出720P视频,动作到首帧延迟1.2秒,峰值显存约19GiB;在WorldRoamBench和扩展交互展开上展示了具有竞争力的可控性和连贯的长程演化。