1176 篇论文
method
New world model architectures, training objectives, inference methods, or planning/control algorithms.
文献综述归纳
研究路线
从历史观测学习生成未来帧,通过扩散或VAE-Transformer混合建模捕捉环境动态和外观。
尚未覆盖:长时域一致性、物理合理性、跨域泛化能力及训练效率,多数设计仅在单一领域验证。通过将指令分解为原语(组合)或将动态条件化于显式上下文变量,提升零样本泛化。
尚未覆盖:对全新原语或不可观测上下文的泛化、任务多样性有限、对解析精度的依赖。将动作预测或策略学习与视频生成集成,使世界模型直接支持决策与控制。
尚未覆盖:真实动作空间泛化、模型增益与规划器/控制器贡献的分离、仿真到现实的迁移。提供记忆一致性、动作控制和空间连贯性的标准化度量,超越单纯视频质量评估。
尚未覆盖:多样化场景与任务覆盖、消除数据集偏差、将基准分数与下游任务改进关联。研究共性
- 世界模型普遍采用扩散或Transformer骨干架构。
- 自监督视频/状态预测是核心学习范式。
- 超出训练分布的泛化(零样本、组合、上下文)成为关注焦点。
- 记忆一致性和动作控制被识别为根本性挑战。
关键差异
- 表示选择:部分工作生成纯视频,另一些在统一Transformer中联合建模视频和动作令牌。
- 监督信号:有的仅依赖重建损失,有的融合深度、关键点动力学或显式上下文变量。
- 评测域:基准涵盖Atari游戏、自动驾驶和机器人操作,各自采用不同的成功标准。
- 交互模式:开环视频预测 vs. 闭环动作条件生成与策略学习。
- 部署环境:评估在仿真、离线数据集和有限真实场景中分割,缺乏一致的真实世界基线。
开放问题
- 如何在不限制表达性的前提下将物理约束融入灵活的生成式架构?
- 现有基准是否捕捉了真实部署的需求,还需要哪些额外度量?
- 什么机制能确保世界模型在长时域保持时间和空间一致性?
- 如何分离世界模型本身的贡献与规划器、控制器或训练数据规模的影响?
- 零样本泛化到与训练分布根本不同的动力学和场景的极限在哪里?