1275 篇论文
method
New world model architectures, training objectives, inference methods, or planning/control algorithms.
文献综述归纳
研究路线
将观测轨迹压缩为潜在动力学和想象轨迹,支持样本高效策略学习。
尚未覆盖:上下文和动力学可识别性是否可迁移到CARL和Atari之外的场景仍缺乏证据。通过掩码重建、深度或关键点动力学辅助任务,提升视频预测保真度与物理合理性。
尚未覆盖:跨域和零样本泛化证据有限,驾驶/机器人数据集之外的长期物理一致性尚未验证。将动作与视频生成耦合,或将语言分解为原语视频计划,使世界模型可用于策略或规划。
尚未覆盖:对全新原语、未见动作空间和真实机器人执行的泛化仍不明确。提供空间一致性、记忆一致性和动作响应的评测协议,而不仅是单帧真实性。
尚未覆盖:部分基准结果和基线尚未报告;开放域长期记忆与跨动作空间泛化仍是未解决问题。研究共性
- 世界模型学习正从潜在循环状态空间转向Transformer和扩散架构,用于高维视觉预测。
- 辅助自监督任务被用于稳定生成并注入几何或物理信息,如掩码重建、深度预测和关键点动力学。
- 上下文、语言、目标或动作条件被视为实现控制、规划和零样本泛化的关键要素。
- 评测从视觉质量扩展到闭环一致性、动作可控性和时空连贯性。
关键差异
- 表示方式不同:紧凑随机潜在状态与显式视频/扩散生成并存。
- 监督信号不同:方法分别依赖重建/生成、物理先验或动作-视频耦合。
- 评测目标不同:覆盖Atari/CARL、驾驶视频、机器人操纵和开放域第一/第三人称视频。
- 交互模式不同:想象轨迹用于策略学习、语言-目标视频规划、统一动作-视频扩散或基准动作控制。
开放问题
- 哪些辅助目标能迁移到已报告任务族和数据集之外?
- 策略或推理收益有多少来自模型本身,而不是规划器、控制器或任务先验?
- 模型能否在未见视角、场景和动作空间中保持长期记忆与空间一致性?
- 当前基准是否隔离了方法贡献,而非受数据集特定指标和系统选择影响?
- 部分研究缺少可见代码、局限说明或基准结果,复现性和失败边界仍是验证缺口。