具身世界模型从开放环境中的导航任务中涌现
TLDR
循环智能体在迷宫中通过稀疏奖励自发形成紧凑的具身世界模型用于空间推理
评分理由
The paper presents a novel dynamical systems and representation analysis to show that embodied world models emerge from sensorimotor interaction, with strong causal evidence. However, it is limited to simulated planar mazes and lacks real-world validation, and the connection to generative or video world models is indirect.
Read-first 评分解释
综合优先阅读分 55,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 34。
研究版图角色
前沿论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:312。
关键词评分
深度分析
创新点
- 证明仅通过稀疏奖励在程序生成的平面迷宫中训练的循环智能体能够内化方向、距离和障碍物布局等度量概念,无需显式监督。
- 将封闭的智能体-环境循环建模为混合动力系统,并识别智能体状态空间中的稳定极限环,作为内部世界模型的证据。
- 引入一种岭表示(Ridge Representation),将整个轨迹嵌入到公共度量空间中,用于分析神经和行为流形。
- 使用典型相关分析揭示神经流形与行为流形之间的稳健线性对齐。
- 对信息量最大的神经维度进行定向扰动,以因果地将内部表示与导航性能联系起来。
方法
作者使用稀疏奖励在程序生成的平面迷宫中训练循环智能体。训练后,他们通过将封闭的智能体-环境循环建模为混合动力系统、识别稳定极限环,并使用岭表示将轨迹嵌入公共度量空间,来分析智能体的内部表示。然后应用典型相关分析测量神经流形与行为流形之间的对齐程度,并对信息量大的神经维度进行扰动实验。
关键结果
训练后的智能体在未见过的迷宫中持续产生接近最优的路径。典型相关分析揭示了神经流形与行为流形之间的稳健线性对齐,而对信息量最大的神经维度进行扰动会显著降低导航性能。
局限性
- 该研究仅限于平面迷宫和特定的导航任务,因此尚未建立对更复杂或真实环境的泛化能力。
- 世界模型的涌现可能依赖于循环架构和稀疏奖励训练设置,且分析方法(混合动力系统、岭表示)可能仅适用于此设置。
- 所声称的‘具身世界模型’仅限于度量概念(方向、距离、障碍物布局),可能无法扩展到更丰富的语义或因果理解。
- 该论文未涉及将学到的表示迁移到迷宫导航范式之外的其他任务或环境。