HaM-World: 基于软哈密顿世界模型与选择性记忆的规划方法
TLDR
HaM-World结合哈密顿动力学与选择性记忆,实现稳定长时域规划,在DMC和OOD任务上表现优异。
评分理由
Strengths include novel integration of Hamiltonian mechanics and state-space memory to address instability in world model rollouts, with thorough empirical validation on multiple tasks and OOD conditions. Weaknesses are limited to simulated control tasks and lack of analysis on more complex or high-dimensional environments.
Read-first 评分解释
综合优先阅读分 56.1,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 51。
研究版图角色
排序敏感性
稳定性:volatile;排名波动范围:403。
关键词评分
深度分析
创新点
- 将潜在状态分解为规范(q, p)子空间和上下文子空间c
- 使用Mamba选择性状态空间记忆作为历史条件输入到潜在动力学
- 哈密顿向量场与可学习残差/控制动力学用于(q, p)演化
- 软哈密顿动力学设计,限制无动作哈密顿能量漂移
- 共享潜在状态用于动力学预测、奖励/价值估计、想象 rollout 和 CEM 动作搜索
方法
HaM-World将潜在状态分解为规范(q, p)子空间和上下文子空间c,使用Mamba选择性状态空间记忆作为历史条件输入。(q, p)通过能量导出的哈密顿向量场加上可学习残差/控制动力学演化,而c捕获语义、耗散和非保守因素。该模型在四个DeepMind Control Suite任务上评估,基线包括一个强基线模型,使用Avg. AUC、长时域 rollout 误差、MSE cells和OOD return等指标。
关键结果
HaM-World达到最高Avg. AUC(117.9,+9.5%),将长时域 rollout 误差降低到强基线的45%,并在{3,5,7} MSE cells中赢得11/12。在12种OOD扰动下,它在每种条件下都获得最高回报,在Finger Spin上平均OOD回报增益10.2%,在Reacher Easy上为13.6%。