ResWM:面向视觉强化学习的残差动作世界模型
TLDR
ResWM将视觉RL世界模型中的控制从绝对动作改为残差动作,提升了DeepMind Control Suite上的稳定性和样本效率。
评分理由
The paper introduces a novel residual-action formulation that aligns with real-world smoothness and reduces search space, with empirical validation on simulated tasks. However, it lacks real-world experiments and only evaluates on a single simulated benchmark, limiting generalizability claims.
Read-first 评分解释
综合优先阅读分 68.2,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 51。
研究版图角色
前沿论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:108。
关键词评分
深度分析
创新点
- 将控制变量从绝对动作重新定义为残差动作(相对于上一步的增量调整),以对齐真实世界控制的平滑性并稳定长时域规划。
- 提出观测差异编码器,显式建模相邻帧之间的变化,生成与残差动作自然耦合的紧凑潜在动力学。
- 将残差动作建模以最小修改且无需额外超参数的方式集成到Dreamer风格的潜在动力学模型中。
方法
ResWM用残差动作(相对于上一步的增量调整)替代绝对动作,并使用观测差异编码器建模帧间变化。它集成到Dreamer风格的潜在动力学模型中,想象展开和策略优化均在残差动作空间中进行,从而实现更平滑的探索和更低的控制方差。
关键结果
在DeepMind Control Suite上,ResWM在样本效率、渐近回报和控制平滑性方面均取得一致改进,显著超越Dreamer和TD-MPC。它还生成更稳定且节能的动作轨迹。
局限性
- 该方法假设控制具有平滑性(真实世界机器人固有),这可能不适用于需要突然或不连续动作的任务。
- 评估仅限于模拟环境(DeepMind Control Suite);真实世界机器人部署可能引入此处未解决的额外挑战。