Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

ResWM:面向视觉强化学习的残差动作世界模型

arXiv 26.3 2026 68.2 method

TLDR

ResWM将视觉RL世界模型中的控制从绝对动作改为残差动作,提升了DeepMind Control Suite上的稳定性和样本效率。

评分理由

The paper introduces a novel residual-action formulation that aligns with real-world smoothness and reduces search space, with empirical validation on simulated tasks. However, it lacks real-world experiments and only evaluates on a single simulated benchmark, limiting generalizability claims.

Read-first 评分解释

综合优先阅读分 68.2,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 51。

近期性 8%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

方法质量 25%
80

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基线、评估、结果

主题相关性 42%
72.9

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

可复现性 25%
38

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:代码

研究版图角色

前沿论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:108。

关键词评分

world model
10
model-based reinforcement learning world model
10
world dynamics prediction
9
interactive world model
7
world simulator
6
generative world model
5
video world model
4

深度分析

创新点

  • 将控制变量从绝对动作重新定义为残差动作(相对于上一步的增量调整),以对齐真实世界控制的平滑性并稳定长时域规划。
  • 提出观测差异编码器,显式建模相邻帧之间的变化,生成与残差动作自然耦合的紧凑潜在动力学。
  • 将残差动作建模以最小修改且无需额外超参数的方式集成到Dreamer风格的潜在动力学模型中。

方法

ResWM用残差动作(相对于上一步的增量调整)替代绝对动作,并使用观测差异编码器建模帧间变化。它集成到Dreamer风格的潜在动力学模型中,想象展开和策略优化均在残差动作空间中进行,从而实现更平滑的探索和更低的控制方差。

关键结果

在DeepMind Control Suite上,ResWM在样本效率、渐近回报和控制平滑性方面均取得一致改进,显著超越Dreamer和TD-MPC。它还生成更稳定且节能的动作轨迹。

局限性

  • 该方法假设控制具有平滑性(真实世界机器人固有),这可能不适用于需要突然或不连续动作的任务。
  • 评估仅限于模拟环境(DeepMind Control Suite);真实世界机器人部署可能引入此处未解决的额外挑战。

标签