DreamSmooth: 通过奖励平滑改进基于模型的强化学习
TLDR
DreamSmooth通过平滑奖励预测改进基于模型的强化学习,在稀疏奖励任务上达到最优。
评分理由
The paper addresses a clear bottleneck in MBRL (reward prediction) with a simple, intuitive method. Strengths include strong empirical results on standard benchmarks; weaknesses are that the method's novelty is limited to reward smoothing and it does not introduce new world model architectures.
Read-first 评分解释
综合优先阅读分 43.6,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 25。
研究版图角色
候选论文
排序敏感性
稳定性:volatile;排名波动范围:248。
关键词评分
深度分析
创新点
- 识别出奖励预测是基于模型强化学习的瓶颈,尤其是在稀疏奖励场景下
- 提出DreamSmooth,一种简单有效的奖励平滑方法,预测时间平滑奖励而非精确奖励
- 在长时域稀疏奖励任务上,在样本效率和最终性能方面均达到最先进水平
方法
DreamSmooth修改了基于模型强化学习智能体的奖励预测组件,使其预测时间平滑奖励而非精确即时奖励。该方法在长时域稀疏奖励任务和标准基准(Deepmind Control Suite、Atari)上,与先前的MBRL方法进行对比,评估样本效率和最终性能。
关键结果
DreamSmooth在长时域稀疏奖励任务上,在样本效率和最终性能方面均达到最先进水平,同时在Deepmind Control Suite和Atari等常见基准上保持性能。
局限性
- 论文未明确讨论局限性,但潜在问题包括对平滑超参数的敏感性以及对所学世界模型质量的依赖
- 该方法在不同奖励结构(未在基准中测试)下的有效性可能有所差异