利用离散世界模型掌握Atari游戏
TLDR
DreamerV2使用离散世界模型,通过完全从潜在预测中学习行为,在Atari上达到人类水平性能。
评分理由
The paper presents a strong contribution with DreamerV2, the first agent to reach human-level on Atari using a separately trained world model. Its strengths include clear methodology and impressive results on 55 tasks, but it lacks real-world validation as all experiments are in simulation.
Read-first 评分解释
综合优先阅读分 66.4,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 53。
研究版图角色
复现锚点
排序敏感性
稳定性:volatile;排名波动范围:291。
关键词评分
深度分析
创新点
- 在强化学习的世界模型中引入离散表示
- 完全从单独训练的世界模型的紧凑潜在空间中的预测学习行为
- 首个使用世界模型在全部55个任务的Atari基准上达到人类水平性能的智能体
方法
DreamerV2采用具有离散潜在表示的世界模型,与策略分开训练。智能体通过完全在此紧凑潜在空间内预测结果来学习行为。它在55个任务的Atari基准上进行评估,使用与顶级单GPU智能体相同的计算预算和挂钟时间,达到2亿帧。
关键结果
DreamerV2在所有55个Atari任务上达到人类水平性能,并超越了IQN和Rainbow的最终性能。它还为连续动作任务学习了准确的世界模型,从像素输入解决了人形机器人的站立和行走问题。