Transformer是样本高效的世界模型
TLDR
IRIS使用离散自编码器和自回归Transformer作为世界模型,在Atari 100k上实现样本高效深度强化学习,达到最优性能。
评分理由
The paper presents a novel combination of a discrete autoencoder and Transformer for world modeling, demonstrating strong empirical results on the Atari 100k benchmark. However, the evaluation is limited to simulated Atari games, and the abstract does not mention real-world experiments or broader applicability.
Read-first 评分解释
综合优先阅读分 68.6,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 51。
研究版图角色
复现锚点
排序敏感性
稳定性:volatile;排名波动范围:192。
关键词评分
深度分析
创新点
- 引入了IRIS,一种数据高效的智能体,它在由离散自编码器和自回归Transformer组成的世界模型中学习
- 在Atari 100k基准测试中,仅相当于两小时游戏时间,实现了最先进的样本效率
- 在不使用前瞻搜索的情况下,在26个游戏中超过人类10个
方法
IRIS是一种基于模型的强化学习智能体,它学习一个由离散自编码器(用于编码观测)和自回归Transformer(用于建模环境动态)组成的世界模型。该智能体在Atari 100k基准测试上训练,使用相当于两小时游戏时间的数据,并通过平均人类归一化分数进行评估。
关键结果
IRIS在Atari 100k基准测试上达到了1.046的平均人类归一化分数,在26个游戏中超过人类10个,为没有前瞻搜索的方法设立了新的最先进水平。