基于Transformer的世界模型在10万次交互中表现优异
TLDR
TWM通过自回归处理状态、动作和奖励,在Atari 100k上实现样本高效强化学习。
评分理由
The paper introduces a novel transformer architecture (Transformer-XL) for world modeling that directly attends to past states, improving long-term dependency learning. Its strength lies in achieving state-of-the-art results on the Atari 100k benchmark with only 100k interactions, but it is limited to simulated environments and lacks real-world validation.
Read-first 评分解释
综合优先阅读分 73.9,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 55。
研究版图角色
方法锚点复现锚点
排序敏感性
稳定性:volatile;排名波动范围:110。
关键词评分
深度分析
创新点
- 将Transformer架构应用于强化学习中的世界模型,对潜在状态、动作和奖励进行自回归建模
- 使用Transformer-XL在保持计算效率的同时捕捉世界模型中的长期依赖关系
- 将所有三种模态(潜在状态、动作、奖励)输入Transformer,以实现跨时间步的灵活注意力
方法
本文提出了一种基于Transformer的世界模型(TWM),该模型使用Transformer-XL架构自回归地处理潜在状态、动作和奖励序列。该模型在Atari 100k基准测试的真实世界片段上进行训练,并用于生成合成经验以训练强化学习策略。
关键结果
TWM在Atari 100k基准测试上优于之前的无模型和基于模型的强化学习算法,展示了仅需10万次交互即可实现样本高效的世界建模。
局限性
- 评估仅限于Atari 100k基准测试;未展示对其他环境或任务的泛化能力
- 摘要未讨论基于Transformer方法的潜在计算成本或可扩展性