Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

Transformer是样本高效的世界模型

ICLR 23 Oral 2023 68.6 method

TLDR

IRIS使用离散自编码器和自回归Transformer作为世界模型,在Atari 100k上实现样本高效深度强化学习,达到最优性能。

评分理由

The paper presents a novel combination of a discrete autoencoder and Transformer for world modeling, demonstrating strong empirical results on the Atari 100k benchmark. However, the evaluation is limited to simulated Atari games, and the abstract does not mention real-world experiments or broader applicability.

Read-first 评分解释

综合优先阅读分 68.6,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 51。

可复现性 25%
81

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:有;数据:无;命中信号:代码、GitHub

主题相关性 42%
72.9

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

近期性 8%
65.1

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2023

方法质量 25%
50

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基准

研究版图角色

复现锚点

排序敏感性

稳定性:volatile;排名波动范围:192。

关键词评分

world model
10
world dynamics prediction
9
model-based reinforcement learning world model
9
generative world model
8
world simulator
6
interactive world model
5
video world model
4

深度分析

创新点

  • 引入了IRIS,一种数据高效的智能体,它在由离散自编码器和自回归Transformer组成的世界模型中学习
  • 在Atari 100k基准测试中,仅相当于两小时游戏时间,实现了最先进的样本效率
  • 在不使用前瞻搜索的情况下,在26个游戏中超过人类10个

方法

IRIS是一种基于模型的强化学习智能体,它学习一个由离散自编码器(用于编码观测)和自回归Transformer(用于建模环境动态)组成的世界模型。该智能体在Atari 100k基准测试上训练,使用相当于两小时游戏时间的数据,并通过平均人类归一化分数进行评估。

关键结果

IRIS在Atari 100k基准测试上达到了1.046的平均人类归一化分数,在26个游戏中超过人类10个,为没有前瞻搜索的方法设立了新的最先进水平。

标签