Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

世界模型

NIPS 2018 Oral 2018 52.5 method

TLDR

强化学习环境的生成式神经网络模型实现了无监督学习以及在幻觉梦境中训练智能体。

评分理由

Strengths include unsupervised learning and dream training for efficient policy transfer. Weaknesses: limited to simulated environments, no real-world validation.

Read-first 评分解释

综合优先阅读分 52.5,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 51。

主题相关性 42%
72.9

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

方法质量 25%
40

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:无

可复现性 25%
38

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:GitHub

近期性 8%
31.9

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2018

研究版图角色

候选论文

排序敏感性

稳定性:volatile;排名波动范围:554。

关键词评分

world model
10
generative world model
9
model-based reinforcement learning world model
9
world simulator
8
world dynamics prediction
7
interactive world model
5
video world model
3

深度分析

创新点

  • 使用生成式神经网络模型对强化学习环境进行压缩时空表示的无监督学习
  • 使用从世界模型提取的特征训练紧凑且简单的策略
  • 在世界模型生成的自身幻觉梦境中完全训练智能体,并将策略迁移回实际环境

方法

本文提出构建流行强化学习环境的生成式神经网络模型。世界模型以无监督方式快速训练,学习压缩的时空表示。然后使用从该世界模型提取的特征作为输入,训练紧凑且简单的策略智能体。

关键结果

该方法能够训练非常紧凑且简单的策略来解决所需任务。智能体甚至可以在世界模型生成的自身幻觉梦境中完全训练,并且学习到的策略成功迁移回实际环境。

标签