Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

扩散模型用于世界建模:视觉细节在Atari中的重要性

NeurIPS 24 2024 78.4 method, application

TLDR

DIAMOND使用扩散模型进行Atari世界建模,通过改进视觉细节达到最先进性能。

评分理由

The paper introduces a novel application of diffusion models to world modeling, demonstrating clear performance gains on the Atari 100k benchmark. Its strengths include a strong empirical evaluation and a demonstration of interactive world models, but it is limited to relatively simple game environments and does not address scalability to more complex domains.

Read-first 评分解释

综合优先阅读分 78.4,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 62。

主题相关性 42%
88.6

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

可复现性 25%
81

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:有;数据:无;命中信号:代码、GitHub

近期性 8%
75.1

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2024

方法质量 25%
60

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基准、指标

研究版图角色

复现锚点

排序敏感性

稳定性:volatile;排名波动范围:45。

关键词评分

world model
10
world simulator
9
generative world model
9
world dynamics prediction
9
model-based reinforcement learning world model
9
interactive world model
8
video world model
8

深度分析

创新点

  • 提出了DIAMOND,一种在扩散世界模型中训练的强化学习智能体,标志着从离散潜变量世界模型到基于扩散的世界模型的范式转变。
  • 证明了世界模型中改进的视觉细节能提升智能体性能,挑战了压缩为紧凑离散表示的做法。
  • 在Atari 100k基准测试上取得了1.46的平均人类归一化得分,这是完全在世界模型内训练的智能体的新最佳成绩。
  • 展示了扩散世界模型可以通过在静态Counter-Strike: Global Offensive游戏数据上训练,独立作为交互式神经游戏引擎。

方法

DIAMOND使用扩散模型生成环境动态,取代了传统的离散潜变量方法。智能体完全在此扩散世界模型内进行Atari游戏训练,并使用人类归一化得分作为指标在Atari 100k基准测试上进行评估。此外,世界模型还在静态Counter-Strike: Global Offensive游戏数据上训练,以展示其独立的交互能力。

关键结果

DIAMOND在Atari 100k基准测试上取得了1.46的平均人类归一化得分,为完全在世界模型内训练的智能体设立了新的最先进水平。

技术栈

Diffusion modelsReinforcement learningAtari 100k benchmarkCounter-Strike: Global Offensive

标签