Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

使用合成先验训练的Transformer的一次性世界模型

arXiv 24.9 2024 54.8 method

TLDR

提出OSWM,一种基于合成数据上下文学习的Transformer,用1k步适应简单环境。

评分理由

Strengths: novel use of synthetic prior and in-context learning for world models, enabling quick adaptation. Weaknesses: limited to simple environments, no real-world validation, and transfer to complex environments remains challenging.

Read-first 评分解释

综合优先阅读分 54.8,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 48。

近期性 8%
75.1

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2024

主题相关性 42%
68.6

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

方法质量 25%
50

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:无

可复现性 25%
30

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:无

研究版图角色

候选论文

排序敏感性

稳定性:volatile;排名波动范围:434。

关键词评分

world model
10
world dynamics prediction
9
model-based reinforcement learning world model
8
world simulator
7
interactive world model
7
generative world model
6
video world model
1

深度分析

创新点

  • 提出一次性世界模型(OSWM),一种完全通过上下文学习从合成数据中学习的Transformer世界模型,无需真实环境观测。
  • 使用由多个随机初始化的神经网络组成的先验,对每个状态和奖励维度的动态进行建模,从而能够泛化到新环境。
  • 采用Prior-Fitted Networks的监督学习过程,通过掩码实现从有限上下文进行概率预测。

方法

OSWM是一种Transformer,以上下文学习方式在从随机初始化神经网络的先验分布中采样的合成数据上进行训练。训练过程随机掩码上下文位置中的下一状态和奖励,并基于剩余的转移上下文查询模型进行概率预测,遵循Prior-Fitted Networks方法。

关键结果

仅用1,000个转移步骤作为上下文,OSWM快速适应简单网格世界、CartPole gym和自定义控制环境,并成功训练出解决环境的智能体策略。

局限性

  • 迁移到更复杂的环境仍然是一个挑战。
  • 该方法目前仅限于相对简单的环境,可能无法扩展到高维或复杂动态。

标签