使用合成先验训练的Transformer的一次性世界模型
TLDR
提出OSWM,一种基于合成数据上下文学习的Transformer,用1k步适应简单环境。
评分理由
Strengths: novel use of synthetic prior and in-context learning for world models, enabling quick adaptation. Weaknesses: limited to simple environments, no real-world validation, and transfer to complex environments remains challenging.
Read-first 评分解释
综合优先阅读分 54.8,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 48。
研究版图角色
候选论文
排序敏感性
稳定性:volatile;排名波动范围:434。
关键词评分
深度分析
创新点
- 提出一次性世界模型(OSWM),一种完全通过上下文学习从合成数据中学习的Transformer世界模型,无需真实环境观测。
- 使用由多个随机初始化的神经网络组成的先验,对每个状态和奖励维度的动态进行建模,从而能够泛化到新环境。
- 采用Prior-Fitted Networks的监督学习过程,通过掩码实现从有限上下文进行概率预测。
方法
OSWM是一种Transformer,以上下文学习方式在从随机初始化神经网络的先验分布中采样的合成数据上进行训练。训练过程随机掩码上下文位置中的下一状态和奖励,并基于剩余的转移上下文查询模型进行概率预测,遵循Prior-Fitted Networks方法。
关键结果
仅用1,000个转移步骤作为上下文,OSWM快速适应简单网格世界、CartPole gym和自定义控制环境,并成功训练出解决环境的智能体策略。
局限性
- 迁移到更复杂的环境仍然是一个挑战。
- 该方法目前仅限于相对简单的环境,可能无法扩展到高维或复杂动态。