梦见多重世界:学习上下文世界模型助力零样本泛化
TLDR
提出cRSSM,一种Dreamer的上下文世界模型,提升上下文RL中零样本泛化。
评分理由
Strengths include a clear problem formulation and a novel modification to a well-known world model, with empirical validation on two tasks. Weaknesses are limited evaluation scope (only two tasks) and reliance on observable context, which may not hold in more complex settings.
Read-first 评分解释
综合优先阅读分 81.3,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 50。
研究版图角色
方法锚点复现锚点
排序敏感性
稳定性:volatile;排名波动范围:13。
关键词评分
深度分析
创新点
- 提出了上下文循环状态空间模型(cRSSM),该模型修改了Dreamer v3,以结合上下文来推断潜在马尔可夫状态并建模潜在动力学。
- 证明了系统性地整合上下文能提升在世界模型梦境上训练的策略的零样本泛化(ZSG)能力。
- 定性展示了该方法将潜在状态与上下文解耦,从而能够将梦境外推到未见上下文。
方法
本文引入了cRSSM,这是对Dreamer v3世界模型的修改,显式地将潜在状态推断和动力学条件化于可观测的上下文值(如质量或尺寸)。该模型在CARL基准套件的两个任务上进行训练和评估,该套件专为上下文强化学习设计。策略在世界模型生成的想象轨迹(“梦境”)上训练,并通过在未见上下文值上测试来度量零样本泛化。
关键结果
实验表明,将上下文纳入世界模型显著提升了学习策略的零样本泛化能力,优于基线Dreamer v3。定性分析显示,cRSSM学会了将潜在状态与上下文解耦,使得模型能够为未见上下文生成准确的梦境。
局限性
- 该方法假设上下文值可观测,这在许多真实场景中可能不成立。
- 评估仅限于CARL基准套件中的两个任务,更广泛的泛化性尚未验证。
- 本文处理的是上下文强化学习的简化设置,而非完全未知动力学的零样本泛化挑战。