Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

梦见多重世界:学习上下文世界模型助力零样本泛化

arXiv 24.3 2024 81.3 method

TLDR

提出cRSSM,一种Dreamer的上下文世界模型,提升上下文RL中零样本泛化。

评分理由

Strengths include a clear problem formulation and a novel modification to a well-known world model, with empirical validation on two tasks. Weaknesses are limited evaluation scope (only two tasks) and reliance on observable context, which may not hold in more complex settings.

Read-first 评分解释

综合优先阅读分 81.3,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 50。

方法质量 25%
100

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:分析、基线、基准、评估、实验

可复现性 25%
81

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:有;数据:无;命中信号:代码、GitHub

近期性 8%
75.1

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2024

主题相关性 42%
71.4

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

研究版图角色

方法锚点复现锚点

排序敏感性

稳定性:volatile;排名波动范围:13。

关键词评分

world model
10
model-based reinforcement learning world model
10
generative world model
9
world dynamics prediction
9
world simulator
7
interactive world model
5
video world model
0

深度分析

创新点

  • 提出了上下文循环状态空间模型(cRSSM),该模型修改了Dreamer v3,以结合上下文来推断潜在马尔可夫状态并建模潜在动力学。
  • 证明了系统性地整合上下文能提升在世界模型梦境上训练的策略的零样本泛化(ZSG)能力。
  • 定性展示了该方法将潜在状态与上下文解耦,从而能够将梦境外推到未见上下文。

方法

本文引入了cRSSM,这是对Dreamer v3世界模型的修改,显式地将潜在状态推断和动力学条件化于可观测的上下文值(如质量或尺寸)。该模型在CARL基准套件的两个任务上进行训练和评估,该套件专为上下文强化学习设计。策略在世界模型生成的想象轨迹(“梦境”)上训练,并通过在未见上下文值上测试来度量零样本泛化。

关键结果

实验表明,将上下文纳入世界模型显著提升了学习策略的零样本泛化能力,优于基线Dreamer v3。定性分析显示,cRSSM学会了将潜在状态与上下文解耦,使得模型能够为未见上下文生成准确的梦境。

局限性

  • 该方法假设上下文值可观测,这在许多真实场景中可能不成立。
  • 评估仅限于CARL基准套件中的两个任务,更广泛的泛化性尚未验证。
  • 本文处理的是上下文强化学习的简化设置,而非完全未知动力学的零样本泛化挑战。

标签