Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

面向强化学习任务泛化的Task Aware Dreamer

arXiv 23.3 2023 56.1 method

TLDR

提出Task Aware Dreamer (TAD),将奖励信息特征融入世界模型,实现强化学习任务泛化。

评分理由

The paper presents a novel method (TAD) that extends world models to handle task generalization by incorporating reward information, supported by a new metric (TDR) and theoretical justification. However, the experiments are limited to simulated environments, and the approach assumes similar dynamics across tasks, which may restrict real-world applicability.

Read-first 评分解释

综合优先阅读分 56.1,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 39。

方法质量 25%
80

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基线、实验、指标

近期性 8%
65.1

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2023

主题相关性 42%
55.7

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

可复现性 25%
30

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:无

研究版图角色

方法锚点

排序敏感性

稳定性:volatile;排名波动范围:132。

关键词评分

world model
10
model-based reinforcement learning world model
8
generative world model
7
world dynamics prediction
6
world simulator
5
interactive world model
2
video world model
1

深度分析

创新点

  • 证明训练通用世界模型可以利用任务间的相似结构来提升泛化能力。
  • 提出Task Aware Dreamer (TAD),整合奖励信息特征以识别跨任务的一致潜在特征。
  • 计算变分下界,引入一个新项通过状态区分任务作为优化目标。
  • 提出任务分布相关性 (TDR) 指标,定量衡量不同任务的相关性。
  • 说明马尔可夫策略难以区分高TDR任务,从而论证TAD中奖励信息策略的必要性。

方法

TAD将世界模型扩展到任务泛化,通过将奖励信息特征融入潜在表示。它优化样本数据对数似然的变分下界,增加一个基于状态区分任务的项。该方法在基于图像和基于状态的任务上进行评估,并使用TDR指标分析任务相关性。

关键结果

大量实验表明,TAD在同时处理不同任务时性能显著提升,尤其是高TDR任务,并展现出对未见任务的强大泛化能力。

局限性

  • 该方法需要在训练期间访问奖励函数以融入奖励信息特征,这在某些设置中可能不可用。

标签