面向强化学习任务泛化的Task Aware Dreamer
TLDR
提出Task Aware Dreamer (TAD),将奖励信息特征融入世界模型,实现强化学习任务泛化。
评分理由
The paper presents a novel method (TAD) that extends world models to handle task generalization by incorporating reward information, supported by a new metric (TDR) and theoretical justification. However, the experiments are limited to simulated environments, and the approach assumes similar dynamics across tasks, which may restrict real-world applicability.
Read-first 评分解释
综合优先阅读分 56.1,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 39。
研究版图角色
方法锚点
排序敏感性
稳定性:volatile;排名波动范围:132。
关键词评分
深度分析
创新点
- 证明训练通用世界模型可以利用任务间的相似结构来提升泛化能力。
- 提出Task Aware Dreamer (TAD),整合奖励信息特征以识别跨任务的一致潜在特征。
- 计算变分下界,引入一个新项通过状态区分任务作为优化目标。
- 提出任务分布相关性 (TDR) 指标,定量衡量不同任务的相关性。
- 说明马尔可夫策略难以区分高TDR任务,从而论证TAD中奖励信息策略的必要性。
方法
TAD将世界模型扩展到任务泛化,通过将奖励信息特征融入潜在表示。它优化样本数据对数似然的变分下界,增加一个基于状态区分任务的项。该方法在基于图像和基于状态的任务上进行评估,并使用TDR指标分析任务相关性。
关键结果
大量实验表明,TAD在同时处理不同任务时性能显著提升,尤其是高TDR任务,并展现出对未见任务的强大泛化能力。
局限性
- 该方法需要在训练期间访问奖励函数以融入奖励信息特征,这在某些设置中可能不可用。