语言条件的世界模型通过阅读环境描述提升策略泛化能力
TLDR
语言条件的世界模型通过将语言与观测对齐来提升策略泛化,无需规划或专家演示。
评分理由
The paper proposes LED-WM, a model-based RL approach that uses a language-conditioned world model to improve policy generalization to unseen games, dropping assumptions of planning or expert demonstrations. Strengths include explicit language grounding via attention and empirical generalization results; weaknesses are the lack of real-world validation and reliance on simulated environments.
Read-first 评分解释
综合优先阅读分 60.3,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 48。
研究版图角色
前沿论文
排序敏感性
稳定性:volatile;排名波动范围:280。
关键词评分
深度分析
创新点
- 提出了语言感知编码器世界模型(LED-WM),采用注意力机制将语言描述显式地锚定到观测中的实体上。
- 基于模型的强化学习方法,通过环境交互训练语言条件的世界模型,并从中学习策略,无需规划或专家演示。
- 展示了在现实部署前,通过在世界模型生成的合成测试轨迹上进行微调来改进策略。
方法
该方法基于DreamerV3,使用带有语言感知编码器(LED-WM)的语言条件世界模型,该编码器采用注意力机制将语言描述锚定到观测中的实体上。世界模型通过与环境交互进行训练,并从中学习策略,无需规划或专家演示。在MESSENGER和MESSENGER-WM环境中进行评估。
关键结果
使用LED-WM训练的策略相比其他基线,能更有效地泛化到由新动态和语言描述的未见游戏。此外,可以通过在世界模型生成的合成测试轨迹上进行微调来改进策略。