掩码扩散语言模型是强健且可引导的基于文本的世界模型,用于智能体强化学习
TLDR
掩码扩散语言模型作为可引导文本世界模型,在智能体RL中优于更大自回归模型,有更好连贯性和多样性。
评分理由
The paper introduces a novel steerable text-based world model using masked diffusion language models, with strong empirical evidence across multiple environments and agent backbones. However, its focus on text-based domains limits generalizability to other modalities like video, and the reliance on curated trajectories may not capture all real-world dynamics.
Read-first 评分解释
综合优先阅读分 52.9,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 54。
研究版图角色
排序敏感性
稳定性:volatile;排名波动范围:753。
关键词评分
深度分析
创新点
- 将基于文本的世界建模形式化为一个可引导的转移动力学问题,分解为初始状态、任务上下文、工具模式、领域规则和引导指令。
- 提出掩码扩散语言模型(MDLM)作为双向、锚点感知的世界模型,以克服自回归模型的从左到右偏差。
- 引入一个即插即用的GRPO训练框架,包含确定性状态检查。
- 整理了来自九个开源环境和十二个前沿模型家族的239,403条经过验证的状态-动作轨迹数据集。
- 证明MDLM在连贯性、可验证性和rollout多样性方面优于参数规模大4倍的LLM,并在零样本OOD迁移中实现高达47%的绝对增益。
方法
作者将基于文本的世界建模形式化为一个可引导的转移动力学问题,然后整理了一个大规模的经过验证的轨迹数据集。他们比较了自回归语言模型和掩码扩散语言模型(MDLM)作为世界模型,使用包含确定性状态检查的GRPO框架进行训练,并在三个分布外环境(ScienceWorld、ALFWorld、AppWorld)上使用三个智能体主干(LFM2.5、Qwen3、Mistral)评估零样本迁移。
关键结果
MDLM在连贯性、可验证性和rollout多样性方面优于参数规模大4倍的LLM,且推理延迟相当;在零样本迁移到OOD环境时,相较于基线实现了高达47%的绝对增益,无需针对特定环境进行微调。
局限性
- 行为分析揭示了对抗场景下的失败模式。