PROWL:优先遗憾驱动的世界模型学习优化
TLDR
PROWL使用对抗性课程和优先回放来提高视频世界模型在罕见高影响转换上的鲁棒性。
评分理由
The paper introduces a novel adversarial training loop for world models, combining a KL-constrained policy to expose failures and a prioritized buffer to focus on unresolved weaknesses. Strengths include a clear methodology and empirical evaluation in MineRL, but limitations include reliance on a specific simulation environment and potential sensitivity to behavioral constraints.
Read-first 评分解释
综合优先阅读分 61.6,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 57。
研究版图角色
基础论文前沿论文桥接论文
排序敏感性
稳定性:volatile;排名波动范围:481。
关键词评分
深度分析
创新点
- KL约束的对抗性课程,训练一个策略来暴露基于扩散的世界模型的高误差轨迹,同时保持接近行为分布
- 优先对抗轨迹(PAT)缓冲区,根据预测误差、动作保真度和学习进度重新排序轨迹,以聚焦训练于未解决的失败模式
方法
该方法引入了一个KL约束的对抗性课程,其中训练一个策略来发现基于扩散的世界模型的高误差轨迹,同时保持接近行为分布。世界模型在这些对抗性发现的轨迹上持续微调,形成一个对抗性训练循环。优先对抗轨迹(PAT)缓冲区使用预测误差、动作保真度和学习进度重新排序轨迹,以保持对未解决弱点的压力。
关键结果
PROWL在MineRL框架中,在保留的分布外轨迹上,比仅使用被动数据训练的模型提高了鲁棒性,揭示了在弱行为约束下的奖励黑客行为,并表明有效的对抗性世界模型训练关键取决于平衡探索性失败发现与显式行为正则化。