基于潜在动作的自我改进世界建模
TLDR
SWIRL:利用潜在动作从仅状态序列自我改进的世界建模,结合变分推理和强化学习,在多个基准上取得提升。
评分理由
The paper presents a novel self-improvement approach that avoids costly action-labelled data by treating actions as latent, with theoretical guarantees and strong empirical results across diverse environments. Weaknesses include reliance on RL optimization (GRPO) which may be sample-inefficient, and limited discussion of failure cases or scalability.
Read-first 评分解释
综合优先阅读分 55.6,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 50。
研究版图角色
排序敏感性
稳定性:volatile;排名波动范围:589。
关键词评分
深度分析
创新点
- 将动作视为世界建模中的潜在变量,从而无需动作标签即可从仅状态序列中学习。
- 在前向世界建模(FWM)与逆动力学建模(IDM)之间交替进行自我改进循环。
- 使用变分信息最大化更新FWM,通过最大化给定先前状态下潜在动作与下一状态的条件互信息。
- 使用ELBO最大化更新IDM以解释观测到的转移,有效执行坐标上升。
- 使用强化学习(GRPO)训练两个模型,以对方冻结模型的对数概率作为奖励信号。
- 为两种更新提供理论可学习性保证。
方法
SWIRL是一种自我改进框架,通过将动作视为潜在变量,从仅状态序列中学习世界模型。它迭代两个阶段:(1)变分信息最大化更新前向世界模型(FWM),以生成使给定先前状态下潜在动作的条件互信息最大化的下一状态;(2)ELBO最大化更新逆动力学模型(IDM)以解释观测到的转移。两个模型均使用强化学习(GRPO)进行训练,以对方冻结模型的对数概率作为奖励信号。
关键结果
SWIRL在AURORABench上提升16%,在ByteMorph上提升28%,在WorldPredictionBench上提升16%,在StableToolBench上提升14%,涵盖LLM和VLM环境,包括单轮和多轮开放世界视觉动态以及用于物理、网络和工具调用的合成文本环境。