Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

基于潜在动作的自我改进世界建模

arXiv 26.2 2026 55.6 method

TLDR

SWIRL:利用潜在动作从仅状态序列自我改进的世界建模,结合变分推理和强化学习,在多个基准上取得提升。

评分理由

The paper presents a novel self-improvement approach that avoids costly action-labelled data by treating actions as latent, with theoretical guarantees and strong empirical results across diverse environments. Weaknesses include reliance on RL optimization (GRPO) which may be sample-inefficient, and limited discussion of failure cases or scalability.

Read-first 评分解释

综合优先阅读分 55.6,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 50。

近期性 8%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

主题相关性 42%
71.4

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

方法质量 25%
40

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:无

可复现性 25%
30

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:无

研究版图角色

前沿论文

排序敏感性

稳定性:volatile;排名波动范围:589。

关键词评分

world model
9
world dynamics prediction
9
generative world model
8
interactive world model
7
world simulator
6
model-based reinforcement learning world model
6
video world model
5

深度分析

创新点

  • 将动作视为世界建模中的潜在变量,从而无需动作标签即可从仅状态序列中学习。
  • 在前向世界建模(FWM)与逆动力学建模(IDM)之间交替进行自我改进循环。
  • 使用变分信息最大化更新FWM,通过最大化给定先前状态下潜在动作与下一状态的条件互信息。
  • 使用ELBO最大化更新IDM以解释观测到的转移,有效执行坐标上升。
  • 使用强化学习(GRPO)训练两个模型,以对方冻结模型的对数概率作为奖励信号。
  • 为两种更新提供理论可学习性保证。

方法

SWIRL是一种自我改进框架,通过将动作视为潜在变量,从仅状态序列中学习世界模型。它迭代两个阶段:(1)变分信息最大化更新前向世界模型(FWM),以生成使给定先前状态下潜在动作的条件互信息最大化的下一状态;(2)ELBO最大化更新逆动力学模型(IDM)以解释观测到的转移。两个模型均使用强化学习(GRPO)进行训练,以对方冻结模型的对数概率作为奖励信号。

关键结果

SWIRL在AURORABench上提升16%,在ByteMorph上提升28%,在WorldPredictionBench上提升16%,在StableToolBench上提升14%,涵盖LLM和VLM环境,包括单轮和多轮开放世界视觉动态以及用于物理、网络和工具调用的合成文本环境。

技术栈

GRPOLLMsVLMsFWMIDM

标签