Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

VAGEN:强化多轮VLM智能体的世界模型推理

arXiv 25.10 2025 53.3 method

TLDR

VAGEN使用强化学习训练VLM智能体进行显式视觉状态推理,分解为状态估计和转换建模,实现3倍提升。

评分理由

The paper presents a novel RL-based approach for world model reasoning in VLM agents, with clear methodology and strong empirical results across multiple benchmarks. However, the abstract lacks details on generalization to other modalities or tasks, and the reliance on specific reasoning formats may limit applicability.

Read-first 评分解释

综合优先阅读分 53.3,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 33。

近期性 8%
86.7

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2025

方法质量 25%
60

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基准、实验

主题相关性 42%
47.1

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

可复现性 25%
46

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:代码、GitHub

研究版图角色

前沿论文

排序敏感性

稳定性:volatile;排名波动范围:324。

关键词评分

world model
9
world dynamics prediction
7
model-based reinforcement learning world model
6
interactive world model
5
generative world model
3
world simulator
2
video world model
1

深度分析

创新点

  • 通过强化学习(RL)在架构上强制并奖励VLM智能体的推理过程
  • 将问题形式化为部分可观测马尔可夫决策过程(POMDP)
  • 将推理分解为状态估计和转换建模
  • 世界建模奖励提供密集的回合级监督以实现准确的状态预测
  • 用于回合感知信用分配的双层广义优势估计(Bi-Level GAE)

方法

本文提出了VAGEN,一个可扩展的框架,用于使用强化学习训练多轮VLM智能体。智能体的推理被分解为状态估计和转换建模,并设计了世界建模奖励以提供密集监督。引入了双层广义优势估计(Bi-Level GAE)用于回合感知信用分配。该方法使用3B参数模型在五个不同的智能体基准上进行了评估。

关键结果

一个3B参数模型在五个基准上取得了0.82的分数,相比未训练版本(0.21)提升了3倍,并优于专有模型如GPT-5(0.75)、Gemini 2.5 Pro(0.67)和Claude 4.5(0.62)。

技术栈

VAGEN框架强化学习POMDPBi-Level GAEWorld Modeling Reward

标签