VAGEN:强化多轮VLM智能体的世界模型推理
TLDR
VAGEN使用强化学习训练VLM智能体进行显式视觉状态推理,分解为状态估计和转换建模,实现3倍提升。
评分理由
The paper presents a novel RL-based approach for world model reasoning in VLM agents, with clear methodology and strong empirical results across multiple benchmarks. However, the abstract lacks details on generalization to other modalities or tasks, and the reliance on specific reasoning formats may limit applicability.
Read-first 评分解释
综合优先阅读分 53.3,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 33。
研究版图角色
前沿论文
排序敏感性
稳定性:volatile;排名波动范围:324。
关键词评分
深度分析
创新点
- 通过强化学习(RL)在架构上强制并奖励VLM智能体的推理过程
- 将问题形式化为部分可观测马尔可夫决策过程(POMDP)
- 将推理分解为状态估计和转换建模
- 世界建模奖励提供密集的回合级监督以实现准确的状态预测
- 用于回合感知信用分配的双层广义优势估计(Bi-Level GAE)
方法
本文提出了VAGEN,一个可扩展的框架,用于使用强化学习训练多轮VLM智能体。智能体的推理被分解为状态估计和转换建模,并设计了世界建模奖励以提供密集监督。引入了双层广义优势估计(Bi-Level GAE)用于回合感知信用分配。该方法使用3B参数模型在五个不同的智能体基准上进行了评估。
关键结果
一个3B参数模型在五个基准上取得了0.82的分数,相比未训练版本(0.21)提升了3倍,并优于专有模型如GPT-5(0.75)、Gemini 2.5 Pro(0.67)和Claude 4.5(0.62)。
技术栈
VAGEN框架强化学习POMDPBi-Level GAEWorld Modeling Reward