用想象力思考:基于世界模拟器的智能体视觉空间推理
TLDR
Astra将VLM策略与世界模拟器结合,通过强化学习和视角一致性调优实现智能体空间推理,提升跨视角一致性。
评分理由
Strengths include a novel integration of world simulators with VLMs for spatial reasoning, a two-phase RL curriculum, and view consistency tuning. Weaknesses are the abstract being cut off, limited evaluation to one benchmark (MMSI-Bench), and potential lack of generalization to diverse real-world scenarios.
Read-first 评分解释
综合优先阅读分 68.8,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 56。
研究版图角色
排序敏感性
稳定性:volatile;排名波动范围:390。
关键词评分
深度分析
创新点
- 提出智能体空间推理框架Astra,通过将强化学习训练的VLM策略(Astra-VL)与世界模拟器(Astra-WM)耦合,赋予VLM基于动作的视觉想象能力。
- Astra-WM:基于Bagel的世界模拟器,采用视角一致性调优训练,能从上下文图像和自然语言相机运动生成新视角观测,提升姿态与内容一致性。
- 提出世界模拟器在环的两阶段强化学习课程,稳定工具使用探索,并教会模型何时调用模拟器而非直接回答。
- 证明世界模拟器与智能体策略对有效空间推理均不可或缺,在MMSI-Bench和MindCube上取得量化提升。
方法
本文提出Astra智能体空间推理框架,包含Astra-VL(强化学习训练的VLM策略)和Astra-WM(基于Bagel的世界模拟器)。Astra-WM从上下文图像和自然语言相机运动生成新视角观测,并通过视角一致性调优训练确保姿态与内容一致性。强化学习阶段采用世界模拟器在环的两阶段课程,稳定探索并学习何时调用模拟器。在MMSI-Bench和MindCube基准上评估,与Gemini-3-Flash和Qwen3-VL等基线对比。
关键结果
Astra-WM将模拟器增强的Gemini-3-Flash在MMSI-Bench上的性能从45.1提升至49.5;Astra-VL将Qwen3-VL骨干在MMSI-Bench上从29.8提升至38.8,在MindCube上从36.8提升至42.7。
局限性
- 世界模拟器(Astra-WM)的视角一致性仍不完美,需通过视角一致性调优缓解问题。
- 强化学习课程对稳定工具使用探索是必要的,表明无课程时训练可能不稳定或无效。
- 未在MMSI-Bench和MindCube之外的基准上验证泛化性,且方法依赖学习型模拟器,可能限制其在难以生成新视角领域的应用。