World2VLM:将世界模型想象力蒸馏到视觉语言模型中用于动态空间推理
TLDR
通过合成未来视图将生成式世界模型蒸馏到VLM中提升动态空间推理优于测试时耦合方法
评分理由
The paper presents a novel training framework that leverages a world model to generate structured supervision for spatial reasoning, achieving consistent benchmark improvements without inference-time overhead. Strengths include a clear methodology and empirical validation on multiple benchmarks; weaknesses include limited discussion of generalization beyond camera trajectories and potential reliance on synthetic data quality.
Read-first 评分解释
综合优先阅读分 54.3,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 38。
研究版图角色
排序敏感性
稳定性:volatile;排名波动范围:319。
关键词评分
深度分析
创新点
- 通过训练框架将生成式世界模型的空间想象力蒸馏到视觉语言模型中
- 使用视图一致的世界模型合成几何对齐的未来视图,为正向和逆向空间推理提供结构化监督
- 在流水线生成的紧凑数据集上采用两阶段后训练方案
- 证明世界模型不仅可以作为推理时的工具,还可以作为有效的训练时教师
方法
World2VLM使用视图一致的世界模型,根据初始观测和参数化相机轨迹合成几何对齐的未来视图。它推导出正向(动作到结果)和逆向(结果到动作)空间推理的结构化监督。视觉语言模型在流水线生成的紧凑数据集上经过两阶段后训练,并在多个空间推理基准(包括SAT-Real、SAT-Synthesized、VSI-Bench和MindCube)上进行评估。
关键结果
World2VLM在多个基准上相比基础模型取得一致改进,并优于测试时世界模型耦合方法,同时消除了昂贵的推理时生成需求。