Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

通过测试时缩放探究世界模型在空间推理中的有效性

World Modeling Workshop 26 2026 73.5 method, application

TLDR

探究世界模型测试时验证器,发现缺陷并提出ViSA,在SAT-Real有效但MMSI-Bench无效

评分理由

The paper provides a systematic analysis of test-time verifiers for world models, identifying calibration issues and action biases, and proposes a principled verification framework (ViSA) that shows improvement on one benchmark but fails on another, highlighting world model bottlenecks. Strengths include rigorous empirical evaluation and clear identification of limitations; weaknesses include limited generalizability and reliance on existing world models.

Read-first 评分解释

综合优先阅读分 73.5,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 46。

近期性 8%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

可复现性 25%
81

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:有;数据:无;命中信号:代码、GitHub

方法质量 25%
70

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基准、实验

主题相关性 42%
65.7

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

研究版图角色

前沿论文方法锚点复现锚点

排序敏感性

稳定性:volatile;排名波动范围:114。

关键词评分

world model
10
generative world model
8
interactive world model
7
world dynamics prediction
7
world simulator
6
video world model
5
model-based reinforcement learning world model
3

深度分析

创新点

  • 引入基于空间断言的验证(ViSA)框架,将测试时奖励建立在可验证的、以帧为锚点的微断言上
  • 系统性地审视了基于世界模型的空间推理的测试时验证器,揭示了校准不良、动作偏差和不可靠的奖励信号
  • 基于不确定性的分析表明,MindJourney的验证器几乎没有提供有意义的校准,且随机评分同样能降低答案熵

方法

本研究审视了MindJourney的测试时缩放方法,其中世界模型生成动作条件轨迹,启发式验证器选择有用的视图。通过基于不确定性的分析,评估了验证器行为,并提出了ViSA,该框架将奖励建立在以帧为锚点的微断言上。实验在SAT-Real和MMSI-Bench基准上进行。

关键结果

ViSA在SAT-Real基准上持续改善了空间推理,并纠正了轨迹选择偏差,但在MMSI-Bench上,所有验证器均未实现一致的缩放,表明当前世界模型形成了信息瓶颈。

局限性

  • 当前世界模型形成了信息瓶颈,想象视图无法丰富细粒度推理
  • MindJourney的验证器表现出校准不良、系统性动作偏差和不可靠的奖励信号
  • 在MMSI-Bench上,没有验证器(包括ViSA)实现一致的缩放

标签