PhyGround:生成式世界模型中的物理推理基准测试
TLDR
PhyGround通过250个提示、13条物理定律和大规模人类研究,对生成式世界模型中的物理推理进行基准测试。
评分理由
The paper's strength lies in its rigorous benchmark design with per-law diagnostics and a large-scale, quality-controlled human study (459 annotators, high split-half reliability). Weaknesses include potential limited coverage of physical laws and lack of explicit discussion on generalizability beyond the selected laws.
Read-first 评分解释
综合优先阅读分 59.6,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 46。
研究版图角色
排序敏感性
稳定性:volatile;排名波动范围:337。
关键词评分
深度分析
创新点
- 基于标准基准,包含250个精心设计的提示,每个提示附带预期物理结果
- 涵盖固体力学、流体动力学和光学的13条物理定律分类体系,通过可观察的子问题实现逐定律诊断
- 基于社会科学实验设计的大规模质量控制人类研究,涉及459名标注员、5796份完整标注和超过3.74万条细粒度标签
- 开源物理专用VLM裁判PhyJudge-9B,其聚合相对偏差(3.3%)显著低于Gemini-3.1-Pro(16.6%)
方法
PhyGround包含250个精心设计的提示,每个提示附带预期物理结果,以及涵盖固体力学、流体动力学和光学的13条物理定律分类体系,通过可观察的子问题实现逐定律诊断。通过大规模人类研究评估了8个现代视频生成模型,涉及459名标注员提供5796份完整标注和超过3.74万条细粒度标签,经质量控制后得到高折半模型排名相关性(Spearman's rho > 0.90)。同时发布了开源物理专用VLM裁判PhyJudge-9B,用于可复现的自动评估。
关键结果
质量控制后的人类标注展现出高折半模型排名相关性(Spearman's rho > 0.90)。PhyJudge-9B的聚合相对偏差(3.3%)显著低于Gemini-3.1-Pro(16.6%)。