Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

PhysicsMind:面向基础视觉语言模型和世界模型的物理推理与预测的仿真与真实力学基准

arXiv 26.1 2026 59.7 benchmark

TLDR

PhysicsMind是一个统一基准,包含真实与模拟环境,用于评估视觉语言模型和世界模型的物理推理与预测。

评分理由

The paper introduces a novel benchmark that combines real and simulated data to test physical law consistency, addressing fragmentation in existing benchmarks. Its strengths include a focused evaluation on three canonical physics principles and both VQA and video generation tasks. Weaknesses are that it only evaluates existing models without proposing new methods, and the data is not yet publicly available.

Read-first 评分解释

综合优先阅读分 59.7,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 36。

近期性 8%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

方法质量 25%
90

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基准、评估、指标、验证

主题相关性 42%
51.4

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

可复现性 25%
30

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:无

研究版图角色

前沿论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:383。

关键词评分

world model
8
video world model
7
world dynamics prediction
7
generative world model
6
world simulator
5
interactive world model
2
model-based reinforcement learning world model
1

深度分析

创新点

  • 引入了PhysicsMind,一个结合真实和仿真环境的统一基准,用于评估基础视觉语言模型和世界模型的物理推理与生成。
  • 聚焦于三个经典物理原理:质心、杠杆平衡和牛顿第一定律。
  • 定义了两个互补任务:VQA(从图像/视频中推理物理量)和视频生成(评估轨迹是否符合物理定律)。
  • 对广泛的最新多模态大语言模型和视频生成模型进行了系统评估,揭示了它们依赖外观启发式并频繁违反基本力学的问题。

方法

PhysicsMind是一个包含真实和仿真环境的基准,旨在测试在三个经典原理(质心、杠杆平衡和牛顿第一定律)上符合定律的推理和生成。它包括两个主要任务:VQA任务,评估模型从图像或短视频中推理物理量的能力;视频生成任务,评估预测的运动轨迹是否与真实值一样遵循相同的物理约束。该基准评估了广泛的最新多模态大语言模型和视频生成模型,使用将模型输出与真实物理量和轨迹进行比较的指标。

关键结果

被评估的模型被发现依赖外观启发式,同时经常违反基本力学,表明当前的规模扩展和训练不足以实现稳健的物理理解。

局限性

  • 基准仅限于三个经典物理原理(质心、杠杆平衡、牛顿第一定律),可能无法涵盖物理推理的全部范围。
  • 数据和环境尚未公开(将在接收后发布),限制了即时的可重复性和外部验证。
  • 评估聚焦于特定任务(VQA和视频生成),可能无法捕捉现实场景中更深层或更复杂的物理交互。

标签