Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

WorldReasonBench:作为未来世界状态预测器的视频生成器的人类对齐压力测试

arXiv 2026 65.9 benchmark

TLDR

提出WorldReasonBench基准,测试视频生成器作为世界状态预测器,揭示视觉合理性与推理差距。

评分理由

Strengths: Novel benchmark with structured QA and human-aligned evaluation, covering multiple reasoning dimensions. Weaknesses: Limited to 436 test cases; no discussion of scalability or generalization to diverse domains.

Read-first 评分解释

综合优先阅读分 65.9,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 47。

近期性 6%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

方法质量 18%
80

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基准、评估、结果

引用影响力 18%
75.1

使用 OpenAlex 形态的引用元数据作为文献关注度信号,并与论文本身质量分开处理。 归一化引用分位:0.75056323

可复现性 18%
73

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:有;数据:无;命中信号:GitHub

主题相关性 29%
67.1

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

引用速度 12%
0

引用速度按发表年限估算年均引用,降低旧论文天然占优的偏差。 年均引用:0.00

研究版图角色

基础论文前沿论文桥接论文方法锚点复现锚点

排序敏感性

稳定性:volatile;排名波动范围:429。

关键词评分

video world model
9
world dynamics prediction
9
world simulator
8
world model
7
generative world model
7
interactive world model
6
model-based reinforcement learning world model
1

深度分析

创新点

  • WorldReasonBench:将视频生成评估重新定义为世界状态预测,测试物理、社会、逻辑和信息一致性。
  • 双部分人类对齐评估方法:过程感知推理验证(结构化QA和推理阶段诊断)和多维质量评估(推理质量、时间一致性、视觉美学)。
  • WorldRewardBench:包含约6K专家标注对(覆盖1.4K视频)的偏好基准,支持成对和点式奖励模型评估。
  • 发现现代视频生成器中视觉合理性与世界推理之间存在持续差距。

方法

WorldReasonBench包含436个精心策划的测试案例,配有结构化真实QA标注,涵盖四个推理维度(物理、社会、逻辑、信息)和22个子类别。评估采用双部分方法:过程感知推理验证通过结构化QA和推理阶段诊断检测时间和因果失败,多维质量评估对推理质量、时间一致性和视觉美学进行评分,用于排序和奖励建模。此外,WorldRewardBench提供约6K专家标注的偏好对(覆盖1.4K视频),支持奖励模型评估。

关键结果

在现代视频生成器中,结果揭示了视觉合理性与世界推理之间的持续差距:视频可能看起来令人信服,但在动态、因果关系或信息保存方面失败。

局限性

  • 基准规模限于436个测试案例,可能无法涵盖真实世界场景的全部多样性。
  • 评估依赖结构化真实QA标注,可能引入主观性且扩展成本高。
  • 基准仅覆盖四个推理维度(物理、社会、逻辑、信息)和22个子类别,可能遗漏世界模拟的其他方面。

技术栈

Seedance2.0Veo3.1WorldReasonBenchWorldRewardBenchProcess-aware Reasoning VerificationMulti-dimensional Quality Assessment

标签

video generationbenchmarkworld-state predictionreasoningconsistencyevaluationCV