WorldReasonBench:作为未来世界状态预测器的视频生成器的人类对齐压力测试
TLDR
提出WorldReasonBench基准,测试视频生成器作为世界状态预测器,揭示视觉合理性与推理差距。
评分理由
Strengths: Novel benchmark with structured QA and human-aligned evaluation, covering multiple reasoning dimensions. Weaknesses: Limited to 436 test cases; no discussion of scalability or generalization to diverse domains.
Read-first 评分解释
综合优先阅读分 65.9,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 47。
研究版图角色
基础论文前沿论文桥接论文方法锚点复现锚点
排序敏感性
稳定性:volatile;排名波动范围:429。
关键词评分
深度分析
创新点
- WorldReasonBench:将视频生成评估重新定义为世界状态预测,测试物理、社会、逻辑和信息一致性。
- 双部分人类对齐评估方法:过程感知推理验证(结构化QA和推理阶段诊断)和多维质量评估(推理质量、时间一致性、视觉美学)。
- WorldRewardBench:包含约6K专家标注对(覆盖1.4K视频)的偏好基准,支持成对和点式奖励模型评估。
- 发现现代视频生成器中视觉合理性与世界推理之间存在持续差距。
方法
WorldReasonBench包含436个精心策划的测试案例,配有结构化真实QA标注,涵盖四个推理维度(物理、社会、逻辑、信息)和22个子类别。评估采用双部分方法:过程感知推理验证通过结构化QA和推理阶段诊断检测时间和因果失败,多维质量评估对推理质量、时间一致性和视觉美学进行评分,用于排序和奖励建模。此外,WorldRewardBench提供约6K专家标注的偏好对(覆盖1.4K视频),支持奖励模型评估。
关键结果
在现代视频生成器中,结果揭示了视觉合理性与世界推理之间的持续差距:视频可能看起来令人信服,但在动态、因果关系或信息保存方面失败。
局限性
- 基准规模限于436个测试案例,可能无法涵盖真实世界场景的全部多样性。
- 评估依赖结构化真实QA标注,可能引入主观性且扩展成本高。
- 基准仅覆盖四个推理维度(物理、社会、逻辑、信息)和22个子类别,可能遗漏世界模拟的其他方面。
技术栈
Seedance2.0Veo3.1WorldReasonBenchWorldRewardBenchProcess-aware Reasoning VerificationMulti-dimensional Quality Assessment