WorldModelBench:评判视频生成模型作为世界模型
TLDR
提出WorldModelBench,通过物理一致性和指令遵循评估视频生成模型的世界建模能力,并利用人类标签微调评判器。
评分理由
Strengths include a novel benchmark addressing overlooked world modeling aspects like physics adherence, with large-scale human labels and an automated judger. Weaknesses: limited to video generation models and does not evaluate interactive or real-time decision-making.
Read-first 评分解释
综合优先阅读分 64.5,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 55。
研究版图角色
前沿论文
排序敏感性
稳定性:volatile;排名波动范围:293。
关键词评分
深度分析
创新点
- WorldModelBench,一个旨在评估视频生成模型在应用驱动领域的世界建模能力的基准,重点关注指令遵循和物理一致性。
- 检测细微的世界建模违规,例如违反质量守恒定律的物体尺寸不规则变化,这些是先前基准所忽略的问题。
- 众包67K个人类标签以评估14个前沿模型,从而能够准确测量世界建模违规。
- 微调一个2B参数的评判器,在预测世界建模违规方面平均准确率比GPT-4o高出8.6%。
- 证明通过最大化评判器的奖励来训练与人类标注对齐,可以显著提升世界建模能力。
方法
WorldModelBench引入指令遵循和物理一致性维度来评估视频生成模型。作者众包了67K个人类标签以评估14个前沿模型,然后利用这些标签微调了一个2B参数的评判器来自动化评估,其准确率高于GPT-4o。
关键结果
微调后的评判器在预测世界建模违规方面平均准确率比GPT-4o高出8.6%(2B参数)。此外,通过最大化评判器的奖励来训练与人类标注对齐,可以显著提升世界建模能力。
技术栈
WorldModelBenchGPT-4o2B参数评判器67K人类标签视频生成模型