VideoVerse:你的文本到视频生成器距离世界模型还有多远?
TLDR
VideoVerse基准评估T2V模型的时间因果性和世界知识,揭示世界模型能力差距。
评分理由
Strengths include a comprehensive benchmark with 300 prompts and 793 evaluation questions, using human-aligned QA to assess world knowledge and temporal causality. Weaknesses are the focus solely on text-to-video generation, lacking interactive or RL-based world model evaluation.
Read-first 评分解释
综合优先阅读分 38.3,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 37。
研究版图角色
前沿论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:207。
关键词评分
深度分析
创新点
- 引入VideoVerse基准,评估T2V模型在复杂时间因果性和世界知识方面的能力
- 设计涵盖动态和静态属性的十个评估维度
- 开发基于人类偏好对齐的问答评估流水线,利用现代视觉语言模型
方法
VideoVerse收集跨多个领域的代表性视频,提取具有内在时间因果性的事件级描述,并由独立标注员将其改写为文本到视频提示。针对每个提示,设计涵盖动态和静态属性的十个评估维度,最终得到300个提示、815个事件和793个评估问题。开发基于人类偏好对齐的问答评估流水线,利用现代视觉语言模型系统地对领先的开源和闭源T2V系统进行基准测试。
关键结果
该基准揭示了当前T2V模型与期望的世界建模能力之间存在显著差距,特别是在理解复杂时间因果性和世界知识方面。