YoCausal:从因果视角看视频生成离世界模型还有多远?
TLDR
YoCausal利用反转真实视频评估视频扩散模型的因果理解,揭示时间感知与真实因果的差距。
评分理由
The paper introduces a novel benchmark (YoCausal) with two levels to disentangle temporal bias from causal reasoning, using real-world videos and cognitive science principles. Strengths include a zero-cost counterfactual generation method and evaluation of 13 models; weaknesses are that the benchmark's scalability and human-level comparison details are not fully elaborated in the abstract.
Read-first 评分解释
综合优先阅读分 57.3,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 40。
研究版图角色
排序敏感性
稳定性:volatile;排名波动范围:352。
关键词评分
深度分析
创新点
- 受认知科学中预期违背(VoE)范式启发的两级基准
- 通过去噪损失量化时间箭头感知的反向惊奇指数(RSI)
- 使用视觉语言模型(VLM)将数据集分层为因果和非因果子集的因果认知指数(CCI)
- 通过时间反转真实世界视频零成本生成自然反事实样本
方法
YoCausal是一个两级基准,用于评估视频扩散模型的因果理解。第一级使用反向惊奇指数(RSI),通过比较原始视频和时间反转视频的去噪损失来测量时间箭头感知。第二级引入因果认知指数(CCI),利用视觉语言模型(VLM)将数据集划分为因果和非因果子集,从而将真正的因果推理与时间偏差分离开来。该基准由于使用零成本反转的真实世界视频而具有任意可扩展性。
关键结果
对13个最先进的视频扩散模型的评估表明,感知时间箭头并不意味着理解因果关系,并且与人类水平的因果认知相比仍存在显著差距。