Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

YoCausal:从因果视角看视频生成离世界模型还有多远?

arXiv 2026 57.3 benchmark

TLDR

YoCausal利用反转真实视频评估视频扩散模型的因果理解,揭示时间感知与真实因果的差距。

评分理由

The paper introduces a novel benchmark (YoCausal) with two levels to disentangle temporal bias from causal reasoning, using real-world videos and cognitive science principles. Strengths include a zero-cost counterfactual generation method and evaluation of 13 models; weaknesses are that the benchmark's scalability and human-level comparison details are not fully elaborated in the abstract.

Read-first 评分解释

综合优先阅读分 57.3,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 40。

近期性 6%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

引用影响力 18%
88.3

使用 OpenAlex 形态的引用元数据作为文献关注度信号,并与论文本身质量分开处理。 归一化引用分位:0.88296748

方法质量 18%
70

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基准、数据集、评估

主题相关性 29%
57.1

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

可复现性 18%
38

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:数据集

引用速度 12%
0

引用速度按发表年限估算年均引用,降低旧论文天然占优的偏差。 年均引用:0.00

研究版图角色

基础论文前沿论文桥接论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:352。

关键词评分

world model
10
video world model
9
generative world model
7
world dynamics prediction
6
world simulator
5
model-based reinforcement learning world model
2
interactive world model
1

深度分析

创新点

  • 受认知科学中预期违背(VoE)范式启发的两级基准
  • 通过去噪损失量化时间箭头感知的反向惊奇指数(RSI)
  • 使用视觉语言模型(VLM)将数据集分层为因果和非因果子集的因果认知指数(CCI)
  • 通过时间反转真实世界视频零成本生成自然反事实样本

方法

YoCausal是一个两级基准,用于评估视频扩散模型的因果理解。第一级使用反向惊奇指数(RSI),通过比较原始视频和时间反转视频的去噪损失来测量时间箭头感知。第二级引入因果认知指数(CCI),利用视觉语言模型(VLM)将数据集划分为因果和非因果子集,从而将真正的因果推理与时间偏差分离开来。该基准由于使用零成本反转的真实世界视频而具有任意可扩展性。

关键结果

对13个最先进的视频扩散模型的评估表明,感知时间箭头并不意味着理解因果关系,并且与人类水平的因果认知相比仍存在显著差距。

标签

video diffusion modelsworld modelscausalitybenchmarkcounterfactual reasoningvideo generationCV