视频中的思考:视频生成器真的能推理现实世界吗?
TLDR
提出CGDJ框架评估视频生成器是否真正推理现实世界,揭示感知-预测差距。
评分理由
The paper introduces a novel evaluation framework (CGDJ) that separates explicit causal perception from implicit generative consistency, identifying a key limitation in current video generators. Its strength lies in the dual-judge approach and empirical findings, but it is limited to specific models and does not fully address generalization across diverse real-world scenarios.
Read-first 评分解释
综合优先阅读分 47.4,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 45。
研究版图角色
前沿论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:590。
关键词评分
深度分析
创新点
- 将视频生成推理范式重新定义为“视频中的思考”,其中视频作为构建、扩展和验证因果推理的媒介。
- 引入因果生成双重评估(CGDJ)框架,通过显式因果感知(时空视觉问答)和隐式生成感知-预测差距(未来视频一致性)来审计世界模型一致性。
- 识别出感知-预测差距和视听不一致,即模型在语言表达正确因果逻辑方面比在视觉渲染上更可靠。
方法
本文提出CGDJ,一个双重评估框架,通过测试视频生成器回答视频场景因果问题的能力(显式因果感知)以及生成与因果结果一致的一致未来视频的能力(隐式生成感知-预测差距),来评估其推理能力。实验在具有代表性的开源和闭源视频生成器上进行。
关键结果
开源视频生成器能生成合理动态,但显式因果感知几乎为零;而先进的闭源模型在推理与生成之间显示出更强但仍然有限的一致性;视听不一致表明,模型在语言表达正确因果逻辑方面比在视觉渲染上更可靠。
局限性
- 开源视频生成器缺乏显式因果感知,尽管能生成合理动态。
- 即使是先进的闭源模型,在推理与生成之间也只显示出有限的一致性。
- 视听不一致:模型在语言表达因果逻辑方面比在视频渲染上更可靠,这对世界模拟器叙事提出了挑战。
技术栈
Video generative modelsCausal-Generative Dual-Judge (CGDJ) frameworkSpatio-temporal visual question answeringPerception-prediction gap analysis