MBench:视频世界模型记忆能力的综合基准
TLDR
MBench是一个通过实体、环境和因果一致性评估视频世界模型记忆能力的基准,使用真实拍摄视频。
评分理由
The paper addresses a critical gap in evaluating long-term memory for video world models, with a systematic decomposition into three consistency dimensions and use of real-world data. However, it focuses narrowly on memory and does not cover other world model capabilities like interactivity or dynamics prediction.
Read-first 评分解释
综合优先阅读分 55.2,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 41。
研究版图角色
基础论文前沿论文桥接论文
排序敏感性
稳定性:volatile;排名波动范围:408。
关键词评分
深度分析
创新点
- 提出MBench,一个专门评估视频世界模型记忆能力的综合基准。
- 将记忆能力分解为三个层次维度:实体一致性、环境一致性和因果一致性,并进一步细化为12个可量化子维度。
- 使用严格筛选的真实拍摄长视频和基于规则的量化矩阵结合VLM进行客观全面的一致性评估。
方法
MBench系统地将记忆能力分解为三个核心维度(实体、环境、因果一致性)和12个子维度。该基准基于精心筛选的真实拍摄长视频构建,并使用基于规则的量化矩阵和视觉语言模型(VLM)进行评估,以实现客观的一致性评估。
关键结果
对主流最先进的视频世界模型的广泛评估揭示了现有方法在长期状态保持方面的关键系统性局限性。