MIND:世界模型中记忆一致性与动作控制的基准测试
TLDR
MIND是一个基准,使用250个高质量视频评估世界模型中的记忆一致性和动作控制。
评分理由
The paper introduces a novel benchmark (MIND) with a clear evaluation framework and a baseline (MIND-World), addressing a gap in world model evaluation. Strengths include open-domain, closed-loop design and diverse action spaces; weaknesses are limited video count and scene diversity, and lack of detailed results or comparisons in the abstract.
Read-first 评分解释
综合优先阅读分 79,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 51。
研究版图角色
前沿论文方法锚点复现锚点
排序敏感性
稳定性:volatile;排名波动范围:23。
关键词评分
深度分析
创新点
- 首个用于评估世界模型中记忆一致性和动作控制的开放域闭环可复现基准
- 高效的评估框架,用于衡量记忆一致性和动作控制,捕捉跨视角的时间稳定性和上下文连贯性
- 设计多种动作空间(不同角色移动速度和摄像机旋转角度),以评估在共享场景下跨不同动作空间的泛化能力
- 引入MIND-World,一种新颖的交互式视频到世界基线,用于基准测试
方法
MIND包含250个高质量视频(1080p,24 FPS),其中100个第一人称和100个第三人称视频片段共享同一动作空间,另有25+25个片段覆盖不同动作空间,涉及八个多样化场景。评估框架衡量两个核心能力:记忆一致性和动作控制。MIND-World是一种用于基准测试的交互式视频到世界基线。
关键结果
大量实验证明了MIND的完备性,并揭示了当前世界模型的关键挑战,包括难以维持长期记忆一致性和跨动作空间泛化。