WorldMark:交互式视频世界模型的统一基准套件
TLDR
WorldMark是首个交互式视频世界模型统一基准,通过标准化场景、动作和评估指标实现公平比较。
评分理由
The paper addresses a clear gap in the field by providing a common evaluation framework for interactive video world models, with strong methodological contributions like a unified action-mapping layer and hierarchical test suite. However, the abstract does not detail specific experimental results or limitations, and the claim of being 'first' may need verification against prior work.
Read-first 评分解释
综合优先阅读分 61.1,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 51。
研究版图角色
排序敏感性
稳定性:volatile;排名波动范围:375。
关键词评分
深度分析
创新点
- 统一的动作映射层,将共享的WASD风格动作词汇翻译为每个模型的原生控制格式,使得六个主要模型在相同场景和轨迹上能够进行苹果对苹果的比较。
- 包含500个评估案例的分层测试套件,覆盖第一人称和第三人称视角、逼真和风格化场景,以及从简单到困难三个难度等级,时长20-60秒。
- 模块化评估工具包,用于视觉质量、控制对齐和世界一致性,设计为可重用标准化输入,同时允许插入自定义指标。
方法
WorldMark通过标准化场景、动作序列和控制接口,为交互式图像到视频世界模型提供了一个共同的测试平台。它引入了一个统一的动作映射层,将共享的WASD风格动作词汇翻译为每个模型的原生控制格式,从而实现了六个模型之间的比较。该基准包含一个分层的测试套件,共500个评估案例,涵盖不同视角、风格和难度等级,以及一个模块化评估工具包,用于测量视觉质量、控制对齐和世界一致性。
关键结果
摘要未报告具体的实验结果;它描述了基准设计、计划发布的所有数据、评估代码和模型输出,以及World Model Arena(warena.ai)的推出,用于在线并排模型比较和实时排行榜。