Omni-WorldBench:面向世界模型的全面交互中心评估
TLDR
Omni-WorldBench用提示套件和智能体指标评估4D世界模型交互响应,揭示18个模型局限。
评分理由
The paper addresses a critical gap in evaluating interactive response for world models, offering a comprehensive benchmark with a prompt suite and agent-based metrics. However, it is limited to video-based paradigms and lacks explicit details on real-world dataset composition.
Read-first 评分解释
综合优先阅读分 68,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 54。
研究版图角色
前沿论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:146。
关键词评分
深度分析
创新点
- 提出Omni-WorldBench,一个专门设计用于评估4D设置下世界模型交互响应能力的全面基准。
- 引入Omni-WorldSuite,一个涵盖多种交互级别和场景类型的系统提示套件。
- 引入Omni-Metrics,一个基于智能体的评估框架,通过测量交互动作对最终结果和中间状态演化轨迹的因果影响来量化世界建模能力。
方法
该基准包含两个关键组件:Omni-WorldSuite(提示套件)和Omni-Metrics(基于智能体的评估框架)。它使用这些组件评估跨多种范式的18个代表性世界模型,以测量交互响应能力。
关键结果
对18个世界模型的广泛评估揭示了当前世界模型在交互响应方面的关键局限性,为未来研究提供了可操作的见解。