WorldArena:评估具身世界模型感知与功能实用性的统一基准
TLDR
WorldArena基准评估具身世界模型的感知与功能实用性,揭示视觉质量与任务能力之间的差距。
评分理由
The paper introduces a comprehensive benchmark with multiple metrics and human evaluation, addressing a clear gap in evaluation. Strengths include systematic multi-dimensional assessment and a public leaderboard; weaknesses may include limited discussion of limitations or generalizability beyond 14 models.
Read-first 评分解释
综合优先阅读分 68.6,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 55。
研究版图角色
前沿论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:141。
关键词评分
深度分析
创新点
- 用于评估具身世界模型感知与功能维度的统一基准
- 三维评估框架:视频感知质量(六个子维度16个指标)、具身任务功能性(数据引擎、策略评估器、动作规划器,结合主观人类评估)
- EWMScore,一个将多维性能整合为单一可解释指数的整体指标
方法
WorldArena是一个基准,通过三个维度系统性地评估具身世界模型:视频感知质量,使用六个子维度下的16个指标进行测量;具身任务功能性,评估模型作为数据引擎、策略评估器和动作规划器的能力,并结合主观人类评估。该基准包括对14个代表性模型的广泛实验,并引入EWMScore作为统一指标。
关键结果
实验揭示了显著的感知-功能差距,表明高视觉质量并不一定转化为强具身任务能力。