WorldArena: A Unified Benchmark for Evaluating Perception and Functional Utility of Embodied World Models
TLDR
WorldArena benchmark evaluates embodied world models on perception and functional utility, revealing a gap between visual quality and task capability.
Reasoning
The paper introduces a comprehensive benchmark with multiple metrics and human evaluation, addressing a clear gap in evaluation. Strengths include systematic multi-dimensional assessment and a public leaderboard; weaknesses may include limited discussion of limitations or generalizability beyond 14 models.
Read-first score
Read-first score 68.6, weighted from topical fit, citation, graph, method, reproducibility, and recency signals. Original total remains 55.
Field roles
Rank sensitivity
Stability: volatile; rank range: 141.
Keyword Scores
Deep Analysis
Innovations
- Unified benchmark for evaluating embodied world models across both perceptual and functional dimensions
- Three-dimensional evaluation framework: video perception quality (16 metrics across six sub-dimensions), embodied task functionality (data engine, policy evaluator, action planner with subjective human evaluation)
- EWMScore, a holistic metric integrating multi-dimensional performance into a single interpretable index
Methodology
WorldArena is a benchmark that systematically evaluates embodied world models through three dimensions: video perception quality measured with 16 metrics across six sub-dimensions, and embodied task functionality assessing models as data engines, policy evaluators, and action planners with subjective human evaluation. The benchmark includes extensive experiments on 14 representative models and introduces EWMScore as a unified metric.
Key Results
The experiments reveal a significant perception-functionality gap, showing that high visual quality does not necessarily translate into strong embodied task capability.