Awesome World Model Hub Papers · Datasets · Projects
← Back to datasets

Benchmarking World-Model Learning

2025 Datasets
Preview for Benchmarking World-Model Learning

Dataset Analysis

Proposes WorldTest protocol and AutumnBench benchmark to evaluate world models on multiple environment-level queries, showing humans outperform frontier models.

Provenance

Collected from papers.

Derived from paper: Benchmarking World-Model Learning

Resources