CityBench: Evaluating the Capabilities of Large Language Model as World Model
TLDR
CityBench is a systematic benchmark using an interactive simulator to evaluate LLMs and VLMs as world models for diverse urban tasks across 13 cities.
Reasoning
The paper introduces a novel benchmark with real-world urban data and tasks, but its scope is limited to urban domains and does not address generative or video world models. The evaluation focuses on perception and decision-making, lacking explicit reinforcement learning or dynamics prediction components.
Read-first score
Read-first score 62.8, weighted from topical fit, citation, graph, method, reproducibility, and recency signals. Original total remains 35.
Field roles
Rank sensitivity
Stability: volatile; rank range: 343.
Keyword Scores
Deep Analysis
Innovations
- First systematic benchmark for evaluating LLMs and VLMs in urban research
- CityData: integration of diverse urban data
- CitySimu: simulation of fine-grained urban dynamics
- 8 representative urban tasks in 2 categories (perception-understanding and decision-making)
Methodology
CityBench is an interactive simulator-based evaluation platform. It builds CityData to integrate diverse urban data and CitySimu to simulate fine-grained urban dynamics. Based on these, 8 representative urban tasks in two categories (perception-understanding and decision-making) are designed, and 30 well-known LLMs and VLMs are evaluated across 13 cities worldwide.
Key Results
Advanced LLMs and VLMs achieve competitive performance on tasks requiring commonsense and semantic understanding (e.g., human dynamics, semantic inference of urban images), but fail on tasks requiring professional knowledge and high-level numerical abilities (e.g., geospatial prediction, traffic control).