Probing Multimodal LLMs as World Models for Driving
Dataset Analysis
MLLMs like GPT-4o struggle to understand dynamic driving scenes across frames, despite excelling at single images, highlighting gaps in world model capabilities.
Provenance
Collected from papers.
Derived from paper: Probing Multimodal LLMs as World Models for Driving