DriveWorld: 4D Pre-trained Scene Understanding via World Models for Autonomous Driving
TLDR
DriveWorld uses world models for 4D pre-training from multi-camera videos, improving multiple autonomous driving tasks via spatio-temporal representation learning.
Reasoning
The paper introduces a novel world model-based framework with a Memory State-Space Model for spatio-temporal representation learning, achieving significant improvements across various autonomous driving tasks. However, the abstract does not compare to other world model approaches or discuss limitations.
Read-first score
Read-first score 51.1, weighted from topical fit, citation, graph, method, reproducibility, and recency signals. Original total remains 30.
Field roles
Rank sensitivity
Stability: volatile; rank range: 293.
Keyword Scores
Deep Analysis
Innovations
- World model-based 4D representation learning framework for autonomous driving
- Memory State-Space Model with Dynamic Memory Bank for temporal-aware latent dynamics and Static Scene Propagation for spatial-aware latent statics
- Task Prompt for decoupling task-aware features for various downstream tasks
Methodology
DriveWorld pre-trains from multi-camera driving videos using a world model approach. It employs a Memory State-Space Model with a Dynamic Memory Bank for temporal-aware latent dynamics and a Static Scene Propagation module for spatial-aware latent statics. A Task Prompt is introduced to decouple task-aware features for downstream tasks.
Key Results
When pre-trained on OpenScene, DriveWorld achieves a 7.5% increase in mAP for 3D object detection, a 3.0% increase in IoU for online mapping, a 5.0% increase in AMOTA for multi-object tracking, a 0.1m decrease in minADE for motion forecasting, a 3.0% increase in IoU for occupancy prediction, and a 0.34m reduction in average L2 error for planning.