CRISP: A Spatiotemporal Camera-Radar Backbone for Driving via Forecasting-Based World-Model Pretraining
TLDR
CRISP pretrains a camera-radar backbone for driving by forecasting future LiDAR, improving downstream tasks without LiDAR at inference.
Reasoning
Strengths include a novel forecasting-based pretraining method that leverages privileged LiDAR supervision, practical sensor configuration, and strong downstream task improvements. Weaknesses are reliance on LiDAR during pretraining and evaluation on a single dataset (nuScenes), limiting generalizability claims.
Read-first score
Read-first score 35.4, weighted from topical fit, citation, graph, method, reproducibility, and recency signals. Original total remains 30.
Field roles
Rank sensitivity
Stability: volatile; rank range: 136.
Keyword Scores
Deep Analysis
Innovations
- Forecasting-based pretraining for camera-radar fusion using future LiDAR point clouds as privileged supervision
- Enhanced radar encoder, radar-enhanced temporal self-attention, and multimodal feature rendering with modality innovation gating
- Unified BEV representation learning from camera and radar without requiring LiDAR at deployment
Methodology
CRISP pretrains a spatiotemporal backbone by predicting future LiDAR point clouds from historical multi-view camera images and radar sweeps, using LiDAR only as privileged supervision. It incorporates an enhanced radar encoder, radar-enhanced temporal self-attention, and modality innovation gating to fuse camera and radar features into a bird's-eye-view representation.
Key Results
On nuScenes, CRISP improves long-horizon point cloud forecasting and transfers effectively to downstream tasks including 3D detection, tracking, online mapping, motion forecasting, future occupancy prediction, and planning.