ForgeDrive: Bidirectional Cross-Conditioning for Unified Visual-Action Generation in Autonomous Driving
TLDR
ForgeDrive unifies visual and action generation in autonomous driving via bidirectional cross-conditioning, enabling act-then-imagine inference for improved planning and simulation.
Reasoning
The paper introduces a novel act-then-imagine paradigm that reduces error cascades from visual generation to action planning, and unifies multiple driving tasks in a single model. However, evaluation is limited to the NAVSIM simulator without real-world validation, and limitations are not discussed.
Read-first score
Read-first score 42.7, weighted from topical fit, citation, graph, method, reproducibility, and recency signals. Original total remains 54.
Field roles
Rank sensitivity
Stability: volatile; rank range: 408.
Keyword Scores
Deep Analysis
Innovations
- Unified autoregressive diffusion framework with visual-action cross-conditioning for autonomous driving
- Act-then-imagine paradigm replacing the traditional imagine-then-act pipeline to prevent error cascading
- Factorization of future as per-timestep frame-action pairs with intertwined modalities
- Decoupled diffusion timesteps and UniDiffuser-style noise scheduler enabling cross-modal inference
- Inference paradigm where action generation does not require a clean future frame and generated action improves subsequent frame generation
- Integration of future ego-status prediction to enhance planning
- Single model unifying driving simulation, planning, and visual odometry
Methodology
ForgeDrive is an autoregressive diffusion model that generates sequences of frame-action pairs. Training decouples diffusion timesteps for visual and action modalities and uses a UniDiffuser-style noise scheduler to learn bidirectional cross-conditioning. Inference follows an act-then-imagine paradigm, generating actions first and then conditioning frame generation on them, with additional ego-status prediction.
Key Results
On NAVSIM, ForgeDrive outperforms existing strong planners without post-training and unifies driving simulation, planning, and visual odometry in a single model.