WorldRFT: Latent World Model Planning with Reinforcement Fine-Tuning for Autonomous Driving
TLDR
WorldRFT proposes a planning-oriented latent world model with reinforcement fine-tuning for autonomous driving, achieving SOTA with 83% collision reduction.
Reasoning
The paper introduces a novel framework combining hierarchical planning decomposition and reinforcement fine-tuning, demonstrating strong empirical results on nuScenes and NavSim. However, the approach is domain-specific and its generalizability to other tasks is not explored.
Read-first score
Read-first score 49.2, weighted from topical fit, citation, graph, method, reproducibility, and recency signals. Original total remains 35.
Field roles
Rank sensitivity
Stability: volatile; rank range: 518.
Keyword Scores
Deep Analysis
Innovations
- Planning-oriented latent world model framework that aligns scene representation learning with planning via hierarchical planning decomposition and local-aware interactive refinement mechanism
- Reinforcement fine-tuning (RFT) with Group Relative Policy Optimization (GRPO) using trajectory Gaussianization and collision-aware rewards
- Integration of a vision-geometry foundation model to improve 3D spatial awareness
Methodology
WorldRFT integrates a vision-geometry foundation model for 3D spatial awareness, employs hierarchical planning task decomposition to guide representation optimization, and uses local-aware iterative refinement to derive a planning-oriented driving policy. It then applies Group Relative Policy Optimization (GRPO) with trajectory Gaussianization and collision-aware rewards to fine-tune the policy for safety-critical performance.
Key Results
WorldRFT achieves state-of-the-art performance on nuScenes, reducing collision rates by 83% (from 0.30% to 0.05%), and on NavSim with camera-only sensors it attains competitive performance (87.8 PDMS) compared to the LiDAR-based SOTA method DiffusionDrive (88.1 PDMS).