WorldRFT:面向自动驾驶的强化微调潜在世界模型规划
TLDR
WorldRFT提出面向规划的潜在世界模型与强化微调,实现自动驾驶SOTA,碰撞率降低83%。
评分理由
The paper introduces a novel framework combining hierarchical planning decomposition and reinforcement fine-tuning, demonstrating strong empirical results on nuScenes and NavSim. However, the approach is domain-specific and its generalizability to other tasks is not explored.
Read-first 评分解释
综合优先阅读分 49.2,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 35。
研究版图角色
前沿论文
排序敏感性
稳定性:volatile;排名波动范围:518。
关键词评分
深度分析
创新点
- 面向规划的潜在世界模型框架,通过层次化规划分解和局部感知交互细化机制将场景表示学习与规划对齐
- 基于组相对策略优化(GRPO)的强化微调(RFT),采用轨迹高斯化和碰撞感知奖励
- 集成视觉-几何基础模型以提升3D空间感知
方法
WorldRFT集成了视觉-几何基础模型以增强3D空间感知,采用层次化规划任务分解来引导表示优化,并利用局部感知迭代细化来推导面向规划的驾驶策略。随后,应用组相对策略优化(GRPO)结合轨迹高斯化和碰撞感知奖励对策略进行微调,以实现安全关键性能。
关键结果
WorldRFT在nuScenes上取得最先进性能,碰撞率降低83%(从0.30%降至0.05%);在NavSim上仅使用摄像头传感器,其性能(PDMS 87.8)与基于LiDAR的SOTA方法DiffusionDrive(PDMS 88.1)相当。