Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

WorldRFT:面向自动驾驶的强化微调潜在世界模型规划

AAAI 26 2026 49.2 method

TLDR

WorldRFT提出面向规划的潜在世界模型与强化微调,实现自动驾驶SOTA,碰撞率降低83%。

评分理由

The paper introduces a novel framework combining hierarchical planning decomposition and reinforcement fine-tuning, demonstrating strong empirical results on nuScenes and NavSim. However, the approach is domain-specific and its generalizability to other tasks is not explored.

Read-first 评分解释

综合优先阅读分 49.2,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 35。

近期性 8%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

主题相关性 42%
50

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

方法质量 25%
50

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基准

可复现性 25%
30

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:无

研究版图角色

前沿论文

排序敏感性

稳定性:volatile;排名波动范围:518。

关键词评分

world model
10
model-based reinforcement learning world model
8
world dynamics prediction
6
interactive world model
5
world simulator
3
generative world model
2
video world model
1

深度分析

创新点

  • 面向规划的潜在世界模型框架,通过层次化规划分解和局部感知交互细化机制将场景表示学习与规划对齐
  • 基于组相对策略优化(GRPO)的强化微调(RFT),采用轨迹高斯化和碰撞感知奖励
  • 集成视觉-几何基础模型以提升3D空间感知

方法

WorldRFT集成了视觉-几何基础模型以增强3D空间感知,采用层次化规划任务分解来引导表示优化,并利用局部感知迭代细化来推导面向规划的驾驶策略。随后,应用组相对策略优化(GRPO)结合轨迹高斯化和碰撞感知奖励对策略进行微调,以实现安全关键性能。

关键结果

WorldRFT在nuScenes上取得最先进性能,碰撞率降低83%(从0.30%降至0.05%);在NavSim上仅使用摄像头传感器,其性能(PDMS 87.8)与基于LiDAR的SOTA方法DiffusionDrive(PDMS 88.1)相当。

标签