DriveLaW:在潜在驾驶世界中统一规划与视频生成
TLDR
DriveLaW通过将世界模型的潜在表示注入扩散规划器,统一了自动驾驶中的视频生成与运动规划。
评分理由
The paper presents a novel unified paradigm with strong empirical results on video prediction and planning benchmarks. However, the abstract lacks details on limitations and the real-world scope of the benchmarks.
Read-first 评分解释
综合优先阅读分 49.9,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 48。
研究版图角色
前沿论文
排序敏感性
稳定性:volatile;排名波动范围:438。
关键词评分
深度分析
创新点
- 通过将视频生成器的潜在表示直接注入规划器,统一了视频生成与运动规划
- DriveLaW-Video:一个强大的世界模型,能够生成具有表达性潜在表示的高保真预测
- DriveLaW-Act:一个扩散规划器,从DriveLaW-Video的潜在表示中生成一致且可靠的轨迹
- 三阶段渐进训练策略以优化两个组件
方法
DriveLaW包含两个核心组件:DriveLaW-Video,一个用于高保真视频预测并具有表达性潜在表示的世界模型;以及DriveLaW-Act,一个从DriveLaW-Video的潜在表示中生成轨迹的扩散规划器。两个组件通过三阶段渐进训练策略进行优化。该模型通过将视频生成器的潜在表示直接注入规划器,统一了规划与视频生成。
关键结果
DriveLaW在视频预测上取得了最先进的结果,在FID上超越最佳工作33.3%,在FVD上超越1.8%,并在NAVSIM规划基准上创下新纪录。