其他车辆轨迹同样必要:一种驾驶世界模型在视频潜在空间中统一自车与他车轨迹
TLDR
提出EOT-WM,一种在视频潜在空间中统一自车与他车轨迹以实现可控仿真的驾驶世界模型。
评分理由
The paper addresses a key limitation of existing driving world models by enabling control over both ego and other vehicle trajectories, using a novel trajectory-injected diffusion Transformer. Strengths include clear methodology and strong results on nuScenes; weaknesses are reliance on a single dataset and lack of real-world deployment evidence.
Read-first 评分解释
综合优先阅读分 67.8,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 53。
研究版图角色
前沿论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:106。
关键词评分
深度分析
创新点
- 在视频潜在空间中统一自车与他车轨迹用于驾驶世界模型
- 将BEV轨迹投影到图像坐标,通过像素位置实现车辆-轨迹匹配
- 时空变分自编码器用于将轨迹视频与驾驶视频潜在表示对齐
- 轨迹注入的扩散Transformer,在自车与他车轨迹引导下实现可控视频生成
- 基于控制潜在相似性的新度量,用于评估轨迹可控性
方法
该模型首先将自车与他车轨迹从BEV空间投影到图像坐标,通过像素位置匹配每辆车与其轨迹。然后使用时空变分自编码器对轨迹视频进行编码,使其在统一视觉空间中与驾驶视频潜在表示在空间和时间上对齐。进一步设计了一种轨迹注入的扩散Transformer,在自车与他车轨迹引导下对噪声视频潜在表示进行去噪以生成视频。
关键结果
在nuScenes数据集上,所提模型在FID上优于最先进方法30%,在FVD上优于55%,并且能够利用自生成的轨迹预测未见过的驾驶场景。