Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

FAR-Drive: 闭环自动驾驶中的帧级自回归视频生成

arXiv 26.3 2026 75 method, system, application

TLDR

FAR-Drive提出帧级自回归视频生成框架用于闭环自动驾驶模拟,在nuScenes上达到最先进性能。

评分理由

The paper introduces a novel training strategy (adaptive reference horizon conditioning and blend-forcing) to address long-horizon consistency and autoregressive degradation, and includes system-level optimizations for low-latency inference. However, evaluation is limited to the nuScenes dataset, and generalization to other domains or real-world deployment is not discussed.

Read-first 评分解释

综合优先阅读分 75,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 54。

方法质量 25%
100

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:基线、数据集、评估、实验、指标

近期性 8%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

主题相关性 42%
77.1

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

可复现性 25%
38

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:数据集

研究版图角色

前沿论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:18。

关键词评分

world simulator
9
interactive world model
9
video world model
9
generative world model
8
world model
7
world dynamics prediction
7
model-based reinforcement learning world model
5

深度分析

创新点

  • 用于闭环自动驾驶的帧级自回归视频生成框架
  • 具有细粒度结构化控制的多视图扩散变换器,实现几何一致的多相机生成
  • 结合自适应参考视界条件化和混合强制自回归训练的两阶段训练策略,改善长时域一致性并缓解迭代退化
  • 系统级效率优化,实现单GPU低延迟推理

方法

FAR-Drive是一个帧级自回归视频生成框架,使用带有结构化控制的多视图扩散变换器生成几何一致的多相机输出。它采用两阶段训练策略:自适应参考视界条件化以保持长时域一致性,以及混合强制自回归训练以减少自条件下的退化。模型在nuScenes数据集上训练和评估,与现有闭环自动驾驶模拟器进行对比,并包含系统级优化以实现亚秒级延迟。

关键结果

FAR-Drive在nuScenes数据集上达到了现有闭环自动驾驶模拟方法中的最先进性能,同时在单个GPU上保持了亚秒级延迟。

局限性

  • 评估仅限于nuScenes数据集,未展示对其他驾驶环境或传感器配置的泛化能力
  • 尽管提出了训练策略,但在极长序列上长时域时空和跨视图一致性仍可能退化
  • 迭代自条件下的自回归退化得到缓解,但在极端或分布外条件下并未完全消除
  • 低延迟推理在单GPU上得到验证,但未解决多GPU或复杂场景下实时部署的可扩展性问题

技术栈

Multi-view Diffusion TransformernuScenesPyTorchCUDA

标签