端到端驾驶中的潜在思维链世界建模
TLDR
LCDrive使用潜在思维链和世界模型令牌进行端到端驾驶,实现更快的推理和更好的轨迹质量。
评分理由
The paper introduces a novel latent reasoning space that unifies action proposals and world model tokens, supported by cold-start supervision and closed-loop RL post-training. Strengths include improved inference speed and trajectory quality over text-based reasoning baselines, but the approach is domain-specific and lacks discussion of generalization or safety limitations.
Read-first 评分解释
综合优先阅读分 43.5,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 41。
研究版图角色
前沿论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:420。
关键词评分
深度分析
创新点
- 引入使用动作提议令牌和世界模型令牌的潜在思维链推理,替代自然语言
- 在动作对齐的潜在空间中统一思维链推理与决策
- 通过使用真实未来轨迹监督动作提议和世界模型令牌来冷启动潜在思维链
- 使用闭环强化学习进行后训练以增强推理能力
方法
LCDrive将推理建模为动作提议令牌(与输出动作共享同一词汇表)和世界模型令牌(基于学习到的潜在世界模型预测未来结果)的交错序列。模型首先通过监督学习在真实未来轨迹上进行冷启动,然后使用闭环强化学习进行微调。在大型端到端驾驶基准上,与无推理和文本推理基线进行比较评估。
关键结果
与无推理和文本推理基线相比,LCDrive实现了更快的推理、更好的轨迹质量以及从交互式强化学习中获得的更大改进。
局限性
- 需要真实未来轨迹进行冷启动监督,这在现实环境中可能成本高昂或不可用
- 潜在表示可能不如自然语言可解释,使得调试或安全分析更具挑战性