小米汽车世界模型:一种融合重建与生成的联合世界模型用于自动驾驶
TLDR
结合重建(WorldRec)和生成(WorldGen)的自动驾驶统一世界模型,用于闭环仿真与数据合成。
评分理由
The paper presents a novel joint architecture integrating feed-forward 3D scene reconstruction with efficient causal video generation, achieving synergistic gains in consistency and fidelity. Strengths include a clear two-module design and progressive training; weaknesses are the lack of explicit real-world experimental results in the abstract and potential complexity in deployment.
Read-first 评分解释
综合优先阅读分 48.6,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 42。
研究版图角色
前沿论文桥接论文
排序敏感性
稳定性:volatile;排名波动范围:333。
关键词评分
深度分析
创新点
- WorldRec:一种由稀疏场景查询驱动的前馈重建架构,在3D空间中初始化结构化查询,聚合跨视角、跨时间特征,强制空间一致性,生成紧凑高保真的3D高斯场景表示。
- WorldGen:一种两阶段训练框架,包括双向预训练和因果微调(通过教师强制、ODE蒸馏和DMD三个渐进阶段),仅需4步去噪即可实现高质量在线因果视频生成。
- JWM:深度集成WorldRec和WorldGen,在生成稳定性、跨帧一致性和视觉保真度上实现协同增益。
方法
本文提出一个统一系统,包含两个模块:WorldRec用于世界表示,利用3D空间中的稀疏场景查询聚合跨视角和跨时间特征;WorldGen用于世界生成,采用两阶段训练框架(双向预训练后因果微调,包括教师强制、ODE蒸馏和DMD)实现高效视频生成。联合世界模型(JWM)集成两个模块以获得协同改进。
关键结果
JWM在生成稳定性、跨帧一致性和视觉保真度上实现协同增益,为自动驾驶的闭环仿真、数据合成和端到端训练提供了坚实基础。