面向自动驾驶的半监督视觉中心三维占据世界模型
TLDR
提出半监督3D占据世界模型,利用2D标签和体渲染实现自动驾驶预测与规划。
评分理由
Strengths include a novel semi-supervised paradigm reducing annotation cost and integration of forecasting and planning tasks. Weaknesses are reliance on a single dataset and lack of explicit comparison to fully-supervised baselines in the abstract.
Read-first 评分解释
综合优先阅读分 66.1,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 27。
研究版图角色
前沿论文方法锚点复现锚点
排序敏感性
稳定性:volatile;排名波动范围:570。
关键词评分
深度分析
创新点
- 在预训练阶段仅使用二维标签的三维占据世界模型半监督学习范式
- 两阶段训练:自监督预训练(属性投影头和体渲染)后接全监督微调
- 属性投影头从三维占据生成RGB、密度和语义场,实现来自二维标签的时间监督
- 用于递归预测未来占据和自车轨迹的状态条件预测模块
方法
PreWorld采用两阶段训练范式。在自监督预训练阶段,属性投影头从三维占据生成RGB、密度和语义场,体渲染提供来自二维标签的时间监督。在全监督微调阶段,使用三维占据标签。状态条件预测模块递归预测未来占据和自车轨迹。实验在nuScenes数据集上进行。
关键结果
PreWorld在nuScenes数据集上的三维占据预测、四维占据预测和运动规划任务上取得了有竞争力的性能,展示了有效性和可扩展性。
局限性
- 仍需要微调阶段的三维占据标签,限制了完全的标签效率
- 评估仅限于nuScenes数据集;未展示对其他数据集或条件的泛化能力