InDRiVE: 基于潜在分歧的无奖励世界模型预训练用于自动驾驶
TLDR
InDRiVE使用潜在分歧进行无奖励世界模型预训练,实现自动驾驶的零样本和少样本适应。
评分理由
The paper presents a novel reward-free pretraining method using latent ensemble disagreement as intrinsic motivation, which is a strength for reducing reward engineering. However, it is only evaluated in the CARLA simulator, lacking real-world validation, and the approach is specific to autonomous driving.
Read-first 评分解释
综合优先阅读分 51.6,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 41。
研究版图角色
前沿论文
排序敏感性
稳定性:volatile;排名波动范围:466。
关键词评分
深度分析
创新点
- 使用来自潜在集成分歧的内在动机作为认知不确定性的代理进行无奖励预训练
- DreamerV3风格的MBRL智能体用于自动驾驶的无奖励预训练
- 基于想象的动作-评论家直接从学习到的世界模型中学习无规划器的探索策略
- 通过冻结所有参数并在未见过的城镇和路线上部署预训练探索策略实现零样本迁移
- 使用有限的外部反馈针对下游目标(车道保持和碰撞避免)进行少样本适应
方法
本文提出了InDRiVE,一种DreamerV3风格的基于模型的强化学习智能体,在CARLA模拟器中使用来自潜在集成分歧的内在动机进行无奖励预训练。分歧作为认知不确定性的代理,驱动智能体前往探索不足的驾驶场景。基于想象的动作-评论家直接从学习到的世界模型中学习无规划器的探索策略。预训练后,通过冻结所有参数并在未见过的城镇和路线上部署策略来评估零样本迁移,随后使用有限的外部反馈针对车道保持和碰撞避免进行少样本适应。
关键结果
在CARLA实验中跨城镇、路线和交通密度,基于分歧的预训练在城镇迁移和匹配交互预算下产生了更强的零样本鲁棒性和鲁棒的少样本碰撞避免能力。