BadDreamer:针对自动驾驶视频世界模型的可迁移后门攻击
TLDR
BadDreamer提出针对自动驾驶视频世界模型的可迁移后门攻击,毒化转移动力学以幻觉触发擦除。
评分理由
The paper presents a novel security threat with clear methodology and empirical validation on a real pipeline, but lacks discussion on defense mechanisms and generalizability beyond the specific trigger scenario.
Read-first 评分解释
综合优先阅读分 60.1,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 47。
研究版图角色
基础论文前沿论文桥接论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:471。
关键词评分
深度分析
创新点
- 首个针对自动驾驶视频世界模型学习到的转移动力学的时空后门攻击
- 触发-擦除序列:在观察到的上下文帧中可见迎面而来的黄色配送骑手,但在未来帧中被擦除
- 证明被破坏的未来感知表示可以迁移到下游动作模块,而无需直接修改自我轨迹标签
方法
BadDreamer构建触发-擦除序列,其中黄色配送骑手出现在观察到的上下文帧中,但在未来帧中被擦除。视频世界模型在一小部分此类毒化序列上进行微调,学习到一个隐藏的条件关联:当触发出现时,模型会幻觉出一条清晰的道路。然后被破坏的表示迁移到下游动作模块,导致不安全的路径点预测。
关键结果
该攻击在代表性的开源感知到动作流水线上诱导出不安全的非规避路径点预测,揭示了自动驾驶视频世界模型中的表示级安全风险。
局限性
- 攻击仅在一个代表性的开源流水线上演示,限制了泛化性
- 依赖于特定的物理触发(黄色配送骑手),可能无法覆盖所有真实世界的攻击场景
- 需要在一小部分序列上进行微调,但未讨论此类毒化的隐蔽性和可检测性
- 未提出针对此后门攻击的防御或缓解策略
技术栈
video world modelbackdoor attackfine-tuningtrigger-erasure sequences