当世界模型做错梦:针对世界模型的物理条件对抗攻击
TLDR
首个针对驾驶生成式世界模型的白盒攻击,通过扰动物理条件通道在保持感知保真度的同时诱导语义失真。
评分理由
The paper introduces a novel adversarial attack on generative world models, with a well-designed two-stage optimization and extensive quantitative results including FID, FVD, ASR, and downstream task degradation. However, it is limited to white-box settings and a single driving domain, and the claim of being the first may need broader verification.
Read-first 评分解释
综合优先阅读分 58.5,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 38。
研究版图角色
前沿论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:352。
关键词评分
深度分析
创新点
- 首个白盒世界模型攻击,通过扰动物理条件通道(HDMap嵌入、3D框特征)在保持感知保真度的同时诱导语义、逻辑或决策层面的失真。
- 两阶段优化:(1)质量保持引导阶段,将反向扩散损失约束在校准阈值以下;(2)动量引导去噪阶段,沿去噪轨迹累积目标对齐梯度,实现稳定、时间一致的语义偏移。
方法
PhysCond-WMA是一种针对生成式世界模型的白盒攻击。它分两阶段运行:首先,质量保持引导阶段将反向扩散损失约束在校准阈值以下以维持感知保真度;其次,动量引导去噪阶段沿去噪轨迹累积目标对齐梯度,以实现稳定且时间一致的语义偏移。该攻击扰动物理条件通道,如HDMap嵌入和3D框特征。
关键结果
该攻击平均使FID增加约9%,平均使FVD增加约3.9%,目标攻击成功率(ASR)为0.55。下游任务中,攻击视频使3D检测性能下降约4%,并使开环规划性能恶化约20%。
局限性
- 白盒攻击假设需要完全访问世界模型,限制了在黑盒场景中的适用性。
- 攻击成功率(ASR)为0.55,表明并非所有目标攻击都能成功。
- 感知保真度略有下降(FID和FVD增加),可能被检测到。
- 评估仅限于驾驶视频领域,未证明对其他世界模型应用的泛化能力。
技术栈
World ModelsDiffusion ModelsHDMap3D Object DetectionAdversarial Attacks