BadWAM: 当世界-动作模型想象正确但行动错误
TLDR
破坏世界-动作模型想象与执行动作对齐的对抗攻击框架。
评分理由
Strengths: novel attack surface (World-Action Drift) and two distinct attack types. Weaknesses: evaluation only on model variants, no real-world validation; limited scope of WAMs.
Read-first 评分解释
综合优先阅读分 35.6,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 37。
研究版图角色
前沿论文
排序敏感性
稳定性:volatile;排名波动范围:176。
关键词评分
深度分析
创新点
- 提出了BadWAM,一个统一框架,用于建模和评估World-Action Drift Attacks,这是一类针对世界-动作模型(WAMs)的新型对抗攻击。
- 沿着两个标准(攻击强度和隐蔽性)刻画了攻击面。
- 提出了一种纯动作对抗攻击,直接驱使模型执行导致任务失败的动作。
- 提出了一种保持想象不变的对抗攻击,在保持预测未来接近干净想象的同时诱导有害的动作偏移,暴露了WAM的隐蔽性故障。
方法
BadWAM使用微小的视觉扰动攻击WAMs,实例化了两种攻击策略:一种破坏任务成功的纯动作攻击,以及一种在改变动作的同时约束未来预测漂移的保持想象不变的攻击。在闭环执行下对不同WAM变体进行评估,测量任务成功率。
关键结果
纯动作攻击将模型成功率从96.5%降至43.1%。保持想象不变的攻击在适度的未来保持正则化下仍保持强大的攻击性能,暴露了模型想象合理未来但执行不同步动作的脆弱性。