ARB4WM:面向连续控制中世界模型的对抗鲁棒性基准
TLDR
一个用于评估连续控制中世界模型对抗鲁棒性的统一基准,测试对策略、价值和潜在动态的攻击。
评分理由
The paper introduces ARB4WM, a comprehensive framework for assessing adversarial threats across multiple levels of world-model agents, addressing a clear gap in existing evaluations. Its strengths include systematic attack categorization and empirical evaluation on diverse tasks, but it is limited to Dreamer-style agents and continuous control domains, with input-level defenses showing limited effectiveness.
Read-first 评分解释
综合优先阅读分 67.3,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 43。
研究版图角色
排序敏感性
稳定性:volatile;排名波动范围:442。
关键词评分
深度分析
创新点
- 针对视觉扰动下世界模型智能体部署前鲁棒性和风险评估的统一评估框架
- 五种白盒损失目标,分别针对策略、价值和潜在动态层面
- 时间攻击模式:全帧、半序列和稀疏帧暴露
- 在MetaWorld和DeepMind Control Suite的20个任务上系统评估Dreamer-style智能体
方法
ARB4WM定义了五种白盒损失目标,涵盖策略、价值和潜在动态层面,并研究它们与单步或多步扰动策略以及时间攻击模式(全帧、半序列、稀疏帧)结合的效果。该框架在MetaWorld和DeepMind Control Suite的20个连续控制任务上,评估了四种Dreamer-style智能体在不同损失目标、扰动策略和时间攻击模式下的表现。
关键结果
针对价值估计、潜在表示和RSSM动态的攻击可能与直接策略破坏同样有害;早期或频繁的扰动尤其有害,而输入级防御在自适应攻击下恢复能力有限。