针对World Models以破坏机器人学习流水线
TLDR
世界模型引入隐蔽数据投毒,使安全训练数据仍导致策略被破坏。
评分理由
The paper identifies a novel security vulnerability in world models used for robot learning, demonstrating effective attacks against state-of-the-art models. Strengths include a clear attack methodology and empirical validation; weaknesses include limited scope to specific attack types and potential lack of generality across all world model variants.
Read-first 评分解释
综合优先阅读分 59.4,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 37。
研究版图角色
基础论文前沿论文桥接论文方法锚点
排序敏感性
稳定性:volatile;排名波动范围:430。
关键词评分
深度分析
创新点
- 新颖的攻击方法,将恶意提示或妥协的转移动态注入看似安全的远程操作数据集,这些提示仅在通过世界模型作为输入时被激活。
- 展示了在下游DRL策略上的完整端到端后门攻击,以及针对VLA设置的概念验证,使用了最先进的行动条件和文本条件世界模型。
方法
作者提出针对世界模型的数据投毒攻击,通过将恶意提示或转移动态嵌入看似安全的远程操作数据集中。这些被投毒的数据集随后作为世界模型的输入,生成合成的危险机器人训练轨迹。攻击针对行动条件(action-conditioned)和文本条件(text-conditioned)世界模型进行评估,下游效果通过DRL策略(完整后门)和VLA设置(概念验证)进行测量。
关键结果
攻击成功生成合成的危险机器人训练轨迹,导致不安全或受损的机器人策略。在下游DRL策略上展示了完整的端到端后门攻击,并在VLA设置中展示了概念验证。
局限性
- 世界模型容易受到隐蔽的数据投毒攻击,传统方法难以检测。
- 研究结果强调需要更安全的世界模型,并重新评估其在机器人学习供应链中的角色,暗示当前防御措施不足。