具身人工智能的安全性:风险、攻击与防御综述
TLDR
全面综述具身AI安全性,涵盖感知、认知、规划与交互中的攻击与防御。
评分理由
The paper provides a structured taxonomy and synthesizes over 500 papers, which is a strength for organizing fragmented research. However, as a survey, it lacks new empirical contributions or real-world experiments, limiting its direct impact.
Read-first 评分解释
综合优先阅读分 40.2,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 0。
研究版图角色
前沿论文复现锚点
排序敏感性
稳定性:volatile;排名波动范围:204。
关键词评分
深度分析
创新点
- 对具身AI安全性研究的全面结构化综述
- 多层次分类体系,统一分散的研究线索,并将具身特定安全发现与视觉、语言和多模态基础模型的更广泛进展联系起来
- 综合来自500多篇论文的见解,涵盖对抗性攻击、后门攻击、越狱攻击和硬件级攻击;攻击检测、安全训练和鲁棒推理;以及风险感知的人机交互
- 识别被忽视的挑战:多模态感知融合的脆弱性、越狱攻击下规划的不稳定性,以及开放场景中人机交互的可信度
方法
本综述回顾了500多篇关于完整具身流水线(从感知、认知到规划、行动与交互以及智能体系统)中攻击与防御的论文。它引入了一个多层次分类体系,统一了分散的研究线索,并将具身特定的安全发现与视觉、语言和多模态基础模型的更广泛进展联系起来。
关键结果
该综述识别出几个被忽视的挑战,包括多模态感知融合的脆弱性、越狱攻击下规划的不稳定性,以及开放场景中人机交互的可信度,并为构建在现实部署中安全、鲁棒且可靠的具身智能体提供了路线图。