Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

具身人工智能的安全性:风险、攻击与防御综述

arXiv 26.05 2026 40.2 method

TLDR

全面综述具身AI安全性,涵盖感知、认知、规划与交互中的攻击与防御。

评分理由

The paper provides a structured taxonomy and synthesizes over 500 papers, which is a strength for organizing fragmented research. However, as a survey, it lacks new empirical contributions or real-world experiments, limiting its direct impact.

Read-first 评分解释

综合优先阅读分 40.2,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 0。

近期性 6%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

可复现性 18%
73

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:有;数据:无;命中信号:GitHub

引用影响力 18%
71.6

使用 OpenAlex 形态的引用元数据作为文献关注度信号,并与论文本身质量分开处理。 归一化引用分位:0.71574477

方法质量 18%
50

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:分析

主题相关性 29%
0

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

引用速度 12%
0

引用速度按发表年限估算年均引用,降低旧论文天然占优的偏差。 年均引用:0.00

研究版图角色

前沿论文复现锚点

排序敏感性

稳定性:volatile;排名波动范围:204。

关键词评分

world model
0
world simulator
0
generative world model
0
interactive world model
0
video world model
0
world dynamics prediction
0
model-based reinforcement learning world model
0

深度分析

创新点

  • 对具身AI安全性研究的全面结构化综述
  • 多层次分类体系,统一分散的研究线索,并将具身特定安全发现与视觉、语言和多模态基础模型的更广泛进展联系起来
  • 综合来自500多篇论文的见解,涵盖对抗性攻击、后门攻击、越狱攻击和硬件级攻击;攻击检测、安全训练和鲁棒推理;以及风险感知的人机交互
  • 识别被忽视的挑战:多模态感知融合的脆弱性、越狱攻击下规划的不稳定性,以及开放场景中人机交互的可信度

方法

本综述回顾了500多篇关于完整具身流水线(从感知、认知到规划、行动与交互以及智能体系统)中攻击与防御的论文。它引入了一个多层次分类体系,统一了分散的研究线索,并将具身特定的安全发现与视觉、语言和多模态基础模型的更广泛进展联系起来。

关键结果

该综述识别出几个被忽视的挑战,包括多模态感知融合的脆弱性、越狱攻击下规划的不稳定性,以及开放场景中人机交互的可信度,并为构建在现实部署中安全、鲁棒且可靠的具身智能体提供了路线图。

标签