Awesome World Model Hub 论文 · 数据集 · 项目
← 返回论文列表

当世界模型做错梦:针对世界模型的物理条件对抗攻击

arXiv 26.2 2026 58.5 method

TLDR

首个针对驾驶生成式世界模型的白盒攻击,通过扰动物理条件通道在保持感知保真度的同时诱导语义失真。

评分理由

The paper introduces a novel adversarial attack on generative world models, with a well-designed two-stage optimization and extensive quantitative results including FID, FVD, ASR, and downstream task degradation. However, it is limited to white-box settings and a single driving domain, and the claim of being the first may need broader verification.

Read-first 评分解释

综合优先阅读分 58.5,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 38。

近期性 8%
100

使用温和的时间衰减,让近期论文更容易浮现,同时保留较早基础工作的价值。 年份:2026

方法质量 25%
80

检查可见的摘要与分析字段,寻找实验、数据集、基线、指标和局限性等方法证据。 命中信号:评估、实验、结果

主题相关性 42%
54.3

使用现有 LLM 关键词相关性评分,并归一化到 0-100。 关键词:world model、world simulator、generative world model、interactive world model、video world model、world dynamics prediction、model-based reinforcement learning world model

可复现性 25%
30

检查链接和可见文本中的论文、代码、数据集、工件与仓库信号。 论文:有;代码:无;数据:无;命中信号:无

研究版图角色

前沿论文方法锚点

排序敏感性

稳定性:volatile;排名波动范围:352。

关键词评分

world model
10
generative world model
10
video world model
8
world simulator
5
world dynamics prediction
3
interactive world model
1
model-based reinforcement learning world model
1

深度分析

创新点

  • 首个白盒世界模型攻击,通过扰动物理条件通道(HDMap嵌入、3D框特征)在保持感知保真度的同时诱导语义、逻辑或决策层面的失真。
  • 两阶段优化:(1)质量保持引导阶段,将反向扩散损失约束在校准阈值以下;(2)动量引导去噪阶段,沿去噪轨迹累积目标对齐梯度,实现稳定、时间一致的语义偏移。

方法

PhysCond-WMA是一种针对生成式世界模型的白盒攻击。它分两阶段运行:首先,质量保持引导阶段将反向扩散损失约束在校准阈值以下以维持感知保真度;其次,动量引导去噪阶段沿去噪轨迹累积目标对齐梯度,以实现稳定且时间一致的语义偏移。该攻击扰动物理条件通道,如HDMap嵌入和3D框特征。

关键结果

该攻击平均使FID增加约9%,平均使FVD增加约3.9%,目标攻击成功率(ASR)为0.55。下游任务中,攻击视频使3D检测性能下降约4%,并使开环规划性能恶化约20%。

局限性

  • 白盒攻击假设需要完全访问世界模型,限制了在黑盒场景中的适用性。
  • 攻击成功率(ASR)为0.55,表明并非所有目标攻击都能成功。
  • 感知保真度略有下降(FID和FVD增加),可能被检测到。
  • 评估仅限于驾驶视频领域,未证明对其他世界模型应用的泛化能力。

技术栈

World ModelsDiffusion ModelsHDMap3D Object DetectionAdversarial Attacks

标签