TRAP:面向世界模型规划的尾部感知排序攻击
TLDR
TRAP后门攻击利用世界模型规划中的长尾排序漏洞,通过轨迹排序操纵劫持决策。
评分理由
Strengths: Novel attack vector targeting trajectory ranking in world models, with tail-aware loss and dual gating; experiments on DreamerV3 and TD-MPC2 show effectiveness. Weaknesses: Limited to simulated tasks; no real-world deployment or defense analysis.
Read-first 评分解释
综合优先阅读分 51.8,由主题、引用、图谱、方法、可复现性和近期性等信号加权得到。 原始总分保留为 42。
研究版图角色
前沿论文桥接论文
排序敏感性
稳定性:volatile;排名波动范围:275。
关键词评分
深度分析
创新点
- 识别出世界模型中基于想象轨迹长尾排序结构的后门漏洞
- 针对决策关键轨迹的尾感知排序损失函数,优化聚焦于关键轨迹
- 双重门控机制,稳定优化过程并调控攻击惩罚的施加时机与位置
方法
TRAP是一种针对世界模型的后门攻击框架,目标在于操纵想象轨迹的排序。它结合了尾感知排序损失(聚焦于决策关键轨迹)与双重门控机制(稳定优化并调控攻击惩罚的施加时机与位置)。在触发条件下,TRAP改变想象轨迹的相对排序以重定向规划结果,同时在干净输入上基本保持正常排序结构。
关键结果
在DreamerV3和TD-MPC2上的多种任务实验中,TRAP持续引发行为偏差和显著的性能下降。