The Space of Transferable Adversarial Examples
Florian Tramèr Stanford University Nicolas Papernot Pennsylvania State University Ian Goodfellow Google Brain Dan Boneh Stanford University Patrick McDaniel Pennsylvania State University
Abstract
Adversarial examples are maliciously perturbed inputs designed to mislead machine learning (ML) models at test-time. They often transfer: the same adversarial example fools more than one model.
中文速览
针对机器学习模型的对抗样本(adversarial examples)为何能在不同模型之间"迁移"这一核心谜题,研究者首次从几何维度给出了定量解释:他们提出了一套新方法,通过寻找多个正交攻击方向来直接测量对抗子空间(adversarial subspace)的维度,发现对抗样本实际上张成了一个维度高达约25维的连续子空间,而非零散分布于输入空间的孤立角落。进一步的决策边界(decision boundary)相似性分析表明,不同模型——无论来自同一还是不同模型族——学到的决策边界在任意方向(包括对抗方向和良性方向)上都彼此极为接近,而数据点到自身决策边界的距离反而大于两个模型决策边界之间的间距,这从几何上直接解释了迁移性的成因。在理论层面,研究者推导出了保证迁移性成立的数据分布充分条件,同时也构造出了迁移失败的反例,证明迁移性并非不可鲁棒模型的固有属性。这一发现意义重大:它说明即便模型本身对白盒攻击脆弱,针对迁移型黑盒攻击仍存在设计有效防御的可能性,为对抗鲁棒性研究指明了新方向。
原文 arXiv:1704.03453;中英对照 + 大白话阅读 https://aha.fim.ai/paper/1704.03453v2