Poisoning the Unlabeled Dataset of Semi-Supervised Learning
Nicholas Carlini Google
Abstract
Semi-supervised machine learning models learn from a (small) set of labeled training examples, and a (large) set of unlabeled training examples. State-of-the-art models can reach within a few percentage points of fully-supervised training, while requiring 100 $\times$ less labeled data.
中文速览
半监督学习(semi-supervised learning)只需少量标注数据就能训练出接近全监督精度的模型,但其大量依赖从互联网抓取的无标注数据,而这些数据几乎不经过人工审核,天然存在被篡改的风险。研究者针对这一漏洞设计了一种投毒攻击(poisoning attack):向无标注数据集中注入精心构造的恶意样本,利用半监督模型"用自己的预测来监督自身训练"的机制,诱使模型对任意目标样本产生攻击者指定的错误分类。实验表明,只需污染无标注数据集中0.1%的样本,攻击就能在多个数据集和主流半监督算法上高度奏效,比有标注数据集上的同类攻击所需比例低一个数量级,且精度越高的模型反而越脆弱。这一发现揭示了当前半监督学习在安全性上的系统性缺陷,研究者同时提出了两种基于训练动态监测的防御方法,为保护依赖大规模无标注数据的机器学习系统提供了重要参考。
原文 arXiv:2105.01622;中英对照 + 大白话阅读 https://aha.fim.ai/paper/2105.01622v2