对抗样本是指有意设计用来使机器学习模型产生错误的输入数据。这些输入通常通过对合法数据施加微小且往往难以察觉的扰动而生成,例如向图像添加噪声或修改文本中的几个词语。对抗样本的存在凸显了许多机器学习系统中的一个根本性漏洞,这些系统通常假设训练数据和测试数据来自相同的统计分布。然而,在实践中,用户或攻击者可能提供违反这一假设的伪造数据,从而在安全、自动驾驶和生物特征识别等高危应用中导致错误预测。
对这些攻击及其防御措施的研究属于对抗性机器学习领域。该领域探讨模型如何被欺骗以及如何使其更加鲁棒。对抗样本与其他类型的模型故障不同,因为它们经过刻意优化,专门利用模型决策边界中的特定弱点,而非源于随机噪声或泛化能力差。
历史
对抗样本的概念源于垃圾邮件过滤的早期工作。2004年1月,在MIT垃圾邮件会议上,John Graham-Cumming证明,一个机器学习垃圾邮件过滤器可被用来击败另一个此类过滤器,方法是通过自动学习在垃圾邮件中添加哪些词语以使其被分类为非垃圾邮件。同年,Nilesh Dalvi及其同事指出,垃圾邮件过滤器中使用的线性分类器可被简单的规避攻击所击败,即垃圾邮件发送者在其邮件中插入正常词语。大约在2007年,一些垃圾邮件发送者在图像垃圾邮件中添加随机噪声以模糊词语,从而击败基于OCR的过滤器。
2006年,Marco Barreno等人发表了《机器学习能否安全?》一文,概述了一个广泛的攻击分类体系。直到2013年,许多研究人员仍希望支持向量机和神经网络等非线性分类器可能对对抗者具有鲁棒性。然而,这一希望被打破,因为Battista Biggio等人在2012-2013年展示了针对此类模型的首次基于梯度的攻击。2014年,Christian Szegedy及其同事表明,深度神经网络可被对抗者欺骗,他们使用基于梯度的方法来构造对抗扰动。这项工作引发了关于攻击和防御研究的热潮。
进一步的研究表明,对抗攻击在不受控制的环境中更难产生,因为微小的旋转或光照变化可能破坏对抗效果。Google Brain的Nick Frosst等研究人员指出,物理上移除一个停车标志往往比为一个自动驾驶汽车创建可靠的对抗样本更容易。Frosst还认为,社区错误地假设在一个数据分布上训练的模型会在不同分布上表现良好,并建议需要模仿人类感知的新方法。尽管该领域仍以学术研究为主,但Google、Microsoft和IBM等大型科技公司已开始整理文档和开源代码库,以评估模型鲁棒性并最小化攻击风险。
攻击类型
对抗性机器学习涵盖了几种常见的攻击类别。规避攻击发生在测试阶段,攻击者修改输入以使其被错误分类,例如向停车标志图像添加噪声,使其被识别为限速标志。数据投毒攻击发生在训练阶段,攻击者将恶意数据注入训练集以破坏模型行为。拜占庭攻击针对分布式训练系统,其中受损节点发送不正确的更新。模型提取攻击旨在通过查询模型并训练替代模型来窃取模型的功能。
在恶意软件检测的背景下,研究人员提出了对抗性恶意软件生成方法,这些方法自动构造二进制文件以规避基于学习的检测器,同时保留恶意功能。基于优化的攻击(如GAMMA)使用遗传算法将良性内容(如填充或新的PE节)注入Windows可执行文件。这种方法将规避视为一个受约束的优化问题,在误分类成功率和载荷大小之间取得平衡,并显示出对商业杀毒产品的可迁移性。互补的工作使用生成对抗网络(GAN)来学习特征空间扰动,使恶意软件被分类为良性;例如,Mal-LSGAN用最小二乘目标替换标准GAN损失,以提高训练稳定性并降低多个检测器上的真阳性率。
现实世界示例
对抗样本已在许多领域得到展示。研究人员表明,仅改变一个像素就能欺骗深度学习算法。其他人使用低成本的商用3D打印技术,打印了一个玩具乌龟,其纹理经过设计,使Google的目标检测AI无论从哪个角度观察都将其分类为步枪。一张经过机器调整的狗图像被证明对计算机和人类都看起来像猫。2019年的一项研究报告称,人类可以猜测机器如何对对抗图像进行分类。
在自动驾驶领域,研究人员发现了扰动停车标志外观的方法,使车辆将其分类为合并或限速标志。McAfee攻击了Tesla前Mobileye系统,通过在限速标志上添加一条两英寸的黑色胶带,诱使系统以超过限速50英里/小时的速度行驶。用于欺骗面部识别系统或车牌读取器的对抗性眼镜或服装图案,催生了一个小众的隐身街头服饰行业。
对抗性音频输入可以将命令伪装在看似良性的音频中,以欺骗智能助手。在生物特征识别中,伪造特征可以冒充合法用户或破坏模板库。新兴攻击也对用于监控和自动驾驶的人类动作识别系统有效,攻击者向人类特征表示中引入噪声以欺骗系统,通常无需访问识别系统本身。
防御与缓解措施
针对对抗样本的防御措施包括对抗训练,即模型在对抗样本上进行训练以提高鲁棒性;输入预处理,如去噪或特征压缩;以及检测方法,用于标记可疑输入。然而,不存在通用的防御方法,攻击者不断开发新技术。芝加哥大学研究人员于2023年发布的Nightshade数据投毒过滤器,允许视觉艺术家破坏未经同意抓取数据的文本到图像模型的数据集,这说明了投毒如何被用于防御目的。