译自英文

对抗样本是特意构造的输入,旨在欺骗机器学习模型做出错误预测,通常通过对合法数据添加难以察觉的扰动来实现。它们是对抗性机器学习研究的核心焦点。

对抗样本是旨在欺骗人工智能模型的输入,通常通过向合法数据引入微小且往往难以察觉的扰动,导致机器学习模型错误分类或行为异常。这些输入利用了大多数学习算法所依赖的统计假设,即训练数据和测试数据通常来自同一分布。在实践中,攻击者可以故意提供违反这一假设的伪造数据,从而在垃圾邮件过滤、计算机安全、生物特征识别和自动驾驶等高危应用中引发故障。

对抗样本的研究属于对抗性机器学习这一更广泛领域,该领域既研究针对机器学习算法的攻击,也研究针对此类攻击的防御。常见的攻击类别包括规避攻击(在推理时修改输入以逃避检测)、数据投毒攻击(破坏训练数据)、拜占庭攻击(针对分布式学习系统)以及模型窃取(攻击者试图窃取或复制模型的功能)。

历史发展

对对抗样本的兴趣源于早期垃圾邮件过滤的研究。在2004年1月的MIT垃圾邮件会议上,John Graham-Cumming证明,一个机器学习垃圾邮件过滤器可以被用来击败另一个此类过滤器,方法是自动学习在垃圾邮件中添加哪些单词以使其被归类为非垃圾邮件。同年晚些时候,Nilesh Dalvi及其同事指出,垃圾邮件过滤器中使用的线性分类器可以通过简单的规避攻击被击败,因为垃圾邮件发送者会在邮件中插入“好词”。大约在2007年,一些垃圾邮件发送者在图像垃圾邮件中添加随机噪声来模糊单词,以击败基于OCR的过滤器。

2006年,Marco Barreno等人发表了《机器学习能否安全?》,概述了攻击的广泛分类。直到2013年,许多研究人员仍希望支持向量机和神经网络等非线性分类器能够抵御攻击者。这一希望因Battista Biggio等人在2012年和2013年展示了针对此类模型的首次基于梯度的攻击而破灭。从2014年开始,Christian Szegedy等人表明深度神经网络可能被攻击者欺骗,再次使用基于梯度的方法来构造对抗扰动。

机制与性质

对抗样本通常通过向输入添加一个微小且经过精心计算的扰动来生成。对于图像分类器,这通常涉及以人类难以察觉的方式修改像素值,但会导致模型以高置信度输出不同的类别。基于梯度的方法,如快速梯度符号法,利用模型的损失函数来确定使分类错误最大化的扰动方向。

进一步的研究表明,对抗样本在不受控的环境中更难生成,因为环境约束(如小幅旋转或轻微光照变化)可以抵消噪声的效果。例如,在实验室条件下能欺骗模型的对抗图像,在从不同角度或不同光照下观看时可能失去其对抗性。这一观察对现实世界攻击具有重要意义,因为物理条件会引入变异性。

Google Brain的研究人员(包括Nick Frosst)指出,让自动驾驶汽车错过停车标志通常比生成对抗样本更容易,只需物理移除标志本身即可。Frosst还认为,对抗性机器学习社区错误地假设在某一数据分布上训练的模型会在完全不同的分布上表现良好。他建议探索更接近人类感知特征的新机器学习方法。

著名演示

几项高调的演示展示了对抗样本的强大能力。研究人员表明,仅改变图像中的一个像素就能欺骗深度学习算法。在另一个案例中,一个3D打印的玩具乌龟,其纹理经过精心设计,使Google的目标检测AI将其分类为步枪,无论从哪个角度观察乌龟都是如此。制作这只乌龟只需使用低成本、商业上可用的3D打印技术。

一张经过机器调整的狗图像被证明对计算机和人类都看起来像猫,2019年的一项研究报告称,人类可以猜测机器将如何对对抗图像进行分类。研究人员还发现了扰动停车标志外观的方法,使自动驾驶车辆将其分类为合并或限速标志。在另一起事件中,McAfee攻击了特斯拉以前的Mobileye系统,通过在限速标志上添加一条两英寸的黑色胶带,诱使其以超过限速50英里/小时的速度行驶。

用于欺骗面部识别系统或车牌读取器的对抗图案眼镜或服装,催生了一个“隐身街头服饰”的小众行业。这些物理对抗样本表明,该现象不仅限于数字输入。

在安全与恶意软件中的应用

对抗样本对计算机安全具有重大影响。在恶意软件检测中,研究人员提出了对抗性恶意软件生成方法,可自动构造二进制文件以规避基于学习的检测器,同时保留恶意功能。GAMMA等基于优化的攻击使用遗传算法将良性内容(如填充或新的PE节)注入Windows可执行文件。这种方法将规避视为一个约束优化问题,在误分类成功率和注入负载大小之间取得平衡,并已显示出对商业杀毒产品的可迁移性。

补充性工作使用生成对抗网络(GAN)学习特征空间扰动,使恶意软件被分类为良性。例如,Mal-LSGAN用最小二乘目标替换标准GAN损失,并修改激活函数以提高训练稳定性。该方法生成的对抗性恶意软件示例可显著降低多个检测器的真阳性率。

聚类算法在安全应用中用于恶意软件和计算机病毒分析,也容易受到攻击。这些算法旨在识别恶意软件家族并生成特定的检测签名,但攻击者可以操纵输入以逃避聚类或误导生成的签名。

音频与物理攻击

对抗攻击不仅限于图像。研究人员创建了对抗性音频输入,将命令伪装在看似良性的音频中,以欺骗智能助手。这些攻击可用于向目标系统注入算法或触发意外操作。并行文献探讨了人类对此类刺激的感知,研究人们是否能检测或理解隐藏的命令。

在人类动作识别领域,新兴的对抗攻击非常有效。这些系统用于监控、自动驾驶和室内监测。攻击者向人类特征的表示中引入噪声以欺骗识别系统。值得注意的是,这些攻击不一定需要访问识别系统本身,并且对人类用户来说可能难以察觉。

防御与缓解措施

防御对抗样本仍然是一个开放的挑战。对抗训练等技术(即模型在对抗样本上训练以提高鲁棒性)已显示出一定前景,但通常会降低干净输入的准确性。其他方法包括输入预处理、对抗输入检测以及提供形式保证的认证防御。

虽然对抗性机器学习仍主要根植于学术界,但Google、Microsoft和IBM等大型科技公司已开始整理文档和开源代码库,使他人能够具体评估机器学习模型的鲁棒性并最小化对抗攻击的风险。这些资源旨在标准化评估方法,并鼓励开发更具弹性的系统。

数据投毒与创造性保护

一个相关的威胁是数据投毒,即攻击者破坏训练数据以影响模型行为。2023年,芝加哥大学的研究人员发布了一个名为Nightshade的数据投毒过滤器。它供视觉艺术家使用,将其应用于艺术作品,以破坏文本到图像模型的数据集,这些模型通常未经图像创作者同意就从互联网抓取其数据。该工具代表了对对抗技术的防御性使用,允许个人保护其知识产权免受在训练生成式AI模型中的未授权使用。

持续研究与未来方向

对抗样本领域持续发展,研究人员正在探索新的攻击向量和更稳健的防御机制。关于在某一数据分布上训练的模型会在完全不同的分布上表现良好的假设日益受到质疑。一些研究人员提倡采用一种更接近人类感知的新机器学习方法,这种方法通常对微小扰动更具鲁棒性。

随着深度学习模型在更多关键应用中的部署,理解和缓解对抗样本变得越来越重要。攻击与防御之间的相互作用推动了持续的研究,每一种新防御措施往往都会激发更复杂的攻击。最终目标是创建不仅在干净数据上准确,而且在存在攻击者的情况下也能可靠的机器学习系统。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:adversarial-machine-learning·machine-learning-security·ai-safety·robustness
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史