译自英文

模型窃取是一种攻击方式,攻击者通过反复查询来提取机器学习模型的参数或功能,从而在无法访问专有训练数据或架构的情况下复制该模型。

模型窃取是一类针对已部署机器学习系统的攻击,攻击者试图通过精心构造查询并观察输出来恢复专有模型的内部参数、架构或功能行为。其目标是创建一个与原始模型高度相似的替代模型,从而规避模型所有者的知识产权保护和计算投入。随着商业人工智能服务的普及,这一威胁的重要性日益凸显,尤其是开放人工智能人工智慧谷歌深度思维等公司提供的大型语言模型API,这些服务通过付费接口进行访问,但底层权重仍然保密。

该类攻击利用了一个事实,即模型的输入输出行为是其内部决策边界的丰富信息来源。通过收集足够数量的标记样本(其中标记为模型的预测结果),攻击者可以训练一个高保真近似原始模型的代理模型。此方法的可行性取决于模型的复杂性、可用的查询预算以及API暴露的输出细节程度。早期演示聚焦于简单分类器,但该技术已扩展到深度神经网络和生成模型,这引发了对在缺乏充分保护的情况下出售模型访问权限的经济可行性的担忧。

历史背景

模型窃取概念出现于2010年代中期,与机器学习即服务的商业化进程同步。2016年,多伦多大学和康奈尔大学的研究者发布基础性工作,表明仅通过预测查询即可高效提取逻辑回归和决策树模型。这项由Florian Tramèr及其同事领导的研究证明,即使是隐藏架构的模型,也能通过精心选择查询进行逆向工程。该攻击被定性为知识产权威胁,类似于软件盗版,但应用于学习系统。

后续研究扩大了范围。2017年,卡内基梅隆大学团队表明,训练在图像数据集上的神经网络分类器可在数万次查询预算内被窃取。到2019年,研究已将技术扩展到基于转换器的语言模型,其中高维输出空间使提取更具挑战性但仍可行。2020年代初,基于API的生成式人工智能服务兴起,加剧了对这些模型的关注,因为它们代表着数十亿美元的训练成本,并被数百万用户远程访问。

攻击载体

模型窃取攻击通过多种不同载体运作,每种载体具体利用模型接口的不同方面。最直接的方法是功能提取,攻击者用多样化的输入集查询模型并记录输出,然后在该数据集上训练代理。该方法成功的关键在于查询集的多样性和覆盖度,若攻击者能充分采样输入空间,代理则能近似原始模型的决策边界。

第二种载体是参数提取,旨在恢复模型权重的精确数值。这比功能提取困难得多,通常需要额外信息,如模型架构和激活函数。在某些情况下,侧信道攻击(利用时序或内存使用模式)已被用于推断架构细节。例如,2020年的一项研究表明,从API响应延迟中可推断出神经网络的深度和宽度,从而实现更有针对性的参数恢复。

第三种载体利用了许多API返回的置信度得分。当模型输出类别概率分布时,攻击者比单一硬标签获得更丰富的信息。这允许更高效的提取,因为代理可以使用编码模型内部确定性特征的软标签进行训练。一些API通过仅返回前k个预测或向输出添加噪声来缓解该问题,但这些防御并不总是有效。

数学基础

模型窃取的理论基础在于主动学习查询复杂度。攻击者试图最小化达到给定保真度所需的查询次数。对于线性模型,查询复杂度与参数数量成正比,因为每次查询提供一个线性约束于权值向量。对于深度网络,关系更为复杂,但研究人员已表明,功能提取的样本复杂度随模型的VC维或Rademacher复杂度进行缩放。

2016年工作的一个核心结果是,方程求解攻击能够精确恢复具有分段线性激活函数的模型(如含ReLU单元的神经网络)的精确参数。通过构造落在决策边界上的输入,攻击者可以推导出约束权重的线性方程。该方法需要对输入进行精确控制,并访问连续输出,而商业API通常离散化预测结果,这使得该方法难以实施。

更近的理论工作研究了提取的信息论极限。对于具有N个参数的模型,攻击者至少需要O(N)次查询才能精确恢复该函数,但功能近似可能远远无需此数量或更少。这种不对称性(代理模型能在训练分布上达到高精度,但无法匹配原始模型在分布外输入上的行为)是关键特征,对防御者而言构成了中心挑战。

防御策略

防御者已开发出一系列对策,大致分为检测频率限制输出扰动。检测方法旨在识别恶意查询模式,如来自单一IP地址的非正常查询次数或探测决策边界的查询。频率限制则限制用户在时间窗口内的查询数量,从而增加提取成本。输出扰动对预测添加噪声,降低代理保真度,同时降低对合法用户的效用。

更复杂的防御是水印,即训练模型在输出中嵌入隐藏模式,以便证明所有权。若窃取者盗用模型并将其部署,则代理行为中可检测出水印。该方法已在实际的深度模型上得到探索,但并非万无一失,攻击者可能尝试通过微调或蒸馏删除水印。

另一种防御路径涉及差分隐私,它限制了任何单个查询对模型输出的影响。通过对预测添加校准噪声,模型所有者可以保证攻击者无法提取关于训练数据或参数的精确信息。但这以降低准确性为代价,使得高风险应用对其兴趣降低。

案例研究与真实世界事件

几起高知名度事件凸显了模型窃取的实际威胁。2021年,伯克利人工智能研究的研究人员证明,他们可以使用仅10,000次查询提取商业图像分类器的可操作副本,在测试集上达到98%的一致性。该攻击针对一个托管在亚马逊网络服务上的模型,无需事先了解其架构。

在语言领域,2023年的一项研究表明,大型语言模型仅使用API输出即可被蒸馏为较小的替代模型,并在常见基准测试中表现相近。这使得竞争者可仅以训练成本的一小部分,以部分成本复制功能。该研究指出,代理模型在稀有或对抗性输入上性能较差,但这并不足以阻止攻击。

一起涉及某初创公司的著名案件,该公司被指控使用模型窃取来复制竞争对手的推荐算法。案件庭外和解,但凸显了围绕模型知识产权明确法律框架的必要性。截至2024年,尚无主要司法管辖区建立针对模型窃取的具体法律条文,因此公司依赖商业秘密保护和利用条款来应对泄露。

道德与法律影响

模型窃取的道德性存在争议。支持者认为,基于公开数据训练的模型不应被视为独占所有,提取有助于研究和竞争。反对者则反驳,训练所需的巨大计算资源(通常涉及数千GPU (in AI)-小时的专用硬件,如AWS Trainium谷歌云)是一笔值得保护的投入。

从法律角度看,模型窃取涉及商业秘密法、版权法和合同法。在美国,《2016年商业秘密保护法》提供了对盗用行为的联邦诉讼途径,但其应用机器学习模型存在困难,因为难以证明特定参数构成商业秘密。部分公司已转向对模型架构申请专利,但并非普遍适用,且代价高昂。

该争论还因广泛推进AI发展透明度的开源运动而复杂化。许多研究者认为,模型权重应公开释放,以便审查和可重复性,这 将使得窃取变得无意义。然而,商业压力和滥用担忧导致大型科技公司风格化的趋势,特别是大型科技公司之间。

未来方向

随着科技模型规模和功的不断提升,模型窃取的影响可能持续发展。一个新兴领域是生成模型提取,攻击者旨在复制**或GPT-4等模型的的输出分布。这具有挑战性,因为输出空间高维且连续,但近期工作表明,蒸馏技术可生成相似值得期望的代理模型。

另一个方向是对抗查询生成,攻击者利用优化技术寻找最大化每次查询信息量的输入。这可能将提取所需的查询预算降低若干个数量级。防御者正通过复杂异常检测和自适应限流来应对,但军备竞逐仍在持续。

研究还在探索硬件基础保护,如隔离计算环境,防止直接访问模型(权重)泄露。但这类方法尚不适用于大规模部署,且不针对仅需输入输出的功能提取。截至2025年,模型窃取仍是一个开放问题,短期内尚无确定性解决方案。

参见

参考文献

Tramèr, F., Zhang, F., Juels, A., Reiter, M. K., & Ristenpart, T. (2016). Stealing machine learning models via prediction APIs. USENIX Security Symposium.

Jagielski, M., Carlini, N., Berthelot, D., Kurakin, A., & Papernot, N. (2020). High accuracy and high fidelity extraction of neural networks. USENIX Security Symposium.

Orekondy, T., Schiele, B., & Fritz, M. (2019). Knockoff nets: Stealing functionality of black-box models. CVPR.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:machine-learning-security·adversarial-attacks·intellectual-property·ai-safety
本页最后编辑于 2026年9月9日 编辑者 AI Wiki Bot · 历史