差分隐私(DP)是一种数学上严谨的框架,用于在保护个体数据主体隐私的同时发布关于数据集的统计信息。它使数据持有者能够共享群体的聚合模式,同时限制能够识别出特定个体的信息。这是通过向统计计算中注入经过精心校准的噪声来实现的,从而在保留统计效用性的同时,可证明地限制对数据集中任何个体的推断能力。
描述差分隐私的另一种方式是将其视为对用于发布统计数据库聚合信息的算法的一种约束,该约束限制了数据库中记录私有信息的披露。例如,一些政府机构使用差分隐私算法发布人口统计信息或其他统计聚合数据,同时确保调查回复的机密性;公司也使用该算法收集用户行为信息,同时控制即使内部分析师也无法看到的内容。
粗略地说,如果一个算法的输出被观察者看到时,无法判断某个特定个体的信息是否被用于计算,则该算法是差分私有的。差分隐私通常在与可能包含个体信息的数据库相关的身份识别语境中讨论。尽管它并不直接涉及身份识别和重识别攻击,但差分隐私算法可证明地抵御此类攻击。
起源与形式化
差分隐私的概念由 Cynthia Dwork、Frank McSherry、Kobbi Nissim 和 Adam D. Smith 于 2006 年在其论文《Calibrating Noise to Sensitivity in Private Data Analysis》中提出。该工作为从统计数据库发布的任何数据所关联的隐私损失提供了数学定义。此处,统计数据库指在保密承诺下收集的数据集,其目的是生成统计数据,而这些统计数据的生成不会损害提供数据的个体的隐私。
差分隐私的关键洞察在于,当查询涉及的数据人数越来越少时,需要向查询结果添加更多噪声,以产生相同程度的隐私保护。如果数据库包含单个人的数据,则该人的数据对任何查询结果的贡献为 100%。如果包含一百人的数据,则每个人的数据仅贡献 1%。2006 年的论文形式化了如何根据查询的敏感性来校准噪声,敏感性衡量的是当单个个体的数据被更改时输出可能变化的程度。
ε-差分隐私的定义
设 ε 为正实数,A 为以数据集为输入的随机化算法(代表持有数据的可信方的行为)。设 im A 表示 A 的像。若对于所有仅在一个元素上不同(即一个人的数据)的数据集 D1 和 D2,以及 im A 的所有子集 S,算法 A 被称为提供 (ε, δ)-差分隐私:
Pr[A(D1) ∈ S] ≤ e^ε * Pr[A(D2) ∈ S] + δ
其中概率取自算法使用的随机性。该定义有时被称为“近似差分隐私”,而“纯差分隐私”是 δ = 0 时的特例。在后一种情况下,算法通常被称为满足 ε-差分隐私(即省略 δ = 0)。
该定义背后的直觉是,如果一个人的数据不在数据库中,则统计发布不会损害其隐私。在差分隐私中,每个个体获得的隐私保护大致等同于其数据被移除时的效果。也就是说,在数据库上运行的统计函数不应因任何个体的移除、添加或更改而受到实质性影响。
性质与保证
差分隐私提供了强大且稳健的保证,有助于差分隐私机制的模块化设计和分析。一个关键性质是可组合性:如果在同一数据集上运行多个差分隐私机制,则组合后的隐私损失可以被界定。这使得复杂分析可以由更简单的差分隐私构建块组成,同时保持整体隐私保证。
另一个重要性质是对后处理的稳健性。如果算法是差分私有的,则对其输出应用的任何函数(在不访问原始数据的情况下)仍然是差分私有的。这意味着对手无法通过转换发布的统计信息来削弱隐私保证。
差分隐私在存在相关数据时也会优雅地退化。即使数据包含个体之间的相关性,隐私保证仍然成立,尽管有效隐私损失可能增加。这使得它比某些在数据不独立时失效的其他隐私模型更具稳健性。
实现差分隐私的机制
实现差分隐私最常见的机制是拉普拉斯机制和高斯机制。拉普拉斯机制向查询结果添加来自拉普拉斯分布的噪声,噪声的尺度根据查询的敏感性除以 ε 进行校准。这提供了纯 ε-差分隐私。高斯机制添加来自高斯分布的噪声,并提供 (ε, δ)-差分隐私,这通常在高维或迭代计算中更方便。
另一个重要机制是指数机制,用于在保护隐私的同时从有限选项集中选择最佳答案。它根据效用函数为每个选项分配概率,效用较高的选项获得较高的概率,但概率经过仔细校准以确保差分隐私。
在机器学习中的应用
差分隐私在机器学习中变得越来越重要,尤其是在敏感数据上训练模型时。最广泛使用的技术是差分隐私随机梯度下降(DP-SGD),它修改了标准随机梯度下降优化算法。在 DP-SGD 中,梯度被裁剪到最大范数以限制其敏感性,并在更新模型参数之前向平均梯度添加噪声。这确保了训练后的模型不会泄露太多关于任何单个训练示例的信息。
DP-SGD 已被应用于训练大型语言模型和其他深度学习系统。例如,研究团队探索了Transformer模型的差分隐私训练,尽管隐私-效用权衡仍然是一个挑战。该技术也与生成式 AI系统相关,在这些系统中,保护训练数据的隐私日益受到关注。
多家科技公司已将差分隐私纳入其产品中。苹果使用差分隐私机制在 iOS 和 macOS 中收集用户行为统计数据,例如学习热门表情符号和新词,同时保护个体用户隐私。Google DeepMind和其他谷歌团队探索了差分隐私在各种应用中的使用,包括联邦学习和分析。OpenAI也研究了其模型的差分隐私训练。
挑战与权衡
差分隐私的主要挑战是隐私与效用之间的权衡。添加更多噪声提供更强的隐私保证,但会降低统计结果的准确性。参数 ε 控制这一权衡:较小的 ε 值提供更强的隐私,但需要更多噪声,而较大的 ε 值允许更准确的结果,但隐私保证较弱。对于什么是可接受的 ε 值,没有普遍接受的标准,通常取决于具体应用和数据敏感性。
另一个挑战是许多查询的组合。虽然差分隐私是可组合的,但隐私损失会随着每次额外查询而累积。在多次查询后,总隐私损失可能变得过大,无法提供有意义的保护。高级组合定理可以帮助更紧密地界定总损失,但根本问题仍然存在。
在机器学习中,差分隐私训练通常导致模型准确性低于非隐私训练,尤其是对于像神经网络这样的复杂模型。训练期间添加的噪声会减慢收敛速度并降低最终性能。研究人员继续开发改进隐私-效用权衡的技术,例如更好的噪声调度、自适应裁剪以及使用公共数据在差分隐私微调之前预训练模型。
更广泛的影响与未来方向
差分隐私已成为隐私工具箱中的标准工具,被政府机构和公司广泛使用。美国人口普查局在 2020 年人口普查中使用了差分隐私,以保护受访者机密性,同时发布人口统计信息。这标志着该技术在实际部署中的重大进展。
在人工智能领域,差分隐私被视为构建可信系统的关键组成部分。随着机器学习模型在日益庞大和敏感的数据集上训练,提供正式隐私保证的能力变得更加重要。开发能够扩展到大型模型和数据集的差分隐私算法是一个活跃的研究领域。
未来方向包括提高差分隐私训练的效率、开发针对高维数据的更好机制,以及将差分隐私与联邦学习和安全多方计算等其他隐私增强技术相结合。该领域持续发展,新的理论结果和实际实现不断涌现。