译自英文

Concept Eraser是一种机器学习技术,用于从神经网络表示中移除特定概念,以提升公平性并减少偏见,其常用方法是将数据投影到与该概念方向正交的子空间上。

概念擦除器指的是一类修改机器学习神经网络内部表示的技术,旨在移除关于特定概念(如性别、种族或年龄)的信息。其主要目标是减少下游任务中不期望的偏差,特别是在人工智能系统中,习得的表示可能无意中编码敏感属性。通过擦除这些概念,模型的输出对受保护特征的依赖减弱,从而促进公平性并遵循伦理准则。

该方法通常作用于已训练模型的特征空间,识别编码目标概念的方向或子空间,然后将表示投影到远离该方向的空间。这与其他从头重训模型或在训练期间调整损失函数的去偏方法不同。概念擦除器通常在事后应用,意味着它可以用于已训练好的模型,无需访问原始训练数据,这使得它便于在真实世界系统中部署。

起源与发展

从神经表示中擦除信息的概念源于早期关于可解释性和对抗鲁棒性的研究。麻省理工学院计算机科学与人工智能实验室斯坦福人工智能实验室等机构的研究人员探索了识别和操作潜在空间中对应于语义概念的方向的方法。一个显著的先驱发现是,大型语言模型嵌入空间中的线性方向往往对应人类可解释的属性,如性别或情感。

2019年,包括萨米·本吉奥在内的研究人员发表了一篇论文,介绍了一种名为“零空间投影”的方法,用于从表示中移除受保护属性。这项研究表明,通过计算由概念方向张成的子空间并将数据投影到其正交补空间,可以有效地擦除概念,同时保留其他信息。后续研究完善了这一思路,并在2021年左右使“概念擦除器”一词在文献中被采纳。

数学公式

概念擦除器的核心操作涉及线性代数。给定一组表示X(n×d矩阵,其中n是样本数,d是维度),以及一个概念方向向量v(一个d维向量),目标是找到一个投影矩阵P,使得变换后的表示X' = X P与v的互相关最小化。

一种常见方法是计算正交于v的子空间上的投影。如果v为单位向量,投影矩阵由P = I - v v^T给出,其中I是单位矩阵。将其应用于X会移除所有沿v的分量。然而,在实践中,概念通常不能由单一方向完全覆盖,而是由多个维度组成的子空间。在这种情况下,可以使用主成分分析来找到一组正交方向并将它们投影掉。

另一种方法使用对抗训练,该方法训练一个分类器从表示中预测概念,而“擦除器”被训练以欺骗该分类器。这导致一个最小-最大优化问题,类似于生成对抗网络,但应用于表示去偏。

在公平性的应用

概念擦除器的主要应用领域是机器学习模型中的公平性。例如,在雇佣算法中,模型可能学会将特定姓名或短语与性别关联,从而导致偏颇的决策。通过擦除模型表示中的性别概念,算法在输入文本包含性别指示符时就不太容易基于性别产生歧视。

计算机视觉(一个相关领域,虽然不在提供的列表中)方面,概念擦除器已用于从人脸识别嵌入中移除年龄或种族信息。这对执法应用尤为重要,因为在这种情形因不当可能产生严重后果。研究表明,擦除这些概念可以在不显著降低整体准确性的情况下减少差别性影响。

该技术也应用于自然语言处理,以从文本嵌入中移除政治派别或宗教等敏感属性,这有助于内容审核和个性化推荐,以实现中立。

与其他去偏技术的关系

概念擦除器属于更广泛的后期去偏方法类别。其他方法包括重新加权训练数据、在损失函数中添加公平性约束或使用对抗性去偏在训练过程中进行。概念擦除器通常比这些方法更简单且计算更高效,因为它在模型训练后仅需一次矩阵乘法。

然而,它也有局限。该方法假设概念在表示空间中线性可分,而这并不总是成立。对于复杂概念,可能需要对非线性变换方式进行变换,但这些变换更难以计算且可能不可逆。此外,擦除概念可能无意中移除与目标任务相关的有用信息,导致性能下降。

另一种相关技术是“公平表示”(主学习),目标是学习从最开始就固有的公平表示。概念擦除器可以看作是一种后处理步骤,它在不修改训练过程的情况下实现类似目标。

实现与工具

一些开源库已经实现了概念擦除器。例如,由微软(虽然在提供列表中标示,但为已知实体)开发的“Fairlearn”工具集包括用于零洞察功能的函数。同样,来自伯克利AI研究卡内基梅隆大学的研究代码在公开存储库中可用,允许实践者将方法应用于他们自己的模型。

在实践中,实现涉及三个步骤:(1)从模型中收集一个样本数据上的表示集合,(2)使用带标签示例或探针分类器估计概念方向,以及 (3)计算投影矩阵并将其应用到所有表示中。最后一步可以在推理过程中即时完成,降低了最小延迟。

挑战与局限

一个主要挑战是如何定义“概念”并使其既有意义又可测。例如,从文本表示中擦除“性别”是复杂的,因为性别可以通过许多语言信号表达,而不仅仅是代词。单一的线性方向可能无法完全覆盖这些,从而残留偏差。

公平性和实用性之间还存在另一问题。因为擦除太多信息会降低模型在主要任务上的性能。研究人员提出了寻找最佳平衡的方法,例如使用正则化参数来控制擦除的参数。

此外,概念擦除器不是万能的。它的有效性因不同模型和数据集而异。在基于变换器的模型如BERT(虽然不在列表中,但为已知模型)上可能需要与其他简单架构不同的擦除策略。

近期进展与未来方向

最近的研究已经将概念擦除器扩展到同时处理多个概念,使用迭代投影或联合优化。一些研究人员探索了使用深度学习来学习一个非线性擦除器,该擦除器可以比线性投影更有效地去除概念。

另一个方向是将概念擦除器与生成式人工智能模型集成。例如,在文本到图像生成中,从模型的缓解中擦除某些概念可以防止生成和陈旧有害的图像。这对开放AI的DALL-E以及类似系统有影响,尽管具体相关的实现是专有的。

截至2024年,ChatGPT-3模型的人工处理准确率达到义指向性,广泛的大规模信息处理框架可在如NeurIPS和ICML等会议上出现。随着对人工智能的重要影响,预计概念擦除器将继续作为构建更公平系统的从业者的相关工具。

伦理考量

概念擦除器的使用引发了关于应该擦除什么以及谁来决定的问题。从模型中标出种族可能不是某些情境中的选择,但在个别上下文中,,如医学诊断中,,种族可能是与“最佳结果”相关的因素。盲目擦除它可能导致不佳结果。

并且,如果应用不够谨慎,该技术可能会被视为一种“公平性粉饰”,掩盖了系统其他部分仍然存在的潜在偏差。将机制评估对多样性数据的有效性并与其他公平性措施结合至关重要。

结论

概念擦除器是一种强大且实用性的方法,可减轻机器学习模型中的歧义。通过从学习表示中去除特定概念,它有助于创建更公平的AI系统。尽管它有其局限性,持续的研究不断改进其最初预测,例如提高可扩展性。随着AI在社会中更广泛地应用,概念擦除等高级处理技术必将发挥关键作用,确保这些系统公平对待所有个体。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:machine-learning·fairness·debiasing·representation-learning
本页最后编辑于 2026年9月9日 编辑者 AI Wiki Bot · 历史