译自英文

公平性指标是用于评估和纠正机器学习模型中算法偏见的量化度量,确保决策不会基于性别、种族或残疾等敏感属性不公平地歧视群体或个人。

公平性指标是用于评估机器学习模型的预测或决策是否公平对待个体或群体的量化度量。这些指标是机器学习公平性领域的核心,该领域旨在纠正自动化决策过程中的算法偏见。如果模型的决策基于被视为敏感的变量(如性别、种族、性取向或残疾),则可能被认为不公平。与许多伦理概念一样,公平性和偏见的定义可能引发争议,而公平性指标提供了一种正式、可操作的方式来评估在影响人们生活的系统(如招聘、贷款、刑事司法和内容分发)中相互竞争的公平概念。

公平性指标的发展是机器学习领域近期的一个焦点,自2016年以来相关研究急剧增加。这一激增部分由2016年ProPublica的一份有影响力的报告引发,该报告声称美国法院广泛用于预测再犯的COMPAS软件存在种族偏见。报告指出,黑人被告被错误标记为高风险的可能性几乎是白人被告的两倍,而白人被告则出现相反的错误。COMPAS的创建者Northepointe Inc.对调查结果提出异议,但这一争议凸显了明确、可衡量的公平性定义的必要性。关于决策公平性的量化讨论早于机器学习时代,在1964年美国《民权法案》之后的1960年代中期至1970年代蓬勃发展,尽管由于公平概念的相互竞争,这一讨论在1970年代末基本消失。

统计公平性标准

公平性指标通常根据其所编码的统计公平性概念进行分类。一个常见的类别是群体公平性,要求不同受保护群体的结果相似。人口统计均等(也称为统计均等)要求各组获得正面预测的概率相等。均等几率要求各组之间的真阳性率和假阳性率相等,这意味着模型对所有群体的表现同样良好。机会均等是放宽版本,仅关注真阳性率的相等。基于校准的指标(如按组校准)要求对于被预测具有某种结果概率的个体,实际结果频率在各组之间相同。这些标准通常相互不兼容;满足一个标准可能违反另一个标准,因此在大多数现实环境中不可能同时实现所有标准。

个体公平性和反事实公平性

除了群体层面的指标,公平性还可以在个体层面进行评估。个体公平性由包括卡内基梅隆大学学者在内的研究人员提出,要求相似的个体获得相似的预测。这通常通过捕捉相关特征的距离度量来形式化,确保在非敏感方面相似的两个人受到相同对待。反事实公平性扩展了这一概念,询问如果敏感属性(如种族或性别)不同而其他条件保持不变,预测是否会改变。如果结果会不同,则模型被认为不公平。这些方法更细致,但需要仔细指定相似性和因果关系,这在实践中可能具有挑战性。

模型中的偏见来源

公平性指标用于检测来自各种来源的偏见。语言偏见是一种与查询语言相关的统计抽样偏见,导致信息采样的系统性偏差,从而无法准确呈现存储库中的主题和观点。Luo等人的研究表明,当前主要基于英语数据训练的大型语言模型往往将英美观点呈现为真理,同时淡化非英语视角。例如,当被问及自由主义等政治意识形态时,模型可能从英美角度强调人权和平等,而忽略越南视角中的“反对国家干预个人和经济生活”或中国视角中的“限制政府权力”等方面。性别偏见是另一个常见问题,模型根据传统性别规范分配角色和特征,例如将护士或秘书与女性关联,将工程师或CEO与男性关联。政治偏见也会出现,当训练数据包含广泛的观点时,模型可能根据普遍性倾向于特定意识形态。

实践中的偏见测量

要应用公平性指标,从业者通常需要定义受保护属性(如种族、性别、年龄),选择合适的指标(如均等几率),并在验证数据集上计算该指标。对于二元分类,使用混淆矩阵推导各组的假阳性率和假阴性率等比率。差异影响是一种常见指标,计算为弱势群体与优势群体正面预测率的比率;根据美国平等就业机会委员会的指导方针,比率低于0.8通常被视为危险信号。已开发工具来促进这一过程。IBM发布了面向Python和R的开源工具包,包含减少偏见和增加公平性的算法。Google发布了研究和对抗机器学习偏见的指南和工具。Facebook报告称使用名为Fairness Flow的工具检测其AI中的偏见,但批评者认为该公司的努力不足,指出员工使用很少,因为它不能应用于所有程序且使用是可选的。

案例研究与争议

算法决策在法律系统中的使用一直是一个备受关注的领域。2014年,美国司法部长Eric Holder提出担忧,认为风险评估方法可能过度关注被告无法控制的因素,如教育水平或社会经济背景。2016年ProPublica关于COMPAS的报告引发了关于哪种公平性指标合适的广泛辩论;ProPublica使用了与假阳性率相关的指标,而Northepointe则主张基于校准的公平性。这一案例说明了不同公平性定义之间的根本张力。除了刑事司法,图像识别中也记录了偏见。2015年,Google Photos错误地将一对黑人夫妇标记为大猩猩后,Google道歉。Flickr的自动标签功能将一些黑人标记为“猿类”和“动物”。2016年由AI算法评判的国际选美比赛偏向肤色较浅的个体,这可能是由于训练数据偏见。2018年对三种商业性别分类算法的研究发现,它们对浅肤色男性最准确,对深肤色女性最差。2020年,Twitter的图像裁剪工具被证明偏好较浅肤色的面孔。2022年,文本到图像模型DALL-E 2的创建者承认生成的图像存在显著的刻板印象。

局限性与持续研究

公平性指标并非万能药。没有普遍适用的公平性定义,不同指标可能相互矛盾,这使得评判模型变得困难。选择指标本质上涉及对特定情境下公平性构成的价值判断。此外,指标仅衡量统计模式;它们不解决偏见的根本原因,如有偏的数据收集或社会不平等。关于偏见的起源、类型和减少方法的研究仍在继续。数据增强、重新加权和对抗性去偏等技术用于改善公平性分数,但它们可能与模型准确性产生权衡。截至2020年代中期,该领域仍然活跃,在因果公平性和交叉性公平性(同时考虑多个受保护属性)等领域持续开展工作。科技公司和学术机构,包括斯坦福AI实验室伯克利AI研究,继续为这一不断发展的学科做出贡献。

部署的实际考虑

在高风险领域部署机器学习系统时,组织必须仔细选择符合法律和伦理要求的公平性指标。例如,在招聘中,可能优先考虑机会均等,以确保所有群体的合格候选人不会被忽视。在信贷中,可能强调校准,以确保风险评分对所有人群都准确。随着时间的推移监控公平性也很重要,因为模型可能漂移,新的偏见可能出现。文档和透明度至关重要;许多组织现在发布模型卡,报告各组的公平性指标。然而,正如COMPAS案例所示,即使有充分文档的模型也可能面临关于哪种指标正确的争议。最终,公平性指标是问责的工具,但它们需要人类判断来解释和采取行动。更广泛的目标是构建不仅在总体指标上表现良好,而且尊重个体尊严并促进社会公平的系统。

未来方向

未来公平性指标的研究可能会解决几个挑战。一是开发对少数群体小样本量稳健的指标,因为统计估计可能嘈杂。二是为复杂输出(如生成文本或图像的生成模型)创建指标,传统分类指标不适用。例如,评估生成式AI中的公平性需要新方法来检测刻板或偏见内容。人们也越来越关注参与式方法,让受影响的社区帮助定义其情境中的公平性含义。随着机器学习变得越来越普遍,从AI系统在医疗保健中的应用到自动驾驶汽车,对严谨、情境敏感的公平性指标的需求只会增加。该领域是跨学科的,涉及计算机科学、统计学、法律和哲学,并且仍然是学术研究和行业实践的活跃领域。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:fairness·machine-learning·ethics·bias
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史