AI中的偏见,也称为算法偏见,描述的是计算机化社会技术系统中一种系统性且可重复的有害倾向,即产生不公平的结果,例如以可能偏离算法预期功能的方式优待某一类别而非另一类别。这种偏见可能源于多种因素,包括故意带有偏见的設計决策,或与数据编码、收集、选择或用于训练算法的方式相关的意外或未预见的使用或决策。算法偏见的研究最关注那些反映系统性和不公平歧视的算法,并已在搜索引擎结果、社交媒体平台及其他应用中被观察到,其影响范围从隐私侵犯到强化种族、性别、性取向和族裔方面的社会偏见不等。
随着算法在组织社会、政治、机构和行为方面的能力不断扩展,社会学家开始关注数据的意外输出和操纵可能对物理世界产生的影响。由于算法通常被视为中立且无偏见的,它们可能不准确地投射出比人类专业知识更高的权威性,部分原因是自动化偏见的心理现象。在某些情况下,对算法的依赖可能取代人类对其结果的责任。偏见可能因预先存在的文化、社会或制度期望而进入算法系统;或因特征和标签的选择方式;或因设计的技术局限性;或因在软件初始设计未考虑的意外情境或受众中使用而产生。
偏见来源
偏见可以通过多种方式引入算法。在数据集组装过程中,数据可能根据人类设计的编目标准被收集、数字化、改编并输入数据库。程序员为程序评估和排序数据的方式分配优先级或层级,这需要对分类以及包含或排除做出人类决策。一些算法根据人类选择的标准自行收集数据,这可能反映人类设计者的偏见。其他算法在处理和显示相关数据给人类用户时可能强化刻板印象和偏好,例如,根据相似用户或群体的先前选择来筛选信息。
除了组装和处理数据外,偏见也可能因设计而产生。决定资源分配或审查的算法,例如确定学校安置,在基于相似用户(如信用评分)评估风险时,可能无意中歧视某一类别。将用户与相似用户关联或推断营销特征的推荐引擎,可能依赖于反映广泛种族、性别、社会经济或族裔刻板印象的不准确关联。结果中包含和排除的标准可能呈现意外结果,例如航班推荐软件省略不遵循赞助航空公司航线的航班。算法还可能表现出不确定性偏见,在数据集更大时提供更自信的评估,这可能使结果偏向较大样本,并忽视来自代表性不足人群的数据。
历史背景
最早的计算机程序旨在模仿人类推理和演绎,并被认为在成功且一致地复现预期输出时即正常运行。随着Machine learning和Artificial intelligence的进步,对数据驱动决策的依赖增加,对偏见的担忧也变得更加突出。2021年的一项调查识别了多种形式的算法偏见,包括历史偏见、代表性偏见和测量偏见,每种都可能促成不公平结果。历史偏见源于数据反映过去的社会不平等,代表性偏见发生在某些群体在训练数据中代表性不足时,测量偏见则源于使用有缺陷或不完整的指标。
影响领域
算法偏见已被引用在从选举结果到在线仇恨言论传播的案例中。它也出现在刑事司法、医疗保健和招聘领域,加剧了现有的种族、社会经济和性别偏见。面部识别技术相对无法准确识别较深肤色面孔的问题,已与多起黑人男性被错误逮捕的案件相关,这一问题源于不平衡的数据集。在招聘中,基于历史简历训练的算法可能因过去的招聘实践存在偏见而偏向男性候选人。在医疗保健中,预测模型可能因训练数据不足而对少数族裔人群的疾病诊断不足。
法律与监管回应
AI中的偏见直到最近才在法律框架中得到解决。欧盟的《通用数据保护条例》于2018年生效,包含与自动化决策和解释权相关的规定。2021年提出并于2024年通过的《人工智能法案》建立了基于风险的AI系统要求,包括减轻偏见的措施。这些法规旨在提高透明度和问责制,但由于许多算法的专有性质,执行仍然具有挑战性。
解决偏见的挑战
由于算法的专有性质(通常被视为商业秘密),理解、研究和发现算法偏见的问题仍然存在。即使提供完全透明,某些算法的复杂性也构成理解其功能的障碍。此外,算法可能以无法预见或难以复现分析的方式对输入或输出做出改变或响应。在许多情况下,即使在单个网站或应用程序内,也没有单一算法可供检查,而是由许多相互关联的程序和数据输入组成的网络,甚至在同一服务的用户之间也是如此。
缓解方法
研究人员和实践者已开发出多种缓解AI偏见的方法。这些方法包括用于平衡数据集的预处理技术、在模型训练期间纳入公平约束的处理中方法,以及对输出进行调整的后处理。例如,Data Augmentation可以通过为代表性不足的群体生成合成样本来帮助解决代表性偏见。公平性指标,如人口统计均等和均等几率,用于量化和监控偏见。然而,公平性与准确性之间往往存在权衡,且没有一种公平定义普遍适用。
未来方向
随着AI系统更加融入社会,解决偏见仍然是一个关键挑战。计算机科学家、社会学家、伦理学家和法律学者之间的跨学科合作至关重要。像OpenAI、Anthropic和Google DeepMind这样的组织已发表关于公平性和偏见的研究,尽管其算法在很大程度上仍是专有的。可解释AI的发展,旨在使模型决策更可解释,是一个活跃的研究领域。最终,减少偏见不仅需要技术解决方案,还需要对算法部署的社会和制度背景进行持续审视。