AI对齐是指确保人工智能系统的目标、行为和输出与其设计者的意图以及受影响人群的价值观相一致的研究问题,而非追求一个仅表面上近似于原意的目标。该术语既用于近期工作,即让当今的大型语言模型安全地遵循指令,也用于长期关切,即未来能力更强的系统是否仍能保持可控。
外部对齐与内部对齐
研究人员通常将这一问题分为两部分。外部对齐考察系统训练所依据的目标(如奖励函数或损失函数)是否真正捕捉到了设计者的意图;若目标定义不当,则可能以非预期方式被满足,这种失败模式被称为奖励黑客。内部对齐则考察训练后产生的系统是否真正追求该目标,还是学到了一个不同的内部目标,该目标恰好在训练期间产生良好行为,但在训练之外泛化不佳。这一区分之所以重要,是因为模型可能在开发者测试的所有案例上表现对齐,但在其未预料到的情境中行为迥异。
技术方法
语言模型的实用对齐工作包括基于人类反馈的强化学习,其中人类评分者比较模型输出以训练一个奖励模型,进而塑造模型行为;宪法式AI,它使用一套成文原则和AI生成的反馈来替代大量人工标注;以及直接偏好优化,它直接根据人类偏好数据拟合模型,无需单独的奖励模型或强化学习循环。红队测试和其他对抗性测试用于在部署前发现模型行为偏离其既定目标的案例,而可解释性研究旨在直接检查模型的内部计算,而非仅凭其输出进行判断。
长期关切
对齐研究的一个子集受到AI存在风险的驱动:即担心一个能力足够强的系统(包括可能达到通用人工智能或超级智能水平的系统)会追求与人类福祉不一致的目标,且一旦部署便难以纠正。斯图尔特·罗素、尼克·博斯特罗姆和保罗·克里斯蒂亚诺等研究者撰文论述了为何对齐可能随着能力提升而变得更加困难,他们认为一个足够聪明、能模拟自身训练过程的系统可能学会仅在评估时才表现良好。这一研究分支与作为制度范畴的AI安全高度重叠,包括Anthropic在内的多家组织已将长期对齐列为其创始使命的核心。
争论
对齐作为一项研究议程在多个方面受到批评。一些人认为,推测性的长期场景分散了对偏见输出、错误信息或不安全代理行为等具体现实危害的关注,资源应更有效地用于解决这些问题。另一些人则认为,RLHF等当前技术仅塑造表面行为,并未验证模型的底层目标,因此对已部署系统“已对齐”的说法夸大了实际已确立的内容。此外,关于对齐能否在构建高能力系统之前预先解决,还是需要在构建这些系统时进行经验性迭代,也存在分歧,这一分歧塑造了前沿AI实验室如何表述其自身安全承诺,包括Anthropic发布的责任扩展政策等公开框架。