宪法AI(Constitutional AI,简称CAI)是一种训练大型语言模型使其既有帮助性又无害的方法,其中模型根据一套书面原则(称为“宪法”)对自己的输出进行批评和修订,而不是主要依赖人类反馈来处理每一个不良行为示例。该方法由Anthropic在2022年12月的一篇论文《宪法AI:来自AI反馈的无害性》中提出,并成为Claude (AI model family)模型系列背后的核心训练方法之一。
方法
该技术分两个阶段进行。在监督阶段,模型生成对提示的响应,根据宪法原则批评自己的响应,并重写响应以更好地满足这些原则;这种自我批评与修订循环生成一个数据集,用于监督微调。在强化学习阶段,模型比较自己响应的成对样本,并判断哪一个更符合宪法,生成一个偏好数据集来训练奖励模型,这一过程被Anthropic称为来自AI反馈的强化学习,即RLAIF。然后,该奖励模型用于通过强化学习对模型进行微调,其结构类似于RLHF,但用AI生成的标签替代了许多人类提供的偏好标签。
动机
Anthropic的研究人员,包括联合创始人Jared Kaplan,认为纯RLHF有两个弱点:它需要大量人力来审查有害输出,这项工作既缓慢又可能让标注者接触令人不安的内容,而且它只编码了隐性的、不成文的判断,而非可审计的书面标准。相比之下,宪法可以被检查、讨论和修订,不受任何单个标注者偏好的影响,并且同一份文件可以在多次训练运行中重复使用。Anthropic的首席执行官Dario Amodei将该方法视为更广泛赌注的一部分,即安全地扩展强大模型需要不依赖日益增多的人类审查的方法。
宪法
Anthropic原始宪法中的原则来源于多个方面,包括联合国《世界人权宣言》、其他科技公司的信任与安全规范,以及旨在让模型不回避问题并关注狭隘西方默认视角之外观点的指令。Anthropic已发布Claude宪法的多次修订版本,并将其描述为一份不断演变的文件,而非固定规格。
与对齐和安全的关系
宪法AI是研究人员用于追求模型行为与设计者意图之间AI alignment的几种技术之一,与普通RLHF和Direct Preference Optimization并列。支持者认为,它提高了可扩展性,因为AI生成的反馈可以比人类反馈快得多地产生,并提高了透明度,因为宪法本身可以被外部人士阅读和批评。它也被视为对Reward hacking的部分解答,理由是,将偏好植根于明确的书面原则,使得模型更难在满足奖励信号的同时违背基本目标的精神。
批评
批评者提出了几点反对意见。由于用于批评和修订响应的模型依赖于与被训练模型相同广泛的能力,一些研究人员质疑AI反馈是否能捕捉到同等能力的人类监督者会错过的失败,尤其是在模型在被评判任务上接近或超过人类表现时。其他人指出,选择包含哪些原则以及如何解决它们之间的冲突,仍然是单一公司的决策,因此该方法本身并不能解决关于AI系统应反映谁的价值观的争议。宪法AI也没有消除对Red teaming (AI)和其他guardrail机制的需求,因为书面原则仍可能被对抗性提示(如Jailbreak (AI))绕过。
遗产
宪法AI背后的自我批评模式影响了后来关于使用模型监督或评估其他模型的研究,有时被称为LLM-as-judge评估,并且它仍然是前沿实验室发布详细对齐方法论而非将其作为商业机密保存的更广泛引用的例子之一。