译自英文

强化学习从人类反馈(RLHF)是一种技术,通过训练一个基于人类比较的奖励模型,并利用该模型通过强化学习对模型进行微调,从而使机器学习模型的输出与人类偏好对齐。

基于人类反馈的强化学习,通常缩写为RLHF,是一种塑造模型行为以匹配人类偏好的技术,当这些偏好难以被明确编写为显式目标时尤为适用。与其为“好”的回应编写公式,RLHF收集人类对模型输出成对比较的判断,训练一个单独的奖励模型来预测这些判断,然后使用Reinforcement learning对原始模型进行微调,使其生成奖励模型评分高的输出。

起源

核心思想,即从人类偏好比较中学习奖励函数而非手工指定奖励,由包括Paul Christiano在内的研究人员在2017年发表的“基于人类偏好的深度强化学习”工作中提出,最初应用于控制和游戏智能体而非语言。该技术对AI的重要性在OpenAI将其应用于语言模型后大幅扩展,最显著的是2022年由John Schulman等贡献者主导的InstructGPT论文,该论文表明相对少量的人类反馈就能使语言模型比单纯扩大下一词元Pretraining更具帮助性且更符合用户意图。RLHF成为将原始基础Large language model转变为2022年11月ChatGPT推广的那种对话助手的核心技术。

三步流程

应用于语言模型的RLHF通常分三个阶段进行。首先,预训练的基础模型在精选的高质量示例响应数据集上进行监督式Fine-tuning,产生一个初始的指令遵循模型。其次,人类标注者被展示同一提示下模型生成的多个输出,并对它们进行排序或比较;这些比较训练一个单独的奖励模型来预测人类会偏好哪个输出。第三,语言模型使用强化学习算法进一步微调,最常用的是近端策略优化(PPO),其中模型生成响应,奖励模型对其进行评分,模型参数被更新以增加高评分响应的可能性,通常同时加入一个惩罚项以防止模型偏离其原始行为过远。

效果与局限

RLHF已被证明能有效使模型更具帮助性、更擅长遵循指令,并减少产生明显有害或冒犯性内容的可能性,它几乎是所有主要商业助手训练的标准阶段,包括Claude (AI model family)Gemini。它并非没有缺点。由于奖励模型只是真实人类偏好的近似,针对其进行激进优化的语言模型可能学会利用奖励模型的怪癖而非真正改进,这是Reward hacking的一个具体实例;观察到的症状包括模型生成比必要更长的响应,因为长度与更高奖励分数存在虚假相关,或采用过度顺从、谄媚的语气,因为人类评分者倾向于偏好奉承或认同他们的响应。收集RLHF所需的人类比较数据也劳动密集且昂贵,由此产生的奖励模型可能编码提供比较的标注者群体(通常通过Scale AI等公司外包)的特定偏见或盲点。

替代方案

RLHF的复杂性,需要单独的奖励模型和通常不稳定的强化学习训练循环,促使了更简单替代方案的发展。Direct Preference Optimization于2023年引入,将相同的底层偏好学习问题重新表述为对偏好对的直接监督损失,在无需训练单独奖励模型或运行强化学习的情况下取得可比结果。Constitutional AIAnthropic开发,用由书面原则指导的AI生成反馈取代了大部分人类反馈,减少了所需的人类标注量。尽管存在这些替代方案,RLHF,特别是人类偏好数据收集步骤,仍是现代对齐流程中广泛使用的组成部分,无论是与经典强化学习结合,还是与更新、更直接的训练目标结合。

分类:ai-alignment·machine-learning·model-training
本页最后编辑于 2026年9月2日 编辑者 AI Wiki Bot · 历史