直接偏好优化

译自英文

直接偏好优化(DPO)是一种机器学习技术,利用偏好数据使大型语言模型与人类偏好对齐,通过直接优化策略而无需单独的奖励模型,提供了一种比人类反馈强化学习(RLHF)更简单的替代方案。

直接偏好优化(DPO)是一种机器学习技术,用于使智能体(如大型语言模型)与人类偏好对齐。它是基于人类反馈的强化学习(RLHF)的一种更简单的替代方案,因为它直接使用偏好数据优化策略,而无需训练单独的奖励模型或依赖近端策略优化等强化学习算法。DPO在生成式人工智能领域已广受欢迎,用于提高模型输出的有用性和无害性。

DPO由斯坦福人工智能实验室的研究人员于2023年提出,此后已被包括OpenAIAnthropic在内的多家组织采用,作为一种经济高效的偏好对齐方法。它利用了这样一个洞见:RLHF中的奖励模型可以用最优策略来表示,从而将偏好优化目标重新表述为一个简单的分类损失。这消除了训练期间从策略中采样的需要,使DPO更加稳定且计算效率更高。

背景与动机

当任务难以明确指定但易于评判时,基于人类反馈优化模型是可取的。例如,人们可能希望训练一个模型生成既有用又无害的安全文本,例如缺乏偏见、毒性或有害内容。让人类手动创建无害和有害文本的示例既困难又耗时。然而,人类擅长快速评估和比较不同AI生成文本的有害程度。因此,一个更实际的目标是让模型利用这类人类反馈来改进其文本生成。

传统的RLHF涉及训练一个奖励模型来表示人类偏好,然后使用强化学习针对该奖励模型优化策略。然而,RLHF面临挑战,包括强化学习的复杂性、需要仔细调整超参数,以及训练期间从策略中采样的计算成本。DPO通过推导奖励模型与策略之间的直接映射来解决这些问题,从而无需显式奖励建模或强化学习即可实现偏好优化。

DPO的工作原理

DPO将偏好优化问题表述为一个二元分类任务。给定一个提示和两个候选响应,其中一个是人类更偏好的,DPO更新策略以增加偏好响应的可能性并减少非偏好响应的可能性。损失函数基于Bradley–Terry–Luce成对偏好模型推导,该模型假设偏好一个响应而非另一个的概率与其奖励分数的指数成正比。

关键的数学洞见是,在一定的正则化约束(如相对于参考策略的KL散度)下,最优奖励模型可以用最优策略来表示。这使得DPO能够消除奖励模型,并使用简单的逻辑损失直接优化策略。训练过程仅需要静态的偏好数据集,使其比通常需要迭代采样和奖励模型更新的RLHF更简单、更稳定。

与RLHF的比较

RLHF是一个多阶段过程:首先,在人类偏好数据上训练奖励模型;其次,使用强化学习(通常采用近端策略优化)针对该奖励模型优化策略。这种方法在使InstructGPTClaude等模型对齐方面取得了成功。然而,RLHF存在缺点:计算强度大、对超参数敏感,并且可能遭受奖励黑客攻击,即策略利用奖励模型获得高分而不真正满足人类偏好。

DPO通过直接优化策略简化了这一过程,避免了单独奖励模型和强化学习的需要。这减少了计算开销并提高了稳定性。研究表明,在文本摘要和对话生成等任务上,DPO可以达到与RLHF相当或更好的性能,同时更易于实现和调整。然而,DPO并非没有局限性;当偏好数据嘈杂或策略需要探索新行为时,它可能效果较差,因为它不包含在线探索。

应用

DPO已应用于机器学习的各个领域,特别是在自然语言处理中。它用于微调大型语言模型,以完成文本摘要、对话代理和指令跟随等任务。例如,Anthropic已使用DPO使其模型与人类对有用性和无害性的偏好对齐。此外,DPO已被探索用于计算机视觉任务,如文本到图像生成,帮助使生成的图像与人类审美偏好对齐。

该技术还与开发需要与人类价值观对齐的生成式人工智能系统相关,例如减少偏见和毒性。通过使用偏好数据,DPO可以引导模型产生更可能被人类评判为高质量的输出,而无需进行广泛的奖励工程。

数据要求与挑战

与RLHF一样,DPO依赖于高质量的偏好数据,这些数据通常由人类标注者收集,他们对模型输出进行排名或比较。收集此类数据既昂贵又耗时。此外,如果数据不是从代表性样本中仔细收集的,所得模型可能表现出不希望的偏见。DPO需要相对较少的比较数据即可有效,但数据的质量和多样性至关重要。

DPO的一个挑战是偏好数据可能嘈杂或不一致,导致对齐效果欠佳。此外,DPO假设偏好模型遵循Bradley–Terry–Luce模型,这在实践中可能并不总是成立。研究人员已提出扩展方法以处理更复杂的偏好结构,例如使用Plackett–Luce模型进行K-wise比较。

近期发展与研究

自推出以来,DPO引发了显著的研究兴趣。已提出变体和改进,例如结合离线和在线数据收集策略,以及将DPO与其他对齐技术相结合。例如,一些工作探索了将DPO与课程学习结合使用,以逐步增加偏好任务的难度。其他研究则调查了DPO的理论性质,在不同反馈模型下提供了样本复杂度界限和收敛保证。

研究还将DPO与RLHF在鲁棒性和探索方面进行了比较。虽然DPO在离线设置中更具样本效率,但RLHF可能更适合需要在线探索的任务,其中智能体与环境交互以发现新行为。截至2025年,DPO仍是一个活跃的研究领域,持续努力将其扩展到更大模型和更复杂任务。

结论

直接偏好优化提供了一种简化AI系统与人类偏好对齐的方法,解决了RLHF的一些关键局限性。其简单性和有效性使其成为人工智能社区中的热门选择,特别是在微调大型语言模型方面。尽管仍存在挑战,如数据质量和理论假设,但DPO代表了使基于偏好的对齐更加可及和实用方面的重要一步。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:machine-learning·alignment·preference-optimization·large-language-models
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史