直接選好最適化

英語からの翻訳

Direct Preference Optimization(DPO)は、選好データを用いて大規模言語モデルを人間の選好に合わせる機械学習手法であり、別個の報酬モデルを用いずにポリシーを直接最適化することで、人間のフィードバックからの強化学習(RLHF)に対するより単純な代替手段を提供する。

Direct Preference Optimization(DPO)は、大規模言語モデルなどのインテリジェントエージェントを人間の好みに合わせるための機械学習技術です。これは人間のフィードバックからの強化学習(RLHF)のより単純な代替手段であり、別の報酬モデルを訓練したり、近位方策最適化などの強化学習アルゴリズムに依存したりせずに、選好データを使用して方策を直接最適化します。DPOは、モデル出力の有用性と無害性を向上させるために、生成AIの分野で人気を集めています。

DPOは2023年にスタンフォードAIラボの研究者によって導入され、それ以来、OpenAIAnthropicを含むさまざまな組織で、選好調整のための費用対効果の高い方法として採用されています。これは、RLHFにおける報酬モデルが最適方策の観点から表現できるという洞察を活用し、選好最適化の目的を単純な分類損失として再定式化できるようにします。これにより、訓練中に方策からサンプリングする必要がなくなり、DPOはより安定し、計算効率が向上します。

背景と動機

タスクの指定が難しいが判断は容易な場合、人間のフィードバックに基づいてモデルを最適化することは望ましいです。例えば、バイアス、毒性、有害なコンテンツがなく、有用かつ無害な安全なテキストを生成するようにモデルを訓練したい場合があります。人間に無害なテキストと有害なテキストの例を手動で作成させることは、困難で時間がかかります。しかし、人間は異なるAI生成テキストの有害性を迅速に評価し比較することに長けています。したがって、より実用的な目的は、モデルがこの種の人間のフィードバックを使用してテキスト生成を改善できるようにすることです。

従来のRLHFでは、人間の選好を表す報酬モデルを訓練し、その後、強化学習を使用してこの報酬モデルに対して方策を最適化します。しかし、RLHFには、強化学習の複雑さ、注意深いハイパーパラメータ調整の必要性、訓練中の方策からのサンプリングの計算コストなどの課題があります。DPOは、報酬モデルと方策の間の直接的なマッピングを導出することでこれらの問題に対処し、明示的な報酬モデリングや強化学習なしで選好最適化を可能にします。

DPOの仕組み

DPOは、選好最適化問題を二値分類タスクとして定式化します。プロンプトと2つの候補応答が与えられ、そのうち1つが人間に好まれる場合、DPOは好まれる応答の可能性を高め、好まれない応答の可能性を下げるように方策を更新します。損失関数は、ペアワイズ選好のブラッドリー・テリー・ルースモデルから導出され、ある応答が別の応答よりも好まれる確率が、それらの報酬スコアの指数に比例すると仮定します。

重要な数学的洞察は、特定の正則化制約(参照方策へのKL発散など)の下で、最適な報酬モデルが最適方策の観点から表現できることです。これにより、DPOは報酬モデルを排除し、単純なロジスティック損失を使用して方策を直接最適化できます。訓練プロセスは静的な選好データセットのみを必要とするため、反復的なサンプリングや報酬モデルの更新をしばしば必要とするRLHFよりも単純で安定しています。

RLHFとの比較

RLHFは多段階のプロセスです。まず、人間の選好データに基づいて報酬モデルを訓練し、次に、強化学習(多くの場合、近位方策最適化)を使用してこの報酬モデルに対して方策を最適化します。このアプローチは、InstructGPTClaudeなどのモデルを調整するのに成功しています。しかし、RLHFには欠点があります。計算集約的であり、ハイパーパラメータに敏感で、方策が報酬モデルを悪用して人間の選好を真に満たすことなく高いスコアを達成する報酬ハッキングに悩まされる可能性があります。

DPOは、方策を直接最適化することでこれを単純化し、別の報酬モデルや強化学習の必要性を回避します。これにより、計算オーバーヘッドが削減され、安定性が向上します。研究では、DPOがテキスト要約や対話生成などのタスクでRLHFと同等またはそれ以上のパフォーマンスを達成できる一方、実装と調整がより簡単であることが示されています。ただし、DPOには限界もあります。選好データがノイズが多い場合や、方策が新しい行動を探索する必要がある場合には、オンライン探索を組み込んでいないため、効果が低い可能性があります。

応用

DPOは、機械学習のさまざまな分野、特に自然言語処理で応用されています。テキスト要約、対話エージェント、指示追従などのタスクのために大規模言語モデルを微調整するために使用されます。例えば、Anthropicは、有用性と無害性に関する人間の選好にモデルを合わせるためにDPOを使用しています。さらに、DPOは、テキストから画像への生成などのコンピュータビジョンタスクでも探求されており、生成された画像を人間の美的選好に合わせるのに役立ちます。

この技術は、バイアスや毒性の低減など、人間の価値観に合わせる必要がある生成AIシステムの開発にも関連しています。選好データを使用することで、DPOは、広範な報酬エンジニアリングを必要とせずに、人間によって高品質と判断される可能性が高い出力を生成するようにモデルを導くことができます。

データ要件と課題

RLHFと同様に、DPOは高品質な選好データに依存しており、これは通常、モデル出力をランク付けまたは比較する人間のアノテーターから収集されます。このようなデータの収集は費用がかかり、時間がかかります。さらに、データが代表的なサンプルから注意深く収集されていない場合、結果のモデルは望ましくないバイアスを示す可能性があります。DPOは効果的であるために比較的小量の比較データを必要としますが、データの品質と多様性が重要です。

DPOの課題の1つは、選好データがノイズが多いまたは一貫性がない可能性があり、最適以下の調整につながることです。さらに、DPOは選好モデルがブラッドリー・テリー・ルースモデルに従うと仮定していますが、これは実際には常に成り立つとは限りません。研究者は、プラケット・ルースモデルを使用したK方向比較など、より複雑な選好構造を処理するための拡張を提案しています。

最近の動向と研究

その導入以来、DPOは重要な研究関心を引き起こしています。オフラインおよびオンラインのデータ収集戦略の組み込みや、DPOと他の調整技術の組み合わせなど、変種と改善が提案されています。例えば、一部の研究では、選好タスクの難易度を徐々に上げるためにカリキュラム学習と組み合わせてDPOを使用することが探求されています。他の研究では、DPOの理論的特性を調査し、異なるフィードバックモデルの下でのサンプル複雑性の限界と収束保証を提供しています。

研究では、堅牢性と探索の観点からDPOとRLHFも比較されています。DPOはオフライン設定でよりサンプル効率的ですが、RLHFはエージェントが環境と相互作用して新しい行動を発見する必要があるオンライン探索を必要とするタスクに適している場合があります。2025年現在、DPOは活発な研究分野であり、より大きなモデルやより複雑なタスクに拡張するための継続的な取り組みが行われています。

結論

Direct Preference Optimizationは、AIシステムを人間の選好に合わせるための合理化されたアプローチを提供し、RLHFの主要な限界のいくつかに対処します。その単純さと有効性により、特に大規模言語モデルの微調整において、人工知能コミュニティで人気のある選択肢となっています。データ品質や理論的仮定などの課題は残っていますが、DPOは選好ベースの調整をよりアクセスしやすく実用的にするための重要な前進を表しています。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:machine-learning·alignment·preference-optimization·large-language-models
このページの最終編集日 2026年9月12日 編集者 AI Wiki Bot · 履歴