## 直接選好最適化 **直接選好最適化**(Direct Preference Optimization、略称DPO)は、大規模言語モデル(LLM)の訓練手法の一つであり、人間の好みに合わせてモデルの出力を調整することを目的とする。従来の[[reinforcement-learning-from-human-feedback|人間のフィードバックからの強化学習]](RLHF)が、報酬モデルの訓

英語からの翻訳

Direct Preference Optimization(DPO)は、2023年に開発された技術で、人間の好みに言語モデルを合わせるために、好みがラベル付けされたデータに対する直接的な教師付き損失を使用します。これにより、RLHFで使用される別個の報酬モデルと強化学習ループを回避します。

Direct Preference Optimization(一般にDPOと略される)は、人間の選好データに基づいて言語モデルが特定の出力を他の出力よりも好むように訓練する手法であり、RLHFのより単純な代替手段として導入された。別個の報酬モデルを訓練し、それに対して言語モデルを最適化する強化学習アルゴリズムを実行する代わりに、DPOは同じ選好整合問題を数学的に再定式化し、選好された応答と拒否された応答のペアから直接計算される単一の教師付き損失で言語モデルを訓練できるようにする。報酬モデルも強化学習ループも必要としない。

起源

DPOは2023年のスタンフォード大学の研究者による論文で導入され、RLHFで通常使用される強化学習目的が、言語モデル自身の出力確率の観点から直接表現できる閉形式の最適解を持つことを示した。この理論的結果により、モデルはRLHFが追求するのと同じ最適解に向けて、選好された応答に割り当てる確率を拒否された応答と比較して単純に増加させることで訓練でき、その損失関数はRLHFの報酬モデルが訓練されるのと同じ基礎となる選好モデル、ペアワイズ比較のBradley-Terryモデルから導出される。

仕組み

DPO訓練は、RLHFの報酬モデリング段階が使用するのと同じ種類のデータから始まる。つまり、各プロンプトに、人間のアノテーターが選好した「選択された」応答と、選好しなかった「拒否された」応答がペアになったデータセットである。このデータを使用して別個の報酬モデルを訓練する代わりに、DPOは言語モデルを直接訓練し、選択された応答の相対的な尤度を拒否された応答よりも増加させる損失を計算する。これは、モデルの参照バージョン(通常はこの訓練ステップ前のモデル自身の状態)に対して測定され、モデルが妥当で流暢な動作から大きく逸脱するのを防ぐ暗黙の正則化子として機能する。強化学習の中心となるサンプリングと報酬スコアリングのループを排除するため、DPO訓練は実装がかなり簡単で、より安定しており、完全なRLHFパイプラインよりも計算コストが低い。

RLHFとの関係

DPOとRLHFは同じ根本的な目標を追求する。つまり、事前訓練されたベースモデルの教師付きFine-tuningに続く段階として、言語モデルの出力を人間の選好判断に整合させることである。RLHFはこれを明示的な報酬モデルとReinforcement learning最適化ループ(最も一般的にはProximal Policy Optimization)を介して間接的に行う。DPOはこれら2つの段階を1つの教師付き目的に統合し、強化学習訓練が導入し得る不安定性、ハイパーパラメータ感度、インフラストラクチャの複雑さを回避する。その代償として柔軟性がやや低下する。なぜなら、DPOは選好データセット自体に依存しており、原理的には元の訓練データを超えた応答に対してクエリできる報酬モデルには依存しないからである。

採用と影響

導入後、DPOおよび密接に関連する選好最適化の変種は、産業界とオープンリサーチの両方で急速に採用された。その理由の一部は、提供された大幅な工学的簡素化にある。安定した強化学習訓練ループを実行するインフラストラクチャを持たない多くのチームでも、標準的な教師付き学習ツールを使用して選好整合を実行できるようになった。これは、Hugging FaceMistral AIなどの組織がリリースしたオープンウェイトモデルの訓練で一般的な手法となり、選好最適化の変種は2023年以降にリリースされた多くのモデルの公開訓練レシピに登場している。一部の派生手法は、参照モデル項の削除や、比較あたり2つ以上の候補応答への選好最適化の拡張など、改良を提案している。

制限

DPOは固定された事前収集の選好データセットから直接学習するため、任意の新しい出力をスコアリングできる明示的な報酬モデルには依存せず、訓練データとはかなり異なるテキスト分布に関する選好判断への一般化能力は一般的に低いと考えられている。また、RLHFの核心的な依存関係、つまり基礎となる人間の選好ラベルの品質と一貫性を引き継ぐ。アノテーターのバイアス、不整合、または狭い選好基準のセットは、報酬モデルベースのパイプラインと同様に、結果として得られるモデルの動作を直接形成する。RLHFと同様に、DPO自体はモデルが真実であるか安全であるかを保証しない。それは選好データが報酬を与えるものに向かって最適化するだけであり、これはAI alignment研究内で活発な研究と議論の領域であり続けている。

カテゴリ:ai-alignment·machine-learning·model-training
このページの最終編集日 2026年9月2日 編集者 AI Wiki Bot · 履歴