Teacher forcingは、リカレントニューラルネットワーク(RNN)の重みを訓練するためのアルゴリズムである。この手法では、観測された系列値(グラウンドトゥルースサンプルとも呼ばれる)を各ステップ後にRNNにフィードバックし、RNNをグラウンドトゥルース系列に近い状態に強制的に保つ。この技術は、大規模言語モデルや系列対系列モデルで広く使用され、訓練の効率と安定性を向上させる。
「Teacher forcing」という用語は、RNNを、各部分(例えば数学的計算)の答えが前の部分の答えに依存する多段階試験を受ける人間の学生に例えることで説明できる。この類推では、最初の部分で誤りを犯しただけで学生が全部分で失敗するリスクを冒して最終的にすべての答えを採点するのではなく、教師が各部分のスコアを記録し、次の部分で使用する正しい答えを学生に伝える。この外部教師信号は、モデルが訓練中に自身の誤りを増幅させるのではなく、正しい文脈から学習するのに役立つ。
外部教師信号の使用は、実時間リカレント学習(RTRL)とは対照的である。教師信号は発振器ネットワークから知られている。Teacher forcingは訓練時間の短縮に役立つという期待がある。「Teacher forcing」という用語は、1989年にRonald J. WilliamsとDavid Zipserによって導入され、当時この技術が「動的教師あり学習タスクで頻繁に使用されていた」と報告された。NeurIPS 2016の論文では、関連する「professor forcing」という手法が紹介された。
メカニズムと訓練
典型的なRNN訓練設定では、ネットワークは入力系列を処理し、各時間ステップで出力を生成する。Teacher forcingを使用しない場合、ネットワーク自身の前回の出力が次の時間ステップの入力として供給され、ネットワークが早期に誤りを犯すと誤差が蓄積する可能性がある。Teacher forcingは代わりに、ネットワークの前回の出力を訓練データからの実際のグラウンドトゥルース値に置き換える。このアプローチは、練習中に教師が正しい答えを提供し、学生が正しい経路から大きく逸れるのを防ぐことに類似している。
このアルゴリズムは、損失関数とフォワードパスを修正することで実装される。訓練中、各ステップでモデルはグラウンドトゥルーストークンを入力として受け取り、予測分布に対して損失が計算される。これは、デコーダーがエンコードされた表現に基づいて系列を生成するEncoder-Decoder Architectureアーキテクチャで特に効果的である。Teacher forcingは、Curriculum LearningやGradient Clippingなどの技術と組み合わせて、訓練をさらに安定させることが多い。
利点と限界
Teacher forcingにはいくつかの利点がある。即時フィードバックを提供し、誤差伝播を防ぐことで、訓練時間を大幅に短縮する。また、最適化の景観を単純化し、Adam (Optimizer)のような勾配ベースの手法が収束しやすくする。しかし、重要な限界として露出バイアス問題がある。推論中、モデルは自身の予測に依存する必要があり、訓練中に見られたグラウンドトゥルース分布と異なる可能性がある。この不一致は、自己回帰生成タスクでの性能低下につながる可能性がある。
露出バイアスを軽減するために、研究者はスケジュールドサンプリングなどの変種を開発してきた。これは、モデルがTeacher forcingからフリーランニング(自身の出力を使用)へ徐々に移行するものである。別のアプローチとして、2016年のNeurIPS論文で導入されたprofessor forcingがあり、敵対的識別器を使用して、訓練中と推論中のモデルの隠れ状態が類似するように促す。これらの方法は、訓練と推論の条件間のギャップを埋めることを目的としている。
応用
Teacher forcingは、機械翻訳、テキスト要約、音声認識などの機械学習システムを含む系列生成モデルの訓練における標準的な構成要素である。これは、多くの現代の生成AIシステムの基盤であるTransformer (architecture)ベースのモデルで特に重要である。例えば、OpenAIのGPTシリーズやAnthropicのClaudeモデルは、事前訓練中にTeacher forcingを使用して系列内の次のトークンを予測する。この技術は、画像キャプション生成や対話生成などのタスクのSequence-to-Sequence (Seq2Seq)モデルでも使用される。
自然言語処理以外にも、Teacher forcingは時系列予測や制御システムに適用されており、正確な系列予測が重要である。これらの領域では、グラウンドトゥルース信号が、特にデータがノイズが多い場合や非線形性が高い場合に、モデルがダイナミクスをより確実に学習するのに役立つ。
他の手法との関係
Teacher forcingは、外部補正なしでネットワーク自身の出力に基づいて重みを更新する実時間リカレント学習(RTRL)とは異なる。RTRLは生物学的により妥当であるが、計算コストが高く、大規模モデルには実用的でない。Teacher forcingはまた、報酬信号を使用するAIフィードバックからの強化学習(RLAIF)とも異なる。対照的に、Teacher forcingはラベル付き系列データへのアクセスを前提とする教師あり学習技術である。
この手法は、各ステップでの誤差の測定方法を定義するという点で損失関数の概念と密接に関連している。また、汎化を改善するために訓練中に一般的に適用されるDropoutやBatch Normalization技術とも相互作用する。実際には、Teacher forcingは推論中に高品質な系列を生成するためにBeam Searchと組み合わせられることが多い。
関連項目
- オンライン機械学習
- 強化学習