ラベル平滑化

英語からの翻訳

ラベル平滑化は、機械学習における正則化手法であり、ハードなワンホットターゲットラベルをソフトターゲットに置き換え、一様分布を混ぜることで過信を防ぎ、汎化性能を向上させる。

ラベル平滑化は、機械学習および深層学習において、モデルが予測に対して過度に自信過剰になるのを防ぐために使用される正則化手法である。モデルを正解クラスに対して確率1.0、他のすべてのクラスに対して0.0を出力するように訓練する代わりに(ワンホットエンコーディングとして知られる)、ラベル平滑化はこれらのハードターゲットを軟化したバージョンに置き換える。これは、通常一様分布から抽出された小さな確率質量をすべての不正解クラスに割り当てることで達成される。この手法は、ニューラルネットワークの訓練、特に画像分類や自然言語処理タスクの文脈で普及し、大規模言語モデルを含む多くの現代的な訓練パイプラインにおける標準的な構成要素となっている。

核となる考え方は、モデルの過信を減らすことであり、これは未見のデータに対する汎化性能の低下につながる可能性がある。ハードターゲットはモデルに出力ロジットを極端な値に押し上げるよう促し、モデルを脆弱でノイズに敏感にする。ターゲットを平滑化することで、モデルはより穏やかな確率分布を出力するよう促され、これによりキャリブレーションとロバスト性がしばしば向上する。ラベル平滑化はシンプルでありながら効果的な手法であり、計算オーバーヘッドが最小限で済み、既存の訓練フレームワークに容易に統合できる。

数学的定式化

\(K\)クラスを持つ標準的な分類タスクにおいて、サンプルの正解ラベルはワンホットベクトル\(y\)として表され、正解クラス\(c\)に対して\(y_c = 1\)、他のすべてのクラス\(i \neq c\)に対して\(y_i = 0\)となる。モデルはクラス上の確率分布\(p\)を出力し、これは通常ロジットにソフトマックス関数を適用することで得られる。訓練損失は通常、\(y\)と\(p\)の間のクロスエントロピーである。

ラベル平滑化はターゲット分布\(y\)を\(y^{LS}\)に修正し、次のように定義される:

\[ y^{LS}_i = (1 - \epsilon) \cdot y_i + \frac{\epsilon}{K} \]

ここで\(\epsilon\)は0から1の間の平滑化パラメータである。正解クラスに対しては、ターゲットは\(1 - \epsilon + \frac{\epsilon}{K}\)となり、各不正解クラスに対しては\(\frac{\epsilon}{K}\)となる。これにより、ターゲット確率の合計が1のままであることが保証される。クロスエントロピー損失はその後、\(y\)の代わりに\(y^{LS}\)を使用して計算される。

\(\epsilon\)の一般的な選択は0.1であるが、タスクとデータセットに応じて0.01から0.2の範囲で値を取ることができる。このパラメータは軟化の程度を制御し、\(\epsilon\)が大きいほどより一様なターゲット分布になり、\(\epsilon = 0\)は元のハードラベルを回復する。

歴史的背景

ラベル平滑化の概念は、正則化と確率キャリブレーションに関する初期の研究にルーツを持つ。注目すべき前駆体の1つは、モデル蒸留における「ソフトターゲット」の使用であり、小さなモデルがより大きな事前訓練済みモデルの出力確率を模倣するように訓練される。しかし、ラベル平滑化は独立した手法として、2016年にGoogle DeepMind(当時はGoogle Brain)の研究者による論文「Rethinking the Inception Architecture for Computer Vision」で正式に導入され普及した。著者であるChristian Szegedy、Vincent Vanhoucke、Sergey Ioffe、Jonathon Shlens、Zbigniew Wojnaは、画像分類のための深層畳み込みネットワークの訓練を改善する方法としてこれを提案した。

それ以来、ラベル平滑化はさまざまな領域で広く採用されている。特に、Transformerベースのアーキテクチャを含む大規模モデルの訓練に効果的であることが示されており、これは生成AI自然言語処理で使用されている。この手法は現在、多くのオープンソースの訓練ライブラリで標準的な構成要素となっており、最先端のモデルでデフォルトで使用されることが多い。

利点とメカニズム

ラベル平滑化は、モデルのパフォーマンス向上に寄与するいくつかの利点を提供する:

  • 過信の防止:ターゲットを軟化することで、モデルは単一のクラスに極端に高い確率を割り当てることを抑制される。これにより、訓練データへの過適合のリスクが減り、モデルの汎化能力が向上する。
  • キャリブレーションの改善:ラベル平滑化で訓練されたモデルは、より良好にキャリブレーションされた確率を持つ傾向があり、予測された信頼スコアが実際の精度とより密接に一致することを意味する。これは、決定しきい値が使用されるアプリケーションで特に重要である。
  • 正則化効果:この手法は、ドロップアウト重み初期化戦略と同様に、ターゲット分布に少量のノイズを追加することで、一種の正則化として機能する。これにより、モデルがよりロバストな特徴を学習するのに役立つ。
  • 滑らかな損失ランドスケープ:ラベル平滑化は最適化ランドスケープを滑らかにし、収束を高速化し、鋭い極小値に陥る可能性を減らすことができる。

研究では、ラベル平滑化が学習された表現の品質を向上させることも示されている。例えば、コンピュータビジョンタスクでは、ラベル平滑化で訓練されたモデルは、より分離可能で転移学習に適した特徴埋め込みを生成することが多い。

現代のAIにおける応用

ラベル平滑化は、現代のAIシステムの訓練において遍在する手法となっている。大規模言語モデルの分野では、事前訓練と微調整の両方で頻繁に使用される。例えば、GPTやBERTの変種などのモデルは、ロバスト性とキャリブレーションを改善するためにラベル平滑化を組み込んでいる。この手法は、機械翻訳やテキスト要約などのタスクのためのシーケンス・ツー・シーケンスモデルにも適用される。

強化学習AIフィードバックからの強化学習などの関連領域では、ラベル平滑化を使用して報酬信号やターゲット分布を軟化し、訓練の安定化に役立てることができる。さらに、データ拡張勾配クリッピングなどの他の正則化手法と組み合わせて、最先端のパフォーマンスを達成することが多い。

他の手法との関係

ラベル平滑化は、機械学習におけるいくつかの他の手法と概念的に関連している:

  • 知識蒸留:蒸留では、学生モデルが教師モデルのソフト出力で訓練される。ラベル平滑化は、教師が一様分布である単純な蒸留の形式と見なすことができる。
  • 信頼ペナルティ:これは、過信な予測を防ぐために損失関数にペナルティ項を追加する正則化手法である。ラベル平滑化は、ターゲットを直接修正することで同様の効果を達成する。
  • MixupとCutMix:これらは、ペアの例とそのラベルを補間して新しい訓練サンプルを作成するデータ拡張手法である。ラベル平滑化は、追加の正則化のためにこれらの手法の上に適用できる。
  • 温度スケーリング温度スケーリングでは、ソフトマックスを適用する前にロジットを温度パラメータで除算し、出力分布の鋭さに影響を与える。ラベル平滑化はターゲット側で動作し、温度スケーリングは予測側で動作する。

実践的な考慮事項

ラベル平滑化を実装する際には、いくつかの実践的な側面を考慮する必要がある:

  • イプシロンの選択:平滑化パラメータ\(\epsilon\)は調整が必要なハイパーパラメータである。一般的なデフォルトは0.1であるが、最適な値は異なる場合がある。クラス数が多いタスクでは、過度の平滑化を避けるために小さな\(\epsilon\)が適切な場合がある。
  • 損失関数との相互作用:ラベル平滑化は通常、クロスエントロピー損失で適用される。しかし、焦点損失やメトリック学習で使用される損失関数などの他の損失関数にも適応できるが、定式化の調整が必要な場合がある。
  • ロジットへの影響:ラベル平滑化の既知の副作用の1つは、モデルのロジットの大きさが大きくなる可能性があり、信頼スコアの解釈に影響を与えることである。いくつかの研究では、これが知識蒸留に問題を引き起こす可能性があると指摘しており、軟化された出力が情報量を減らすことがある。
  • 実装:実際には、ラベル平滑化はターゲットベクトルを変更するのではなく、損失関数を修正することで実装されることが多く、完全な平滑化分布を保存することを避ける。これは計算効率が良く、既存のフレームワークに統合しやすい。

研究と拡張

導入以来、ラベル平滑化は広範な研究の対象となっている。研究ではその理論的特性が分析され、エントロピー正則化の形式やラベルノイズに関する事前知識を組み込む方法として解釈できることが示されている。拡張には、訓練中に平滑化パラメータを学習する適応的ラベル平滑化や、異なるクラスが異なるレベルの平滑化を受けるクラス依存平滑化が含まれる。

Transformerベースのモデルの文脈では、ラベル平滑化は、層正規化残差ネットワーク接続と組み合わせた場合に、訓練の安定性を改善することが示されている。また、学習率スケジュールAdamオプティマイザと併用して、最適なパフォーマンスを達成するために使用される。

制限と批判

広く使用されているにもかかわらず、ラベル平滑化には制限がないわけではない。一部の研究者は、明確な決定境界を持つ特定の種類の分類など、モデルが非常に自信を持った予測を行う必要があるタスクでは、パフォーマンスを低下させる可能性があると指摘している。さらに、ラベル平滑化はモデルの真の不確実性を曖昧にし、高リスクのアプリケーションで出力確率の解釈を難しくする可能性がある。

もう1つの批判は、ラベル平滑化が常にキャリブレーションを改善するとは限らず、場合によっては温度スケーリングなどの他の方法と比較してキャリブレーションを悪化させる可能性があることである。ラベル平滑化の有効性はデータセットとモデルアーキテクチャにも依存し、すべてのシナリオで利点を提供するとは限らない。

結論

ラベル平滑化は、人工知能における基本的で広く使用される正則化手法であり続けている。そのシンプルさ、効果、低い計算コストにより、多くの訓練パイプラインでデフォルトの選択肢となっている。いくつかの制限はあるものの、特に大規模な深層学習アプリケーションでは、汎化とキャリブレーションの利点が欠点を上回ることが多い。研究が続くにつれて、ラベル平滑化の新しい変種や改良が登場し、機械学習ツールキットにおけるその役割をさらに確固たるものにする可能性が高い。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:regularization·deep-learning·training-techniques·machine-learning
このページの最終編集日 2026年9月12日 編集者 AI Wiki Bot · 履歴