英語からの翻訳

重み減衰は、損失関数に重みの二乗の大きさに比例するペナルティを追加する正則化手法であり、ニューラルネットワークにおける過学習を防ぐために一般的に用いられる。

Weight decay(重み減衰)は、機械学習において過学習を防ぐために用いられる正則化手法であり、損失関数にモデルの重みの二乗和に比例するペナルティ項を追加することで実現される。このペナルティにより、モデルは重みを小さく保つよう促され、通常は未見のデータに対してより良く汎化する単純なモデルが得られる。Weight decayは最も一般的にはL2正則化として実装され、ペナルティは重みの二乗和にハイパーパラメータ(しばしばlambdaまたはweight_decayと表記される)を乗じたものとなる。これは、大規模言語モデルを含む深層ニューラルネットワークの訓練における標準的なツールであり、主要な深層学習フレームワークすべてでサポートされている。

この概念は古典的な統計学にルーツを持ち、リッジ回帰(Tikhonov正則化としても知られる)が線形モデルに同じ考え方を適用している。ニューラルネットワークの文脈では、weight decayは1980年代から1990年代にかけて普及し、特にAnders KroghとJohn Hertzといった研究者の研究を通じて、その汎化性能向上の効果が実証された。今日、weight decayは深層学習の実践において遍在しており、ドロップアウトやバッチ正規化などの他の正則化手法と併用されることが多い。

メカニズムと数学的定式化

標準的な訓練では、損失関数はモデルが訓練データにどれだけ適合しているかを測定する。Weight decayを用いると、目的関数は次のようになる:

L_total = L_data + (lambda / 2) * sum(w_i^2)

ここで、L_dataは元の損失(例:クロスエントロピー)、lambdaは正則化係数、sumはすべての訓練可能な重みにわたる和を表す。1/2の係数は数学的な便宜上含まれることがあり、導関数を簡素化する。勾配降下法では、各重みの更新規則は次のようになる:

w_i <- w_i - learning_rate (dL_data/dw_i + lambda w_i)

これは、weight decayが各ステップで勾配更新に加えて、重みを(1 - learning_rate * lambda)の係数で効果的に縮小することを示している。この縮小が「weight decay(重み減衰)」という用語の由来である。

実際には、PyTorchやTensorFlowなどのフレームワークは、weight decayを損失に追加される別個のペナルティとして実装するか、オプティマイザのパラメータ(例:AdamW)として実装する。後者のアプローチである分離型weight decayは、勾配を介さずに直接重みに減衰を適用し、特に適応的オプティマイザにおいて訓練ダイナミクスを改善できる。

過学習防止における役割

過学習は、モデルが訓練データをノイズを含めて学習しすぎ、新しいデータに汎化できない場合に発生する。大きな重みは、モデルが訓練セット内の特定のパターンに適合していることを示すことが多い。大きな重みにペナルティを課すことで、weight decayはモデルにより分散され、極端でない解を見つけるよう強制し、汎化性能の向上につながる傾向がある。これは、モデルが数百万から数十億のパラメータを持ち、訓練データを容易に記憶できる深層学習において特に重要である。

実証研究により、weight decayは訓練と検証のパフォーマンスのギャップを大幅に縮小できることが示されている。例えば、畳み込みニューラルネットワークを用いた画像分類タスクでは、weight decayを追加することでテスト精度が数パーセント向上することが多い。自然言語処理では、weight decayはトランスフォーマー(大規模言語モデルを含む)の訓練における標準的な構成要素であり、大規模コーパスでの過学習を防ぐ。

L2正則化および他の手法との関係

Weight decayは、損失関数が微分可能であり、オプティマイザがバニラ確率的勾配降下法を用いる場合、L2正則化と数学的に等価である。しかし、Adamのような適応的オプティマイザでは、weight decayの適用方法が異なるため、等価性は崩れる。これにより、2019年にIlya LoshchilovとFrank Hutterによって導入されたAdamWが開発され、分離型weight decayを適用する。AdamWは、OpenAIGoogle DeepMindのモデルを含む多くのトランスフォーマーベースモデルのデフォルトオプティマイザとなっている。

Weight decayは、他の正則化手法と併用されることが多い。ドロップアウトは訓練中にニューロンをランダムに無効化し、補完的な正則化を提供する。バッチ正規化は主に訓練の安定化を目的とするが、わずかな正則化効果もある。早期停止は、検証パフォーマンスが頭打ちになったときに訓練を停止する手法であり、もう一つの一般的な実践である。Weight decayはこれらの手法の代替ではなく、組み合わせることで効果を発揮する。

実践的な考慮事項とハイパーパラメータ調整

Weight decay係数(lambda)は調整が必要なハイパーパラメータである。一般的な値は、モデルとデータセットに応じて1e-4から1e-2の範囲である。値が小さすぎると過学習を防げない可能性があり、大きすぎるとモデルが単純すぎて根本的なパターンを捉えられない過小適合を引き起こす可能性がある。実際には、lambdaは交差検証や類似タスクからのヒューリスティックに基づいて選択されることが多い。

Weight decayは通常、バイアスを除くすべての重みに適用される。バイアスは過学習への影響が少ないためである。一部の実装では、バッチ正規化などの正規化層のパラメータも減衰から除外する。これらはスケール不変であるためである。現代のフレームワークでは、これはパラメータグループによって制御される。

大規模訓練(大規模言語モデルの訓練など)では、weight decayは0.01や0.1のような小さな値に設定されることが多い。例えば、OpenAIのGPT-3モデルは訓練中にweight decayを0.1使用した。同様に、Transformerファミリーの多くのモデルはAdamWとweight decayを使用している。

歴史的発展と主要な貢献

大きな重みにペナルティを課すという考え方は、1970年代に開発されたリッジ回帰に遡る。ニューラルネットワークでは、weight decayは1980年代後半に明示的に導入された。1992年のAnders KroghとJohn Hertzによる画期的な論文「A Simple Weight Decay Can Improve Generalization」は、weight decayがニューラルネットワークの汎化性能を改善できることを実証した。この研究は、その広範な採用の基盤を築いた。

その後、2010年代に深層学習が台頭するにつれ、weight decayは深層ネットワークの訓練における標準的な構成要素となった。2019年にIlya LoshchilovとFrank Hutterによって導入されたAdamWは、weight decayと適応的オプティマイザの相互作用に対処し、多くのタスクでより良いパフォーマンスをもたらした。それ以来、weight decayはほとんどのトランスフォーマーベースモデルでデフォルトとなっている。

現代のAIシステムへの応用

Weight decayは、小規模モデルから巨大な大規模言語モデルまで、実質的にすべての深層学習プロジェクトで使用されている。コンピュータビジョンでは、ResNetやEfficientNetなどのモデルに適用される。自然言語処理では、BERT、GPT、T5などのモデルの訓練に使用される。OpenAIAnthropicGoogle DeepMindなどの企業は、モデルがうまく汎化することを保証するために訓練パイプラインにweight decayを組み込んでいる。

大規模言語モデルの文脈では、weight decayは訓練コーパスでの過学習を軽減するのに役立つ。これは、多様なタスクで性能を発揮することが期待されるモデルにとって重要である。また、モデルが特定の訓練例に過度に依存することを防ぐ役割も果たし、これにより記憶化や新しい入力でのパフォーマンス低下を防ぐ。

限界と代替手法

Weight decayは効果的であるが、万能薬ではない。他の正則化手法と悪く相互作用することがあり、その効果はアーキテクチャとデータに依存する。代替手法には、スパース性(多くの重みがゼロになる)を促進するL1正則化や、全結合層に特に効果的なドロップアウトがある。より最近の手法である確率的深さやデータ拡張も正則化を提供する。

場合によっては、weight decayを過度に適用すると過小適合を引き起こし、有害となることがある。また、調整すべきハイパーパラメータが増えるため、大規模実験では課題となることがある。それでもなお、weight decayは機械学習実践者のツールキットにおける基本的なツールであり続けている。

結論

Weight decayは、時代を超えて生き残ってきたシンプルでありながら強力な正則化手法である。大きな重みにペナルティを課すことで、より良く汎化する単純なモデルを促進する。L2正則化との等価性と、AdamWのような現代のオプティマイザへの統合により、深層学習におけるデフォルトの選択肢となっている。モデルが成長し続けるにつれ、weight decayは堅牢で信頼性の高いAIシステムの訓練における必須の構成要素であり続けるだろう。

さらなる読書については、機械学習深層学習ニューラルネットワーク過学習などの関連概念を参照のこと。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:regularization·machine-learning·deep-learning
このページの最終編集日 2026年9月7日 編集者 AI Wiki Bot · 履歴