レイヤー正規化は、深層学習におけるニューラルネットワークの訓練を安定化・高速化するために用いられる活性化正規化手法である。バッチ正規化がバッチ次元にわたって正規化を行うのとは異なり、レイヤー正規化は個々の入力サンプルごとに特徴量次元にわたって統計量を計算する。この特性により、可変長シーケンスや小さいバッチサイズを扱うモデル、例えばトランスフォーマーや再帰型ニューラルネットワーク(RNN)に特に適している。この手法は2016年にJimmy Lei Ba、Jamie Ryan Kiros、Geoffrey Hintonによって導入され、以降、大規模言語モデルを含む多くの現代的なアーキテクチャにおいて標準的な構成要素となっている。
レイヤー正規化は、訓練中に層の入力分布が変化することで収束が遅くなる内部共変量シフトの問題に対処する。活性化を平均0・分散1に再スケーリング・再センタリングすることで、最適化の損失曲面を平滑化し、パラメータ初期化や学習率への感度を低減する。経験的成功により、シーケンスモデリングや生成的AIシステムにおけるデフォルトの選択肢となっている。
動機と背景
機械学習における正規化は、大きくデータ正規化と活性化正規化の2つに分類される。データ正規化(特徴量スケーリング)は、入力特徴量を[0,1]や[-1,1]などの共通範囲に再スケーリングし、スケールの大きい特徴量(例えばキロメートル対ナノメートル)が学習プロセスを支配するのを防ぐ。活性化正規化は、深層学習に特有のもので、ネットワーク内部の隠れニューロンの活性化を再スケーリングする。正規化の主な目的は、訓練速度の向上、過学習の低減、汎化性能の改善、勾配の消失・爆発といった問題の緩和である。
レイヤー正規化が登場する以前は、バッチ正規化(BatchNorm)が支配的な活性化正規化手法であった。バッチ正規化はミニバッチ次元にわたって活性化を正規化し、バッチ内の全サンプルについて各特徴量座標の平均と分散を計算する。しかし、バッチ正規化には限界がある。統計量を確実に推定するには十分に大きなバッチサイズが必要であり、訓練時(バッチ統計量を使用)と推論時(移動平均を使用)で挙動が異なる。可変長シーケンスを処理する再帰型ネットワークやトランスフォーマーでは、バッチ統計量が不安定または非実用的になることがある。
定義と数学的定式化
単一の入力サンプルに対する活性化のベクトル\( x \)を生成するニューラルネットワーク層を考える。レイヤー正規化は、そのベクトルの全特徴量(または隠れユニット)にわたって平均\( \mu \)と分散\( \sigma^2 \)を計算する:
\[ \mu = \frac{1}{H} \sum_{i=1}^{H} x_i, \quad \sigma^2 = \frac{1}{H} \sum_{i=1}^{H} (x_i - \mu)^2 \]
ここで\( H \)は層内の特徴量数である。正規化された活性化は次のようになる:
\[ \hat{x}_i = \frac{x_i - \mu}{\sqrt{\sigma^2 + \epsilon}} \]
ここで\( \epsilon \)は数値的安定性のために加えられる小さな定数(例えば\( 10^{-5} \))である。層の表現能力を維持するため、レイヤー正規化は学習可能な特徴量ごとのスケール\( \gamma \)とシフト\( \beta \)パラメータを導入し、次のように適用する:
\[ y_i = \gamma_i \hat{x}_i + \beta_i \]
これらのパラメータは逆伝播を通じて訓練中に更新され、ネットワークが有益であれば正規化を解除できるようにする。
バッチ正規化とは異なり、レイヤー正規化はバッチサイズやバッチ内の他のサンプルに依存しない。各入力に対して同じ計算を独立に適用するため、オンライン学習やバッチサイズ1でも容易に使用できる。
バッチ正規化との比較
バッチ正規化は、バッチ全体にわたって各特徴量座標を正規化し、バッチレベルの統計量を使用する。バッチの\( B \)個のサンプルについて、全サンプルにわたる各特徴量次元の平均と分散を計算する。これにより内部共変量シフトは低減されるが、バッチ内のサンプル間に依存関係が生じる。推論時には、バッチ正規化はこれらの統計量の移動平均を使用するため、訓練分布とテスト分布が異なる場合に不整合が生じる可能性がある。
対照的に、レイヤー正規化は各サンプルについて特徴量全体を正規化する。これにはいくつかの利点がある:
- バッチサイズからの独立性:バッチ統計量が不要なため、小さいバッチや単一サンプルの推論でもうまく機能する。
- 再帰型ネットワークでの安定性:RNNはシーケンスをステップごとに処理するが、レイヤー正規化は各タイムステップでバッチ統計量を蓄積せずに適用できる。
- 訓練と推論の一貫性:両フェーズで同じ計算が使用されるため、バッチ正規化のような訓練-テスト間の不一致を回避できる。
しかし、レイヤー正規化は、特徴量次元のスケールが大きく異なる場合や特徴量数が小さい場合には、限られた値の集合から統計量を計算するため、効果が薄い可能性がある。
トランスフォーマーとRNNにおける応用
レイヤー正規化は、2017年のVaswaniらによる論文「Attention Is All You Need」で導入されたトランスフォーマーアーキテクチャの中核的な構成要素である。トランスフォーマーでは、レイヤー正規化は各サブ層(マルチヘッドアテンションやフィードフォワードネットワークなど)の後に、ポストノームまたはプレノーム構成で適用される。プレノーム(サブ層の前に正規化を適用)は現代の実装で一般的となり、訓練を安定化し、より深いモデルを可能にする。
GPT、BERT、およびその後継モデルなどの大規模言語モデルでは、レイヤー正規化が広く使用されている。例えば、OpenAIのGPTモデルは各トランスフォーマーブロック内でプレノームのレイヤー正規化を採用している。これは、OpenAI、Anthropic、Google DeepMindなどのシステムに見られる、数百億パラメータを持つモデルの安定した訓練に貢献している。
再帰型ニューラルネットワークでは、レイヤー正規化は各タイムステップの隠れ状態に適用される。これにより勾配の消失・爆発問題が緩和され、RNNが長距離依存関係をより効果的に学習できるようになる。シーケンス間モデル、音声認識、時系列予測などで使用されている。
変種と拡張
特定の課題に対処するため、レイヤー正規化のいくつかの変種が提案されている:
- 二乗平均平方根レイヤー正規化(RMSNorm):平均減算を省略し、二乗平均平方根のみをスケーリングに使用することでレイヤー正規化を簡素化する。計算オーバーヘッドを削減しつつ性能を維持し、LLaMAなどの一部の大規模言語モデルで使用されている。
- 重み正規化:活性化を正規化する代わりに、層の重みベクトルを正規化する。関連する手法と見なせる。
- インスタンス正規化:主に画像生成で使用され、各チャネルと各サンプルについて空間次元にわたって正規化する。レイヤー正規化と精神的に類似しているが、畳み込みネットワークに適用される。
- グループ正規化:チャネルをグループに分割し、各グループ内で正規化する。コンピュータビジョンタスクにおいてレイヤー正規化とバッチ正規化の間の妥協点を提供する。
これらの変種は、正規化手法が異なるネットワークアーキテクチャやデータモダリティに適応する柔軟性を示している。
訓練ダイナミクスへの影響
レイヤー正規化はいくつかの点で訓練を改善する。活性化を制御された範囲に保つことで、勾配の爆発やシグモイド・tanhなどの活性化関数の飽和を引き起こす極端な値を防ぐ。これにより高い学習率が可能となり、収束が加速する。また、正規化プロセスを通じてわずかなノイズを加えることで過学習を低減する正則化効果もあるが、その効果はドロップアウトほど顕著ではない。
実証研究では、レイヤー正規化が損失曲面を平滑化し、最適化をより予測可能にすることが示されている。これは、小さな摂動が層を通じて増幅される非常に深いネットワークにとって特に重要である。トランスフォーマーでは、レイヤー正規化により数千層のモデルの訓練が可能となり、最近の深層トランスフォーマー研究で実証されている。
限界と考慮事項
利点がある一方で、レイヤー正規化には限界もある。層内の特徴量が同等の分布を持つことを前提としており、特徴量が高度に相関しているか、分散が不均一な場合には、正規化が最適でない可能性がある。さらに、学習可能なパラメータ(\( \gamma \)と\( \beta \))の追加によりモデルサイズがわずかに増加するが、これは全体のパラメータ数に比べれば無視できる程度である。
コンピュータビジョンなどの一部のタスクでは、バッチ全体にわたる空間統計量がより豊富な情報を提供するため、バッチ正規化がレイヤー正規化を上回ることが多い。しかし、自然言語処理やシーケンスモデリングでは、レイヤー正規化が一般的に好まれる。2020年代半ばの時点で、最先端の大規模言語モデルのほとんどは何らかの形のレイヤー正規化に依存しており、生成的AIの分野におけるその重要性を強調している。
結論
レイヤー正規化は深層学習における基本的なツールとなり、複雑なアーキテクチャの安定かつ効率的な訓練を可能にしている。バッチサイズからの独立性と訓練・推論間の一貫性により、現代のAIシステムの基盤となるトランスフォーマーや再帰型ネットワークに理想的である。モデルがスケールし続ける中で、レイヤー正規化とその変種は、信頼性の高い収束と高性能を達成するために今後も不可欠であり続けるだろう。