正規化(ノーマライゼーション)は、異なるスケールで測定された値を、概念的に共通のスケールに調整するために用いられる統計的手法であり、多くの場合、平均化や比較の前に行われる。最も単純な形では、正規化はデータを再スケーリングするが、より洗練された調整は確率分布全体を整合させることを目的とする。この用語は、教育評価などの分野で見られ、得点分布が正規分布に整合されることがあり、機械学習では、モデルのトレーニングを安定化・高速化するのに役立つ。
統計学では、正規化の枠組みには標準得点(またはZスコア)が含まれ、データを平均ゼロ、標準偏差1にシフト・スケーリングする。これらの正規化値は、位置とばらつきの影響を除去することで、データセット間の比較を可能にする。百分位数などの一部の正規化は、分布間で分位数を整合させる。これらの比率は、測定が比率尺度上にあること、つまり測定値の比率が意味を持つことを必要とする。
歴史
正規化の概念は、18世紀から19世紀にかけて、アブラハム・ド・モアブル、ピエール=シモン・ラプラス、カール・フリードリヒ・ガウスなどの数学者による正規分布の研究とともに出現した。標準正規分布(平均ゼロ、標準偏差1)への標準化は、正規化として知られるようになった。
Zスコアは、標本値と母平均の差を母標準偏差で割ったものと定義され、20世紀初頭にカール・ピアソンやロナルド・フィッシャーなどの統計学者によって形式化された。統計的推論と仮説検定に関する彼らの研究が、この手法を普及させた。
ウィリアム・シーリー・ゴセットは、ギネス醸造所で働きながら、小標本近似、つまり小さなデータセットに対して正規分布を調整し、より高く狭く見えるようにする問題に取り組んだ。1908年に「スチューデント」というペンネームで発表した彼の研究は、後にフィッシャーによって拡張され、スチューデントのt分布となった。これは、小標本サイズに対する初期の正規化手法であった。
特徴スケーリングとバッチ正規化
20世紀半ばに多変量統計とコンピュータが台頭すると、異なる単位を持つ大規模データセットを正規化する方法、例えばミニマックススケーリングやロバストスケーリングが登場した。これらの手法は総称して特徴スケーリングと呼ばれ、20世紀後半にパターン認識やニューラルネットワークなどの分野で重要になった。
2015年、セルゲイ・イオッフェとクリスチャン・セゲディは、深層ニューラルネットワークのトレーニングを安定化・加速するための手法であるバッチ正規化を提案した。この手法は、トレーニング中にネットワーク内の層への入力を正規化し、より高い学習率を可能にし、初期化への感度を低減する。これは多くの深層学習アーキテクチャの標準的な構成要素となっている。
正規化の種類
一般的な正規化にはいくつかの種類があり、それぞれ異なる特徴を持つ:
- Zスコア(標準得点): 平均と標準偏差に基づいて再スケーリングし、値が平均から何標準偏差離れているかを示す無次元量を生成する。
- ミニマックススケーリング: 最小値を引き、範囲で割ることにより、データを固定範囲(通常[0, 1])に再スケーリングする。これは外れ値に敏感である。
- ロバストスケーリング: 中央値と四分位範囲を使用し、ミニマックススケーリングの推定よりも外れ値に対して敏感でない。
- 百分位正規化: 各値に百分位順位を割り当て、分布をゼロから100に整合させる。これは標準化テストで一般的である。
- 分位正規化: 異なる分布の分位数を整合させ、複数のデータセットの統計的特性が類似していることを保証する。
これらの方法は無次元であり、つまりほとんどの場合スケール不変(単位なし)であるが、分散対平均比(σ²/μ)のような一部の比率は単位を持ち、スケール不変ではない。
機械学習における応用
正規化は、人工知能モデルのトレーニングに実用的である。特徴スケーリングにより、異なる単位を持つ入力変数(例えば、センチメートル単位の身長とキログラム単位の体重)がモデルに平等に寄与し、巨大な変数が距離計算や勾配更新を支配するのを防ぐ。ニューラルネットワークのトレーニングでは、正規化された入力は勾配の消失や爆発のリスクを低減し、安定した収束を可能にする。
この概念は生の入力に留まらず、バッチ正規化はネットワーク内部で動作し、各層の活性化を正規化する。これは標準化と深層ネットワークに役立ち、現代の大規模言語モデルやコンピュータビジョンシステムで広く採用されている。
考慮事項と関連概念
正規化の使用は、データが自然に有界である場合とは異なる。過度の正規化は相対的な差を縮小させることがある。機械学習の実践では、学者たちは、データ漏洩を避けるためにデータを分割した後に特徴スケーリングを適用すべきであり、一部のアルゴリズム(例えば、木ベースの手法)は単調変換に対して不変であり、スケーリングの必要性が低いことをしばしば強調する。
正規化はまた、理論統計学におけるピボット量のより広い概念にも関連する。ピボット量とは、その標本分布が観測値のパラメータに依存しない関数であり、未知数なしで計算できる場合、それは補助統計量となる。標準化はしばしばそのようなピボット量を導き出し、これは仮説検定で使用される。