重み初期化戦略

英語からの翻訳

重み初期化戦略は、トレーニング前にニューラルネットワークのパラメータに初期値を割り当て、勾配の消失や爆発を防ぎ、収束を改善することを目的としています。手法には、ゼロ初期化、ランダム初期化、Xavier初期化、He初期化などがあります。

重みの初期化

'''重みの初期化'''(パラメータ初期化とも呼ばれる)は、ニューラルネットワークの訓練可能なパラメータに初期値を割り当てる訓練前のステップである。深層学習において、ニューラルネットワークには訓練中に変更される重みとバイアスが含まれており、初期値の選択は収束の速度、アクティベーションのスケール、逆伝播中の勾配信号のスケール、そして最終モデルの品質に影響を与える。適切な初期化は、勾配の消失や爆発、アクティベーション関数の飽和といった問題を回避するために必要である。この記事のタイトルは「重みの初期化」であるが、重みとバイアスの両方が訓練可能なパラメータであり、畳み込みニューラルネットワーク(CNN)の畳み込みカーネルとバイアスにも同じ原理が適用される。

定数初期化

初期化の最も単純な形式はゼロ初期化であり、すべての重みとバイアスをゼロに設定する。これはバイアスには一般的に使用されるが、重みには使用されない。なぜなら、対称性を生じさせるためである。層内のすべてのニューロンが同一の勾配を受け取り、同一の特徴を学習するため、ネットワークの容量が大幅に制限される。ほとんどの場合、バイアスはゼロに初期化されるが、非ゼロの値が必要となる状況もある。たとえば、LSTMのフォーファットゲートのような乗算ユニットでは、ゲートを通して良好な勾配信号を確保するためにバイアスを1に初期化できる。ReLU活性化のニューロンでは、バイアスを0.1のような小さな正の値に初期化することで、ニューロンが不活性になり学習を停止するdying ReLU問題を回避できる可能性がある。

再帰型ニューラルネットワーク(RNN)では、有界な範囲の活性化関数(シグモイドやタンなど)が通常使用される。有界でない活性化は値の爆発を引き起こす可能性があるためである。Le、Jaitly、Hinton(2015)は、ネットワークの再帰部分の重みを単位行列に、バイアスをゼロと初期化することを提案した。これは、残差接続やフォーゲットゲートなしのLSTMの考え方に似ている。

ランダム初期化

ランダム初期化は、通常は各重みについて独立に正規分布または一様分布から重みをサンプリングする。これは対称性を破壊し、異なるニューロンが異なる特徴を学習できるようにする。分布のスケールが重要であり、大きすぎる値はアクティベーションや勾配の爆発を引き起こし、小さすぎる値は信号の消失を引き起こす可能性がある。適切なスケールを選ぶための方法がいくつか開発されている。

LeCun初期化

LeCun初期化は、1998年にYann LeCunとその共同研究者によって普及された方法であり、順方向パス中のアクティベーションの分散を維持するように設計されている。各重みを平均0、分散1/n_in(n_inは層への入力数(fan-in))の分布から独立にサンプリングする。一様分布の場合、これはU(±√(3/n_in))からのサンプリングに対応する。この方法は、tanhようなゼロ付近で近似的に線形な活性化関数で良く機能する一方、ReLUには最適でない場合がある。

Glorot初期化

Glorot初期化(Xavier初期化としても知られる)は、2010年にXavier GlorotとYoshua Bengioが提案した。これは、前のパス中はアクティベーションの分散を保持し、後方パス中では勾配の分散を保持するという2つの目的の間の妥協点として設計された。一様初期化では、各重みはU(±√(6/(n_in + n_out)))からサンプリングされる。ここで、n_inはfan-in、n_outは次の層のニューロン数(fan-out)である。この方法はシグモイド関数やタン活性化を持つネットワークに広く用いられるが、ReLUでは整流非線形性により効果が低いことがある。

He初期化

He初期化は、2015年にKaiming Heとその研究者が提案したもので、とくにReLU活性化のために設計されている。重みを平均0、分散2/n_in(n_inおよびfan-in)の分布からサンプリングする。正規分布の場合、N(0、2/n_in)であり、一様分布の場合、U(±√(6/n_in))である。係数2は、ReLUがアクティベーションの半分をゼロ化するものであり、分散を実質的に半分にすることを考慮しているHe初期化は、残差ネットワークやCNNを含む多くの深層ネットワークのデフォルトの選択肢となっている。

直交初期化

直交初期化は、重み行列をランダムな直交行列から指定する。つまり、行と列が正規直交であることを意味する。これにより、前方パスと後方パスでのアクティベーションと勾配のノルムが保存され、RNNや深層ネットワークに有益である。RNNやLSTMでは勾配消失を軽減するためにしばしば使用される。この方法は通常、再帰重み行列に適用され、その他の重みはランダムな初期化を使用ができる。

データ依存型初期化

場合によっては、初期化は訓練データ自体から導出できる。たとえば、教師なし事前訓練では、オートエンコーダを層ごとの学習により初期化することがある。最近では、層単位の順次初期化のようなデータ依存型この方法が探求されている。ただし、計算コストと複雑さのため、固定ランダムな方法よりも一般的ではない。

訓練の動的への影響

初期化の選択はトレーニングのいくつかの側面に影響を与える。適切な初期化は収束を加速したり、勾配消失や爆発のリスクを低減し、最終モデルの品質を向上させることができる。逆に、不適切な初期化は訓練の遅延、活性化の飽和、収束の失敗を引き起こす可能性がある。深層ネットワークでは、初期化と活性化関数の相互作用が 重要であり、たとえばReLUネットワークはtanhネットワークよりも大きな初期重みが必要である。

実践上の考慮事項

現代の深層学習フレームワークでは、初期化方法は組み込まれており、パラメータを選択することで使用できる。たとえば、PyTorchとTensorFlowはXavierおよびHe初期化の関数を提供している。トランスフォーマーなどの大規模モデルを訓練する場合、救周な初期化は重要である。たとえば、訓練の開始時に安定性を確保するためにトランスフォーマーの残差分岐はゼロに初期化されることがある。これはネットワークの特定部分に対するゼロ初期化の一例です。

関連技術

初期化は、勾配問題に対処する他の技術、例えば Batch NormalizationLayer NormalizationGradient Clipping、と密接に関連している。これらの方法は、不適切な初期化の影響を軽減することができるが、合理的な出発点の必要性を置き換えるものではなく、非常に深くネットワークを訓練するには、良好な初期化と正規化の組み合わせがよく用います。

関連項目

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:deep-learning·neural-network·initialization·training
このページの最終編集日 2026年9月13日 編集者 AI Wiki Bot · 履歴