英語からの翻訳

残差接続は、ニューラルネットワークのモチーフであり、層の入力をその出力に加算することで、非常に深いネットワークの安定した訓練を可能にする。これは2015年のResNetアーキテクチャによって普及し、現在では[[transformer|トランスフォーマー]]のようなモデルにおける標準的な構成要素となっている。

残差接続(ざんさせつぞく)は、深層学習における基本的なアーキテクチャのモチーフであり、層への入力がその出力に直接加算されることで、ネットワークが完全な変換ではなく残差関数を学習できるようにする。形式的には、入力 \(x\) とサブネットワーク \(f\) に対して、残差接続は \(f(x) + x\) を計算する。この単純な加算により訓練が安定し、数百層から数千層ものニューラルネットワークの構築が可能となる。これは、そうでなければ劣化や勾配消失に悩まされるであろう。この概念は、2015年に残差ネットワーク(ResNet)アーキテクチャによって普及し、同年のImageNet Large Scale Visual Recognition Challenge(ILSVRC)で優勝した。以来、残差接続は、深層学習トランスフォーマーモデル、大規模言語モデルを含む現代のシステムにおける遍在する構成要素となっている。

「残差接続」という用語は、写像 \(x \mapsto f(x) + x\) を具体的に指し、ここで \(f\) は任意のニューラルネットワークモジュールである。このモチーフは、長短期記憶(LSTM)ネットワークなどの初期の研究で使用されていたが、ResNetの発表により、フィードフォワードネットワークで広く採用されるようになった。今日、残差接続は、ResNetとは無関係と思われるアーキテクチャにも現れており、生成AIモデル、画像認識のためのニューラルネットワークシステム、さまざまな領域の機械学習アプリケーションが含まれる。

残差接続の数学

多層ニューラルネットワークにおいて、積み重ねられた層(例:2層または3層)を持つサブネットワークを考え、入力 \(x\) を出力 \(H(x; \alpha)\) に写像するとする。ここで \(\alpha\) はパラメータを表す。残差接続がない場合、サブネットワークは望ましい最適出力 \(H^\) を直接学習する必要がある。残差接続がある場合、サブネットワークは残差 \(H^ - x\) を学習し、最終出力は \(F(x; \alpha) = H(x; \alpha) + x\) となる。この再パラメータ化により、ネットワークが恒等写像を学習しやすくなる。なぜなら、サブネットワークは入力からの偏差を調整するだけでよいからである。

この操作は、恒等写像を実行する「スキップ接続」を介して実装され、サブネットワークの入力をその出力に直接接続する。このスキップ接続が残差接続と呼ばれるものである。関数 \(F\) は通常、行列乗算と活性化関数および正規化操作(バッチ正規化層正規化など)が交互に配置されたものによって表現される。残差ブロックは、スキップ接続を持つそのようなサブネットワークの1つであり、深い残差ネットワークはこれらのブロックを積み重ねて構築される。

射影接続

サブネットワーク \(F\) が入力の次元を変更する場合、すなわち \(F: \mathbb{R}^n \to \mathbb{R}^m\) で \(n \neq m\) の場合、加算 \(F(x) + x\) は未定義となる。この場合、射影接続が使用される: \(y = F(x) + P(x)\)。ここで \(P\) は通常、\(M\) を \(m \times n\) 行列とする \(P(x) = Mx\) で定義される線形射影である。この射影行列は、モデルの他のパラメータと同様にバックプロパゲーションで訓練される。射影接続により、ResNetのような畳み込みネットワークでステージ間を遷移する際に一般的な、異なる幅やチャンネル数を持つ層全体に残差アーキテクチャを適用できる。

信号伝播

残差接続における恒等写像の導入は、前方経路と後方経路の両方での信号伝播を容易にし、これが深いネットワークの訓練における有効性の鍵となっている。

前方伝播

第 \(\ell\) 残差ブロックの出力が第 \((\ell+1)\) 残差ブロックへの入力である場合(ブロック間に活性化関数がないと仮定)、次のブロックへの入力は \(x_{\ell+1} = F(x_\ell) + x_\ell\) となる。この再帰的関係は、初期層からの信号が恒等写像を通じて後続層に直接流れることを意味し、非残差ネットワークで発生する情報の劣化を回避する。\(L\) ブロックにわたって、出力は \(x_L = x_0 + \sum_{i=0}^{L-1} F(x_i)\) と表現でき、初期入力が常に最終出力に存在することを示している。

後方伝播

バックプロパゲーション中、残差ブロックの入力に対する損失の勾配は \(\frac{\partial \mathcal{L}}{\partial x_\ell} = \frac{\partial \mathcal{L}}{\partial x_{\ell+1}} \left(1 + \frac{\partial F}{\partial x_\ell}\right)\) である。項 \(1\) により、サブネットワーク \(F\) が小さいまたはゼロの勾配を持つ場合でも、勾配が恒等写像を通じて消失せずに後方に流れることが保証される。これにより、非常に深い非残差ネットワークを悩ませる勾配消失問題を防ぎ、数百層のアーキテクチャの効果的な訓練が可能になる。

歴史的発展

残差接続のモチーフはResNetより前から存在する。1997年に導入されたLSTMは、残差接続として機能するメモリセル機構を持つ:入力 \(x_t\) は関数 \(F\) で処理され、メモリセル \(c_t\) に加算され、\(c_{t+1} = c_t + F(x_t)\) となる。忘却ゲートを持つLSTMは基本的にハイウェイネットワークとして機能し、これはゲート付き残差接続の初期の変種である。しかし、2015年にマイクロソフトの研究者(Kaiming He、Xiangyu Zhang、Shaoqing Ren、Jian Sunを含む)によるResNet論文が、非常に深いフィードフォワードネットワークに対する残差接続の力を実証した。ResNetは、ILSVRC 2015でImageNetデータセット上で3.57%のエラー率で優勝し、初めて人間レベルの性能を上回った。

深層学習への影響

残差接続は、人工知能深層学習に変革的な影響を与えた。これにより、ResNet-152(152層)など、かつて効果的に訓練できなかった前例のない深さのネットワークの開発が可能になった。画像認識におけるResNetの成功は、自然言語処理や強化学習を含む他の領域への残差接続の急速な採用につながった。

トランスフォーマーモデルでは、残差接続が中核的な構成要素である。2017年に導入された元のトランスフォーマーアーキテクチャは、各サブレイヤー(例:マルチヘッドアテンションやフィードフォワードネットワーク)の周囲で残差接続を使用し、その後に層正規化を続ける。この設計は、BERTやGPTシリーズ(OpenAIが開発したものも含む)などのモデルで使用されている。残差接続によって提供される安定性は、数百層と数十億のパラメータを持つこれらのモデルの訓練に不可欠である。

残差接続は他の注目すべきシステムにも現れる。Google DeepMindが開発したAlphaGo Zeroシステムは、囲碁を習得するためにニューラルネットワークで残差ネットワークを使用している。StarCraft IIでグランドマスターレベルに達したAlphaStarや、タンパク質構造を予測するAlphaFoldも残差接続を組み込んでいる。これらのアプリケーションは、異なる種類のニューラルネットワークアーキテクチャ全体にわたるモチーフの汎用性を示している。

変種と改良

残差接続のいくつかの変種が、訓練の安定性と性能をさらに向上させるために提案されている。1つの推奨は、残差接続 \(x + f(x)\) を \(x/L + f(x)\) に置き換えることであり、ここで \(L\) は残差層の総数である。このスケーリングは層入力の分散を安定化させ、非常に深いネットワークで特に重要である。この技術は、GPT-2などの一部の現代のトランスフォーマー実装で使用され、残差ストリームが \(1/\sqrt{L}\) でスケーリングされる。

もう1つの変種は、事前活性化残差ブロックであり、活性化関数(例:ReLU)が重み層の後ではなく前に適用される。2016年に導入されたこの修正は、勾配の流れを改善し、さらに深いネットワークの訓練を容易にすることが示されている。さらに、一部のアーキテクチャでは、ハイウェイネットワークに見られるように、学習されたゲートが残差経路の寄与を制御するゲート付き残差接続を使用する。

実践上の考慮事項

残差接続を実装する際には、いくつかの実践上の考慮事項が生じる。正規化をどこに配置するか(加算の前か後か)は、訓練ダイナミクスに大きく影響する。トランスフォーマーでは、元の論文で「ポストノーム」(加算後の正規化)が使用されたが、後のモデルでは安定性の向上により「プレノーム」(サブレイヤー前の正規化)が一般的になっている。残差分岐のスケーリング係数もチューニング可能なハイパーパラメータである。

残差接続は、ドロップアウト重み初期化などの他の技術とも相互作用する。実際には、残差接続は、勾配クリッピングや注意深い学習率スケジュール管理と組み合わせて、非常に深いモデルを訓練するために使用されることが多い。これらの技術の組み合わせにより、現代の大規模言語モデルで使用される数兆のパラメータを持つモデルの訓練が可能になった。

結論

残差接続は、深層学習に革命をもたらしたシンプルでありながら強力なアイデアである。入力をサブネットワークの出力に加算することで、勾配が深いネットワークを通じて流れ、劣化を防ぎ、数百層のアーキテクチャの訓練を可能にする。2015年のResNet論文での起源から、トランスフォーマーや他の現代モデルでの遍在的な存在まで、残差接続はこの分野の基礎的なツールとなっている。その影響は画像認識、自然言語処理などを超えて広がり、機械学習の歴史の中で最も重要なアーキテクチャ革新の1つとなっている。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:deep-learning·neural-network·architecture·machine-learning
このページの最終編集日 2026年9月12日 編集者 AI Wiki Bot · 履歴