機械学習において、ハイウェイネットワークは、深いフィードフォワードニューラルネットワークのアーキテクチャであり、数百層のネットワークを初めてうまく訓練することに成功したもので、2014年の最先端モデルで一般的だった20〜30層をはるかに超えていた。これは、層を積み重ねすぎると訓練精度が急激に低下する「劣化」問題を克服しようとする研究者らによって、2015年5月に導入された。このアーキテクチャは、長短期記憶(LSTM)リカレントニューラルネットワークに触発され、学習されたゲーティング機構を用いて層間の情報の流れを調節する。これらのゲートは「情報ハイウェイ」を形成し、勾配がより容易に伝播できるようにして、勾配消失問題を緩和し、最適化を改善する。
ハイウェイネットワークは、2015年12月に発表された残差ニューラルネットワーク(ResNet)と同時期に開発された。ResNetは、ゲートが常に開いている(活性化1.0)ハイウェイネットワークの特殊なケースと見なすことができる。ハイウェイネットワークは、テキストシーケンスラベリングや音声認識タスクで実用的な応用が見られている。
モデルとゲーティング機構
ハイウェイネットワークは、標準的なフィードフォワード層を拡張し、主変換関数\(H(W_H, x)\)に加えて、変換ゲート\(T(W_T, x)\)とキャリーゲート\(C(W_C, x)\)の2つのゲートを追加する。両方のゲートは通常シグモイド関数であり、0から1の間の値を出力する。キャリーゲートは\(C(W_C, x) = 1 - T(W_T, x)\)と定義され、変換経路とキャリー経路の合計が1になることを保証する。
ハイウェイ層の出力は次のように計算される:
\(y = H(x, W_H) \cdot T(x, W_T) + x \cdot C(x, W_C)\)
または同等に:
\(y = H(x, W_H) \cdot T(x, W_T) + x \cdot (1 - T(x, W_T))\)
この定式化により、層は入力をそのまま通過させる(変換ゲートが0に近い場合)か、非線形変換を適用する(ゲートが1に近い場合)ことができる。ゲーティングは訓練中に学習され、ネットワークが各層を流れる情報量を動的に制御できるようにする。
LSTMおよびResNetとの関係
ハイウェイネットワークは、LSTMリカレントニューラルネットワークから直接的な着想を得ている。Sepp Hochreiterは1991年に勾配消失問題を分析し、深いネットワークの訓練が難しい原因であると指摘した。元のLSTM(1997年)は、固定重み1.0の残差接続である定誤差カルーセルを導入し、長いタイムステップにわたって勾配が流れることを可能にした。後のLSTMの変種(2000年)は、学習可能な「忘却ゲート」を追加してこれらの恒等接続を調節し、勾配消失問題をより柔軟に対処した。
ハイウェイネットワークは、これらの原理をフィードフォワードネットワークに適用する。これは、忘却ゲートを持つLSTMを時間的に展開したものに類似しており、ゲートは学習される。対照的に、2015年12月に後で発表されたResNetには忘却ゲートに相当するものはなく、そのスキップ接続は常に開いており、1997年の元のLSTMに似ている。ハイウェイネットワークのゲートを開いたまま(活性化1.0)にすると、ResNetになる。
残差接続は、より広い「ショートカット接続」または「スキップ接続」の概念の特殊なケースであり、これはRosenblatt(1961年)やLang & Witbrock(1988年)にまで遡る。これらの接続は\(x \mapsto F(x) + Ax\)の形を取り、ここで\(A\)は重み行列である。残差接続では\(A\)は恒等行列であるが、一般的なスキップ接続では\(A\)は任意であり得る。したがって、すべての残差接続はスキップ接続であるが、すべてのスキップ接続が残差であるわけではない。
訓練と性能
元のハイウェイネットワークの論文では、20、50、100層のネットワークでの実験が報告され、最大900層までの進行中の作業が言及された。ゲーティング機構により、これらの非常に深いネットワークを効果的に訓練でき、通常の深いネットワークよりも優れた最適化を達成した。情報の流れを調節することで、ゲートは勾配消失問題(勾配が小さすぎて初期層の重みを更新できない問題)を防ぐのに役立つ。
他の深層学習アーキテクチャと比較して、ハイウェイネットワークは非常に深いモデルの訓練可能性を改善する利点を提供する。ただし、ゲート用の追加パラメータが必要であり、計算コストが増加する。ハイウェイネットワークとResNetの成功は、非常に深いアーキテクチャを効果的に訓練できることを実証し、その後の深層学習の進歩への道を開いた。
応用と遺産
ハイウェイネットワークは、深いアーキテクチャが複雑なパターンを捉えるのに有益であるテキストシーケンスラベリングや音声認識に応用されてきた。また、コンピュータビジョンにおける基礎的な構成要素となったResNetなどの後のアーキテクチャの開発にも影響を与えた。ゲート付きスキップ接続の概念は、トランスフォーマーや大規模言語モデルを含む現代の深層学習において様々な形で採用されている。
ハイウェイネットワークの背後にあるアイデアは、トロント大学などの機関や、Sepp Hochreiterやユルゲン・シュミットフーバーなどの研究者による貢献によって推進されてきた深層学習のより広い進化の一部である。ハイウェイネットワーク自体は今日ではあまり一般的に使用されていないが、その原理は非常に深いニューラルネットワークを訓練する方法を理解する上で依然として関連性がある。