ゲート付き回帰型ユニット(GRU)は、リカレントニューラルネットワーク(RNN)で使用されるゲーティング機構の一種であり、2014年にKyunghyun Choらによって導入された。これは、更新ゲートとリセットゲートを使用して情報の流れを制御することで、標準的なRNNで一般的な勾配消失問題に対処するように設計されている。長短期記憶(LSTM)ユニットと比較して、GRUはより単純なアーキテクチャを持ち、独立したコンテキストベクトルと出力ゲートを欠いており、その結果パラメータ数が少ない。この単純化にもかかわらず、GRUはポリフォニック音楽モデリング、音声信号モデリング、自然言語処理などのタスクにおいてLSTMと同等の性能を示している。Yoshua Bengioのチームによる研究は、ゲーティングが一般的に有益であることを示したが、GRUとLSTMのどちらが全体的に優れているかについては決定的な結論には至らなかった。
アーキテクチャ
GRUは、各タイムステップで更新される隠れ状態 \( h_t \) を維持することでシーケンスを処理する。完全ゲート付きユニットの核心的な方程式は以下の通りである:
\[ z_t = \sigma(W_z x_t + U_z h_{t-1} + b_z) \]
\[ r_t = \sigma(W_r x_t + U_r h_{t-1} + b_r) \]
\[ \hat{h}_t = \phi(W_h x_t + U_h (r_t \odot h_{t-1}) + b_h) \]
\[ h_t = (1 - z_t) \odot h_{t-1} + z_t \odot \hat{h}_t \]
ここで、\( \sigma \) はシグモイド活性化関数、\( \phi \) は通常双曲線正接(tanh)、\( \odot \) はアダマール積(要素ごとの積)を表す。入力ベクトルは \( x_t \in \mathbb{R}^d \)、隠れ状態は \( h_t \in \mathbb{R}^e \) である。更新ゲート \( z_t \) は前の隠れ状態をどの程度保持するかを決定し、リセットゲート \( r_t \) は候補活性化 \( \hat{h}_t \) を計算する際に過去の情報をどの程度忘れるかを制御する。最終的な隠れ状態は、更新ゲートによって重み付けされた前の状態と候補の間の線形補間である。
バリアント
GRUにはいくつかのバリエーションが存在し、ゲートの計算方法と組み合わせ方が異なる。最も一般的なバリアントは、上記で説明した完全ゲート付きユニットである。最小ゲート付きユニット(MGU)として知られる簡略化されたバージョンは、更新機能とリセット機能を組み合わせた単一のゲートのみを使用し、パラメータ数をさらに削減する。他のバリアントは、バイアスの配置や操作の順序を変更する場合があるが、すべて情報の流れを管理するためのゲーティングという核心的な原理を保持している。
応用と性能
GRUは、音声認識、機械翻訳、時系列予測など、シーケンスモデリングタスクで広く採用されている。比較研究では、GRUは多くのベンチマーク、特にポリフォニック音楽モデリングと音声信号モデリングにおいてLSTMの性能に匹敵している。パラメータ数が少ないため計算効率が高く、大規模データセットでのトレーニングやリソースが制約された環境での使用に有利である。ただし、GRUとLSTMの選択は特定のタスクとデータセットに依存することが多く、普遍的な勝者はいない。
他のアーキテクチャとの関係
GRUは、特にTransformer (architecture)アーキテクチャの台頭以前において、多くの深層学習モデルの基礎的な構成要素である。トランスフォーマーが大規模言語モデルや生成AIで支配的になる一方で、GRUはリカレント処理が有益なシーケンシャルデータを扱うタスクにおいて依然として関連性がある。また、リカレント機構とアテンション機構を組み合わせたハイブリッドモデルでも使用されている。GRUの開発は、ニューラルネットワークにおけるゲーティング機構のより広範な理解に貢献し、その後のモデル設計における革新に影響を与えた。