トランスフォーマーは、人工ニューラルネットワークアーキテクチャの一族であり、深層学習で使用され、マルチヘッド注意機構に基づいている。テキスト、画像、音声などの入力データは、トークンと呼ばれる数値表現のシーケンスに変換され、各トークンは単語埋め込みテーブルを介してベクトルにマッピングされる。各層では、すべてのトークンが並列マルチヘッド注意を使用してコンテキストウィンドウ内で文脈化され、重要なトークンを増幅し、関連性の低いものを減少させる。自己注意だけでは置換不変であるため、トランスフォーマーは位置エンコーディングまたは学習された埋め込みを通じて位置情報を注入し、トークンの順序が出力に影響を与える。
トランスフォーマーには再帰ユニットがなく、LSTMなどの以前の再帰アーキテクチャよりもトレーニング時間が短くて済む。現代の設計は、エンコーダーのみ、デコーダーのみ、エンコーダー・デコーダーの変種にグループ化され、表現学習、自己回帰生成、または条件付きシーケンス間タスクに最適化されている。元のトランスフォーマーは、Googleの研究者による2017年の論文「Attention Is All You Need」で提案された。それ以来、大規模言語モデル(LLM)の基盤となり、自然言語処理、コンピュータビジョン、強化学習、音声、マルチモーダル学習、ロボティクス、チェスでの応用が見られる。
歴史
前身
長年にわたり、シーケンスモデリングは、Elmanネットワーク(1990年)などの単純な再帰ニューラルネットワーク(RNN)を使用していた。理論上、1つのトークンからの情報は任意に遠くまで伝播できたが、勾配消失問題により、長いシーケンスでは正確に抽出可能な情報が残らなかった。重要なブレークスルーはLSTMであり、1995年の技術報告書で説明され、1997年に正式に出版され、勾配消失を緩和するゲーティングメカニズムを導入した。LSTMは乗法的ゲーティングユニットを使用し、加法的注意とは概念的に異なっていた。2017年まで長いシーケンスモデリングの標準となったが、RNNはトークンを順次処理するため、並列化が妨げられた。線形スケーリングの高速重みコントローラ(1992年)は、入力に基づいて重み行列を計算することを学習し、正規化されていない線形トランスフォーマーと同等であった。
注意を伴うseq2seq
エンコーダー・デコーダーシーケンス変換は2010年代初頭に開発され、2014年の2つの同時論文があった。380Mパラメータのモデルは、機械翻訳に2つのLSTMを使用した。エンコーダーLSTMがトークンシーケンスをベクトルに変換し、デコーダーLSTMがそれを出力に変換した。別の130Mパラメータのモデルは、ゲート付き再帰ユニット(GRU)を使用し、後にLSTMと同等であることが示された。これらの初期のseq2seqモデルには注意がなく、最後の単語後の固定サイズの状態ベクトルに依存しており、長い入力情報をうまく保持できなかった。入力文を逆順にすることで翻訳が改善され、ボトルネックが強調された。RNN検索モデルは、seq2seqに注意を導入し、長い依存関係の処理を改善した。2016年、Google翻訳はGoogleニューラル機械翻訳に刷新され、8層の双方向LSTM seq2seqモデルを使用し、統計的手法を上回った。
注意の並列化
注意を伴うseq2seqモデルは、再帰ネットワークの並列化の難しさに依然悩まされ、GPUアクセラレーションを制限していた。2016年、分解可能注意がフィードフォワードネットワークに自己注意を適用し、より少ないパラメータで最先端のテキスト含意を達成した。著者Jakob Uszkoreitは、再帰なしの注意が翻訳に十分かもしれないと疑い、「Attention Is All You Need」というタイトルにつながった。
アーキテクチャ
トランスフォーマーアーキテクチャは、エンコーダーとデコーダーで構成され、各層はマルチヘッド自己注意と位置ごとのフィードフォワードネットワークを持つ。エンコーダーは入力シーケンスを並列に処理し、デコーダーはマスクされた自己注意を使用して将来のトークン漏洩を防ぎながら、出力を自己回帰的に生成する。マルチヘッド注意は複数の注意メカニズムを並列に実行し、モデルが異なる表現サブスペースに焦点を当てることを可能にする。位置エンコーディングはトークン埋め込みに追加され、順序を捉える。層正規化と残差接続はトレーニングを安定させる。デコーダーはまた、クロスアテンションを使用してエンコーダー出力に注意を向ける。
変種
エンコーダーのみ
BERTなどのエンコーダーのみのモデルは、表現学習に最適化され、分類や理解タスクに有用な文脈化されたトークン埋め込みを生成する。双方向注意を使用し、左右両方のコンテキストを見る。
デコーダーのみ
GPTなどのデコーダーのみのモデルは、自己回帰生成用に設計され、以前のトークンが与えられた次のトークンを予測する。マスクされた自己注意を使用し、大規模テキストコーパスでトレーニングされたほとんどの現代のLLMの基盤である。
エンコーダー・デコーダー
元のトランスフォーマーなどのエンコーダー・デコーダーモデルは、翻訳や要約などの条件付きシーケンス間タスクを処理する。エンコーダーがソースを処理し、デコーダーがターゲットを生成する。
応用
トランスフォーマーは、生成AIシステムで使用され、GPTやBERTなどのLLMを含み、OpenAI、Anthropic、Google DeepMindなどの企業に採用されている。自然言語処理、コンピュータビジョン(ビジョントランスフォーマー)、強化学習、音声処理、マルチモーダル学習、ロボティクス、さらにはチェスプレイプログラムを支えている。そのスケーラビリティはハードウェアの進歩を促進し、AWS TrainiumやGroqの推論プロセッサなどの専用チップがある。
影響
トランスフォーマーは人工知能に革命をもたらし、多様なタスクに微調整できる事前トレーニング済みシステムを可能にした。RNNと比較してトレーニング時間を短縮し、前例のないモデルサイズを可能にし、言語理解と生成のブレークスルーにつながった。アーキテクチャの柔軟性は、多くのAIアプリケーションのデフォルトの選択肢となり、研究と産業の両方に影響を与えている。
制限と未来
その成功にもかかわらず、トランスフォーマーはコンテキスト長で2次計算を必要とし、長いシーケンスを高価にする。研究者は、線形注意メカニズムや代替アーキテクチャを模索しており、この問題に対処している。2025年の時点で、トランスフォーマーは支配的であり続けているが、進行中の革新により、より効率的な設計につながる可能性がある。