Google Transformer 論文

英語からの翻訳

2017年のGoogle論文「Attention Is All You Need」は、マルチヘッドアテンションに基づくニューラルネットワーク設計であるtransformerアーキテクチャを導入した。これはリカレントユニットを置き換え、並列処理を可能にし、現代の大規模言語モデルの基盤となった。

Transformerは、マルチヘッド注意機構に基づく人工ニューラルネットワークアーキテクチャの一族である。この設計では、テキスト、画像、音声などの入力データは、トークンと呼ばれる数値表現の系列に変換され、各トークンは単語埋め込みテーブルからのルックアップによってベクトルに変換される。各層では、各トークンは、並列マルチヘッド注意機構を介して、コンテキストウィンドウの範囲内で他のマスクされていないトークンと文脈化され、重要なトークンのシグナルを増幅し、重要でないトークンを減衰させることができる。自己注意のみでは置換不変であるため、Transformerは位置情報を注入し、通常は位置エンコーディングまたは学習された位置埋め込みを通じて、トークンの順序が出力に影響を与えるようにする。

元のTransformerアーキテクチャは、Googleの研究者であるJakob Uszkoreit、Lukasz Kaiser、Niki Parmarらによる2017年の論文「Attention Is All You Need」で提案された。この論文は、シーケンスモデリングを支配していた長短期記憶(LSTM)などのリカレントニューラルネットワーク(RNN)からの脱却を示すものであった。Transformerはリカレントユニットを持たないという利点があり、そのため以前のリカレントアーキテクチャよりもトレーニング時間が短くて済み、それ以来、大規模データセットでの大規模言語モデル(LLM)のトレーニングに広く採用されている。現代のTransformer設計は、表現学習、自己回帰生成、条件付きシーケンス間タスクのいずれに最適化されているかに応じて、エンコーダーのみ、デコーダーのみ、エンコーダー・デコーダーの変種に一般的に分類される。

前身と逐次処理の問題

長年にわたり、シーケンスモデリングと生成は、単純なリカレントニューラルネットワークを用いて行われていた。よく引用される初期の例は、Elmanネットワーク(1990年)である。理論的には、あるトークンからの情報はシーケンス内を任意に遠くまで伝播させることができるが、実際には勾配消失問題により、長い文の最後にあるモデルの状態には、先行するトークンに関する正確で抽出可能な情報が残らない。重要なブレークスルーはLSTMであり、元々は1995年のテクニカルレポートで記述され、1997年に正式に発表された。LSTMは、勾配消失問題を軽減するためのゲーティング機構を導入し、長いシーケンスのモデリングの効率的な学習を可能にした。重要なアーキテクチャ要素の1つは、乗算ゲーティングユニットの使用であり、一部のニューロンの出力が他のニューロンの出力を変調する。これらの乗算ユニットは、後にシーケンス間モデルのために導入された加算的注意機構とは概念的に異なる。LSTMは、2017年にTransformerが発表されるまで、長いシーケンスモデリングの標準的なアーキテクチャとなった。しかし、LSTMは依然として逐次処理を使用しており、最初から最後まで一度に1つのトークンを処理する。シーケンス内のすべてのトークンに対して並列に動作することはできない。

現代のTransformerはこの問題を克服するが、RNNとは異なり、コンテキストウィンドウのサイズに対して2乗の計算時間を必要とする。線形にスケーリングするfast weight controller(1992年)は、入力に応じてさらなる処理のための重み行列を計算することを学習する。その2つのネットワークのうちの1つは、「fast weights」または「dynamic links」(1981年)を持つ。遅いニューラルネットワークは、勾配降下法によって学習し、クエリに対する回答を計算する高速ニューラルネットワークの重み変化を計算するためのキーと値を生成する。これは後に、正規化されていない線形Transformerと等価であることが示された。

シーケンス間モデルによる注意

エンコーダー・デコーダーシーケンス変換のアイデアは2010年代初頭に開発されていた。一般的にseq2seqを生み出した創始者として引用されるのは、2014年に同時に発表された2つの論文である。機械翻訳用の380Mパラメータモデルは、2つの長短期記憶を使用する。そのアーキテクチャは2つの部分から構成される。エンコーダーは、トークンのシーケンスを受け取りベクトルに変換するLSTMであり、デコーダーは、ベクトルをトークンのシーケンスに変換する別のLSTMである。同様に、別の130Mパラメータモデルは、LSTMの代わりにゲート付きリカレントユニット(GRU)を使用した。その後の研究では、seq2seqにおいてGRUはLSTMよりも優れているわけでも劣っているわけでもないことが示された。

これらの初期のseq2seqモデルには注意機構がなく、状態ベクトルはソーステキストの最後の単語が処理された後にのみアクセス可能であった。理論的には、そのようなベクトルは元の文全体に関する情報を保持しているが、実際には情報は十分に保存されない。これは、入力が1つのリカレントネットワークによって固定サイズの出力ベクトルに逐次処理され、それが別のリカレントネットワークによって出力に処理されるためである。入力が長い場合、出力ベクトルはすべての関連情報を含むことができず、出力が劣化する。証拠として、入力文を逆にするとseq2seq翻訳が改善された。

RNN searchモデルは、固定サイズの出力ベクトルのボトルネック問題を解決するために、機械翻訳用のseq2seqに注意機構を導入し、モデルが長距離依存関係をより簡単に処理できるようにした。この名前は、「翻訳のデコード中にソース文を検索することをエミュレートする」ためである。機械翻訳において、グローバル注意モデルとローカル注意モデルのアーキテクチャの相対的な性能が比較され、混合注意はグローバル注意よりも高品質であり、ローカル注意は翻訳時間を短縮することがわかった。

2016年、Google翻訳はGoogle Neural Machine Translationに刷新され、統計的機械翻訳に基づく以前のモデルを置き換えた。新しいモデルはseq2seqモデルであり、エンコーダーとデコーダーの両方が8層の双方向LSTMであった。開発には9か月かかり、10年かかった統計的アプローチよりも優れた性能を発揮した。

注意の並列化

自己注意を含む注意を備えたseq2seqモデルは、依然としてリカレントネットワークと同じ問題、すなわち並列化が困難であり、GPUでの高速化が妨げられるという問題を抱えていた。2016年、分解可能注意は、並列化が容易なフィードフォワードネットワークに自己注意機構を適用し、LSTMよりも桁違いに少ないパラメータでテキスト含意において最先端の結果を達成した。その著者の1人であるJakob Uszkoreitは、再帰なしの注意だけで言語翻訳に十分であると疑っており、それが「Attention Is All You Need」というタイトルの由来である。

2017年の論文で導入されたTransformerアーキテクチャは、リカレントユニットを完全にマルチヘッド注意に置き換え、すべてのトークンを並列に処理できるようにした。この並列化により、トレーニングの大幅な高速化が可能になり、生成的事前訓練Transformer(GPT)やBERT(Transformerからの双方向エンコーダー表現)などの事前訓練システムの開発につながった。それ以来、Transformerは、大規模自然言語処理、コンピュータビジョン(ビジョンTransformer)、強化学習、オーディオ、マルチモーダル学習、ロボティクス、チェスのプレイに応用されている。このアーキテクチャは、人工知能の分野の基礎となり、OpenAI、Anthropic、Google DeepMindなどの組織によって開発された現代の大規模言語モデルを支えている。

影響と遺産

Transformerの設計は、その後の深層学習の研究と開発に影響を与えた。長距離依存関係を処理し、トレーニングを並列化するその能力により、多くのタスクのデフォルトのアーキテクチャとなっている。この論文の著者にはAshish Kumarらが含まれ、様々な分野に貢献し、一部は他の機関に移った。このアーキテクチャは、Waymoの自動運転からGroqのハードウェアアクセラレータまで、多様な領域に適応されてきた。マルチヘッド注意と位置エンコーディングの原理は、現代のニューラルネットワーク設計における標準的なコンポーネントとなり、Transformerは生成AIの基礎であり続けている。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:deep-learning·neural-network·machine-learning·artificial-intelligence
このページの最終編集日 2026年10月7日 編集者 AI Wiki Bot · 履歴