「Attention Is All You Need」は、Googleに勤務する8人の科学者とエンジニアによって執筆された、機械学習に関する2017年の研究論文である。この論文は、2014年にBahdanauらによって提案されたアテンション機構に基づく、トランスフォーマーとして知られる新しい深層学習アーキテクチャを紹介した。この論文が記述するトランスフォーマーアプローチは、大規模言語モデルを含む多種多様な人工知能システムの主要なアーキテクチャとなっている。当時、研究の焦点は機械翻訳のためのSeq2seq技術の改善にあったが、著者らは論文の中でさらに踏み込み、質問応答や、現在マルチモーダル生成AIとして知られるものなどの他のタスクへの技術の可能性を予見していた。
チームがトランスフォーマーアーキテクチャを試した初期の例には、英語からドイツ語への翻訳、「The Transformer」に関するウィキペディア記事の生成、構文解析などがあった。これらの実験により、チームはトランスフォーマーが翻訳にのみ有効なのではなく、汎用の言語モデルであると確信した。
2026年時点で、この論文は25万回以上引用されており、21世紀で最も引用された論文のトップ10に入っている。この論文がGoogleによって発表された後、8人の著者は全員が会社を離れ、他の企業に加わるか、スタートアップを設立した。
背景
この論文の著者は、Ashish Vaswani、Noam Shazeer、Niki Parmar、Jakob Uszkoreit、Llion Jones、Aidan Gomez、Lukasz Kaiser、Illia Polosukhinである。8人の著者は全員が論文への「同等の貢献者」であり、記載順はランダム化されていた(論文自体による)。論文発表後、著者たちはそれぞれGoogleを離れ、他の企業に加わるか、スタートアップを設立した。
論文のタイトルは、ビートルズの曲「All You Need Is Love」に由来する。「Transformer」という名前は、論文の著者の一人であるJakob Uszkoreitがその言葉の響きを気に入ったために選ばれた。初期の設計文書は「Transformers: Iterative Self-Attention and Processing for Various Tasks」と題され、トランスフォーマーフランチャイズの6人のキャラクターのイラストが含まれていた。チーム名はTeam Transformerと名付けられた。
議論され、導入された手法
この論文は、ほとんどの現代の大規模言語モデル(LLM)の基礎となるトランスフォーマーアーキテクチャを導入したことで最もよく知られている。このアーキテクチャがほとんどの現代のLLMに好まれる主な理由は、その前身に対するアーキテクチャの並列化可能性である。これにより、トレーニングに必要な操作をGPU上で高速化でき、トレーニング時間の短縮と、より大規模なモデルのトレーニングの両方が可能になる。
この論文では、トランスフォーマーアーキテクチャの開発の一環として、以下のメカニズムを導入した。
スケールド・ドットプロダクト・アテンションとセルフアテンション
リカレントニューラルネットワーク(RNN)や長短期記憶(リカレンスに依存する)の代わりに、スケールド・ドットプロダクト・アテンションとセルフアテンション機構を使用することで、以下の段落で説明するように、より良いパフォーマンスが可能になる。この論文では、スケールド・ドットプロダクト・アテンションを次のように記述している。
Attention(Query, Key, Value) := softmax(Query × Key^T / √d_k) × Value
ここで、Query、Key、Valueはそれぞれクエリ、キー、バリュー行列であり、d_kは値の次元である。
モデルは同じソース(つまり、入力シーケンスまたはコンテキストウィンドウ)から得られるQuery、Key、Value行列に依存するため、RNNの必要性がなくなり、アーキテクチャの並列化可能性が完全に保証される。これは、2014年に導入された元の形式のアテンション機構とは異なる。さらに、この論文では、上記のようにキーベクトルの次元(d_kとして表され、論文内では当初64に設定)に関して最も効果的であることが判明した追加のスケーリング係数の使用についても論じている。
論文が焦点を当てた翻訳という特定の文脈では、Query行列とKey行列は通常、ソース言語に対応する埋め込みで表現され、Value行列はターゲット言語に対応する。
マルチヘッドアテンション
セルフアテンション機構では、クエリ(Q)、キー(K)、バリュー(V)が各入力シーケンス(通常はコンテキストウィンドウのサイズによって制限される)に対して動的に生成され、モデルが異なるステップで入力シーケンスの異なる部分に焦点を当てることを可能にする。マルチヘッドアテンションは、複数の並列アテンションヘッドを導入することでこのプロセスを強化する。各アテンションヘッドは、Q、K、V行列の異なる線形射影を学習する。これにより、モデルは単一の側面に焦点を当てるのではなく、シーケンス内の単語間の関係の異なる側面を同時に捉えることができる。
これにより、マルチヘッドアテンションは、モデルが異なる位置で異なる表現部分空間からの情報に注意を向けることを可能にする。この論文では、ヘッド数を8に設定し、各ヘッドの次元を縮小(d_k = 64)して、単一のフル次元アテンションヘッドと同様の総計算コストを実現した。
位置エンコーディング
トランスフォーマーアーキテクチャは本質的にシーケンス内のトークンの順序を捕捉しないため、この論文では位置エンコーディングを導入した。これらは、各トークンの位置に関する情報を提供するために入力埋め込みに追加されるベクトルである。この論文では、異なる周波数のサイン関数とコサイン関数を使用し、モデルが相対位置によって注意を向けることを学習できるようにした。これは、単語の順序が重要となる翻訳などのタスクにとって重要な要素であった。
その他の構成要素
この論文では、深層学習コミュニティで既に知られていた他のいくつかの技術も組み込んだ。トレーニングを安定させるための層正規化、正則化のためのDropout、ウォームアップフェーズとその後の減衰を含むカスタム学習率スケジュールを備えたAdamオプティマイザを使用した。アーキテクチャはエンコーダー・デコーダー構造に従い、マルチヘッドアテンションとフィードフォワードネットワークの層を積み重ね、各サブレイヤーの周囲に残差接続を使用した。
影響と遺産
この論文で導入されたトランスフォーマーアーキテクチャは、自然言語処理における支配的なアプローチとして急速に確立された。多くのアプリケーションでリカレントニューラルネットワークに取って代わり、BERTやGPTなどのモデルの開発につながった。これらのモデルは、OpenAI、Anthropic、Google DeepMindによって開発されたものなどの大規模言語モデルの台頭を支えた。このアーキテクチャの並列化可能性により、GPUやTPUなどの専用ハードウェアでのトレーニングに特に適しており、前例のない規模へのモデルのスケーリングを可能にした。
言語を超えて、トランスフォーマーはコンピュータビジョン、音声処理、さらにはタンパク質フォールディングにも応用され、その汎用性を示している。この論文の影響力は、その引用数に反映されており、2026年までに25万件を超え、コンピュータサイエンス史上最も引用された論文の1つとなっている。
著者たちのその後のキャリアも、この論文の重要性を浮き彫りにしている。Googleを離れた後、彼らはAI21 Labs、Essential AI、Inceptiveなどの企業を含むさまざまなAIスタートアップや研究ラボを設立または参加し、より広範なAIエコシステムに貢献した。
評価と認知
この論文は当初、カリフォルニア州ロングビーチで開催された2017年の神経情報処理システム会議(NeurIPS)で発表され、最優秀論文賞を受賞した。シーケンスモデリングのエレガントな簡素化と、既存のリカレントモデルよりも高速なトレーニング時間で機械翻訳タスクにおける最先端のパフォーマンスを達成した強力な実証結果が賞賛された。
時が経つにつれ、この論文は深層学習の分野における基礎的な研究として認識されるようになった。残差ネットワークやAdamオプティマイザなどの他のブレークスルーと並んで、人工知能の歴史における重要なマイルストーンとしてしばしば引用される。「アテンション」という用語自体がAI研究の中心的な概念となり、その後の数年間で多くの拡張とバリエーションが提案された。
その成功にもかかわらず、この論文はアテンション機構の解釈可能性や大規模トランスフォーマーの計算コストに関して批判に直面しており、より効率的なアーキテクチャと代替アテンション機構に関する継続的な研究につながっている。それでもなお、2026年時点で、トランスフォーマーはほとんどの最先端AIシステムのバックボーンであり続けている。