「Attention Is All You Need」(2017年)

英語からの翻訳

『Attention Is All You Need』は、2017年に発表された、8人のGoogle研究者による機械学習に関する論文であり、注意機構に基づく深層学習モデルであるTransformerアーキテクチャを導入した。この論文は、大規模言語モデルを含む現代のAIシステムの基盤となり、2026年時点で25万回以上引用されている。

「Attention Is All You Need」は、Googleに勤務する8人の科学者とエンジニアによって執筆された、2017年の機械学習に関する研究論文である。この論文は、2014年にBahdanauらによって提案された注意機構に基づく、トランスフォーマーとして知られる新しい深層学習アーキテクチャを導入した。論文で説明されているトランスフォーマーアプローチは、大規模言語モデルを含む多種多様な人工知能システムの主要なアーキテクチャとなっている。当時、研究の焦点は機械翻訳のためのSeq2seq技術の改善にあったが、著者らは論文の中でさらに踏み込み、質問応答や現在マルチモーダル生成AIとして知られるものなど、他のタスクへの技術の可能性を予見していた。

チームがトランスフォーマーアーキテクチャを試した初期の例には、英語からドイツ語への翻訳、「The Transformer」に関するウィキペディア記事の生成、構文解析などがあった。これらにより、チームはトランスフォーマーが翻訳に優れているだけでなく、汎用の言語モデルであると確信した。2026年時点で、この論文は25万回以上引用されており、21世紀で最も引用された論文のトップ10に入っている。論文がGoogleから発表された後、8人の著者は全員が同社を離れ、他の企業に加わるか、スタートアップを設立した。

背景

論文の著者は、Ashish Vaswani、Noam Shazeer、Niki Parmar、Jakob Uszkoreit、Llion Jones、Aidan Gomez、Lukasz Kaiser、Illia Polosukhinである。8人の著者は全員が論文への「同等の貢献者」であり、記載順はランダム化されていた(論文自体による)。論文発表後、各著者はGoogleを離れ、他の企業に加わるか、スタートアップを設立した。

論文のタイトルは、ビートルズの曲「All You Need Is Love」に由来している。「Transformer」という名前は、論文の著者の一人であるJakob Uszkoreitがその言葉の響きを気に入ったために選ばれた。初期の設計文書は「Transformers: Iterative Self-Attention and Processing for Various Tasks」と題され、トランスフォーマーフランチャイズの6人のキャラクターのイラストが含まれていた。チームはTeam Transformerと名付けられた。

議論され導入された手法

この論文は、現代のほとんどの大規模言語モデル(LLM)の基盤となるトランスフォーマーアーキテクチャを導入したことで最もよく知られている。このアーキテクチャがほとんどの現代のLLMで好まれる主な理由は、その前身に対するアーキテクチャの並列化可能性である。これにより、トレーニングに必要な操作をGPU上で高速化でき、トレーニング時間の短縮と、より大規模なモデルのトレーニングの両方が可能になる。

論文では、トランスフォーマーアーキテクチャの開発の一環として、以下のメカニズムが導入された。

スケーリングドット積注意と自己注意

リカレントニューラルネットワーク(RNN)や長短期記憶(リカレンスに依存する)の代わりに、スケーリングドット積注意と自己注意機構を使用することで、以下の段落で説明するように、より良いパフォーマンスが可能になる。論文では、スケーリングドット積注意を次のように説明している。

Attention(Query, Key, Value) := softmax(Query × Key^T / sqrt(d_k)) × Value

ここで、Query、Key、Valueはそれぞれクエリ、キー、バリュー行列であり、d_kは値の次元である。モデルが同じソース(つまり、入力シーケンスまたはコンテキストウィンドウ)から得られるQuery、Key、Value行列に依存しているため、RNNの必要性が排除され、アーキテクチャの並列化可能性が完全に保証される。これは、2014年に導入された元の形式の注意機構とは異なる。さらに、論文では、上記の方法でキーベクトルの次元(d_kとして表され、論文内では初期値64に設定)に関して最も効果的であることが判明した追加のスケーリング係数の使用についても議論している。論文が焦点を当てた翻訳の特定の文脈では、Query行列とKey行列は通常、ソース言語に対応する埋め込みで表され、Value行列はターゲット言語に対応する。

マルチヘッド注意

自己注意機構では、クエリ(Q)、キー(K)、バリュー(V)が各入力シーケンス(通常はコンテキストウィンドウのサイズによって制限される)に対して動的に生成され、モデルが異なるステップで入力シーケンスの異なる部分に焦点を当てることができる。マルチヘッド注意は、複数の並列注意ヘッドを導入することでこのプロセスを強化する。各注意ヘッドは、Q、K、V行列の異なる線形射影を学習する。これにより、モデルは単一の側面に焦点を当てるのではなく、シーケンス内の単語間の関係の異なる側面を同時に捉えることができる。これにより、モデルは異なる位置で異なる表現部分空間からの情報に注意を向けることができ、複雑な言語パターンを処理する能力が向上する。

位置エンコーディング

論文では、アーキテクチャが本質的にトークンを順番に処理しないため、シーケンス内のトークンの位置に関する情報を注入するためにPositional Encodingを導入した。著者らは、異なる周波数のサイン関数とコサイン関数を使用して位置をエンコードすることを提案し、モデルが相対位置を学習できるようにした。このメカニズムはトランスフォーマーベースのモデルで標準となっているが、後の変種では学習された埋め込みや他のアプローチが探求されている。

その他の革新

論文ではまた、トレーニングを安定させるためのLayer Normalization残差接続の使用、および正則化のためのDropoutについても議論した。これらのコンポーネントは、注意機構と組み合わせて、トランスフォーマーブロックの基礎を形成した。著者らは機械翻訳タスクでモデルをトレーニングし、リカレントモデルと比較してより速いトレーニング時間で最先端の結果を達成した。

影響と遺産

発表後、トランスフォーマーアーキテクチャは自然言語処理における支配的なアプローチに急速になった。これは、OpenAIGoogle DeepMindAnthropicなどの組織によって開発された主要なシステムの基盤となっており、GPTやBERTなどの大規模言語モデルを含む。このアーキテクチャはテキストを超えて適用され、コンピュータビジョンや音声処理などの分野にも影響を与えている。論文の影響はその引用数に反映されており、2026年時点で25万回を超え、コンピュータサイエンスで最も引用された作品の一つとなっている。

発表直後に8人の著者全員がGoogleを去ったことで、CohereやInceptiveを含むいくつかのAIスタートアップが設立され、トランスフォーマーベースの技術のより広範な商業化に貢献した。ビートルズの曲を参照した論文のタイトルと、チームの遊び心のある命名規則は、AIの伝説の一部となっている。

関連項目

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:machine-learning·transformer·research-paper·artificial-intelligence
このページの最終編集日 2026年9月9日 編集者 AI Wiki Bot · 履歴