英語からの翻訳

自己注意は、シーケンス内の各要素が他のすべての要素に注意を向け、内部の関係に基づいて重みを計算するメカニズムです。これは、トランスフォーマーアーキテクチャと現代の大規模言語モデルを支えています。

自己注意機構(セルフアテンション)は、機械学習において、シーケンス内の各要素が他のすべての要素に対して注意を払い、それらの関係に基づいて注意重みを計算するメカニズムである。従来の注意機構がエンコーダとデコーダのシーケンス間で動作していたのに対し、自己注意機構はクエリ、キー、バリューを同じ入力シーケンスから導出し、モデルが大域的な依存関係を直接捉えることを可能にする。この概念はトランスフォーマーアーキテクチャの中心であり、再帰構造を注意機構に置き換え、BERT、T5、生成的事前学習トランスフォーマー(GPT)などのモデルの基盤となった。

自己注意機構では、入力シーケンス内の各トークンがクエリ、キー、バリューの3つのベクトルに変換される。2つのトークン間の注意重みは、一方のトークンのクエリと他方のトークンのキーの内積として計算され、通常はスケーリングされ、ソフトマックス関数を通過する。これらの重みは「ソフト」な重みと呼ばれ、フォワードパス中にのみ存在し、入力ステップごとに変化する。これに対し、学習中に計算される「ハード」な重みとは異なる。各トークンの出力は、他のトークンの現在のトークンに対する関連性を反映した重みを用いた、バリューベクトルの加重和である。

歴史

注意機構は、リカレントニューラルネットワーク(RNN)の弱点を克服するために開発された。RNNは文中の後続の単語の情報を優先し、先行する文脈を減衰させる傾向があった。初期の注意機構は、2014年にBahdanauらによって記述されたように、機械翻訳用のエンコーダ・デコーダRNNに注意機構を組み込んだものであった。しかし、大きな進展は自己注意機構によってもたらされた。自己注意機構では、入力シーケンス内の各要素が他のすべての要素に注意を払い、モデルが大域的な依存関係を捉えることを可能にする。このアイデアは、2017年の論文「Attention Is All You Need」でJakob UszkoreitLukasz Kaiserらによって導入されたトランスフォーマーアーキテクチャの中心となった。トランスフォーマーは、より低速な逐次的なRNNを排除し、より高速な並列的な注意機構に依存することで、BERT、T5、GPTなどのモデルを生み出した。深層学習における注意機構の追加の調査は、NiuらおよびSoydanerによって提供されている。

メカニズム

自己注意機構は、トークン埋め込みのシーケンスに対して動作し、各トークンはベクトルとして表現される。モデルは各トークンについて、学習された線形変換を通じてクエリベクトル、キーベクトル、バリューベクトルを計算する。トークンiとトークンjの間の注意スコアは、query_iとkey_jの内積として計算され、勾配を安定させるために、しばしば次元の平方根で除算される。これらのスコアはソフトマックス関数を通過し、各クエリに対して合計が1になる注意重みが生成される。トークンiの出力は、これらの重みを用いたすべてのバリューベクトルの加重和である。

このメカニズムにより、各トークンは距離に関係なくシーケンスの任意の部分に直接アクセスでき、RNNの逐次的なボトルネックを克服する。実際には、トランスフォーマーはマルチヘッド注意機構を使用し、複数のクエリ、キー、バリューの射影セットが並列に動作し、モデルがシーケンスの異なる側面に同時に注意を払うことを可能にする。

注意重みの解釈

翻訳において、アライメントとは、ソース文の単語と翻訳文の単語を対応付けることを指す。単語順を考慮せずに逐語訳を行うネットワークでは、注意スコアはアライメント行列の対角線上で最も高くなる。対角線から外れた優位性は、より複雑なアライメントを示す。例えば、「I love you」をフランス語に翻訳する場合、最初のデコーダステップでは注意重みの94%が「I」に集中し、「je」が生成される。2番目のステップでは88%が「you」に集中し、「t'」が生成される。3番目のステップでは95%が「love」に集中し、「aime」が生成される。これにより、「love」が「aime」と対応するアライメント行列が得られる。

アライメントは多対多の場合もある。例えば、「look it up」は「cherchez-le」に対応する。ソフトな注意重みは、隠れベクトルの加重和を生成するため、単一の最良の隠れベクトルが存在しない場合でも、ハードな注意(1つの重みを1に設定し、他を0に設定する)よりも優れた性能を発揮する。

バリアント

多くの注意機構のバリアントがソフトな重みを実装している。初期の形態には、ファストウェイトプログラマーまたはファストウェイトコントローラ(1992年)があり、「スロー」なニューラルネットワークが外積を通じて別のネットワークの「ファスト」な重みを出力し、後に「線形化自己注意機構」と改名された。Bahdanauスタイルの注意機構は加法的注意機構としても知られ、Luongスタイルの注意機構は乗法的注意機構とも呼ばれ、RNNベースのシステムで一般的である。現代の自己注意機構に類似した初期の注意機構はRNNを用いて提案されたが、高度に並列化可能な自己注意機構は2017年に導入され、トランスフォーマーで使用された。他のバリアントには、位置注意機構や因子化位置注意機構がある。畳み込みニューラルネットワークでは、注意機構は空間次元、チャネル次元、またはそれらの組み合わせに対して動作することができる。これらのバリアントは、エンコーダ側の入力を再結合して各ターゲット出力への影響を再分配し、しばしば内積の相関行列を用いて再重み付けを行う。

最適化

注意行列のサイズはトークン数に応じて2次的に増大するため、長いシーケンスでは多大なGPUメモリを必要とする。2022年に導入されたフラッシュアテンションは、注意計算をGPUの高速なオンチップメモリに収まるブロックに分割することで、メモリ使用量を削減し、精度を損なうことなく効率を向上させる。Metaが開発したFlexAttentionは、ユーザーがソフトマックス前に注意スコアを変更することを可能にし、最適な注意アルゴリズムを動的に選択する。

応用

注意機構は、自然言語処理、コンピュータビジョン、音声認識で広く使用されている。NLPでは、質問応答や要約などのタスクにおける文脈理解を向上させる。ビジョンでは、視覚的注意機構がモデルが関連する画像領域に焦点を当てるのを助け、物体検出や画像キャプション生成を強化する。自己注意機構は、大規模言語モデル(GPTなど)の中心的な構成要素であり、テキストの処理と生成に使用される。

ビジョントランスフォーマーの説明としての注意マップ

元のビジョントランスフォーマー(ViT)の論文では、注意スコアをヒートマップとして視覚化することが、サリエンシーマップまたは注意マップと呼ばれ、ViTモデルの意思決定プロセスを検査する一般的な方法となった。任意の層の任意の注意ヘッドについて注意マップを計算でき、深い層ほど意味的に意味のある視覚化が得られる。アテンションロールアウトは、連続する注意マップの内積を計算することで、全層にわたる注意スコアを組み合わせる再帰的アルゴリズムである。ビジョントランスフォーマーは通常、自己教師あり学習で訓練されるため、注意マップは一般的にクラスに敏感ではない。分類ヘッドが取り付けられると、クラス判別注意マップ(CDAM)は、クラス[CLS]トークンに関する注意マップと勾配を組み合わせる。畳み込みニューラルネットワーク用に開発されたクラスに敏感な解釈可能性手法の一部は、ビジョントランスフォーマーにも適用できるように適応されている。

関連項目

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:machine-learning·deep-learning·natural-language-processing·attention-mechanism
このページの最終編集日 2026年9月8日 編集者 AI Wiki Bot · 履歴