Linformerは、標準的な自己注意機構の二次的な計算コストとメモリコストに対処するために設計されたTransformerアーキテクチャである。従来のTransformerでは、自己注意層がシーケンス内のすべてのトークン対間の類似度スコアを計算し、長さnのシーケンスに対してO(n²)の複雑性をもたらす。このスケーリングは、文書処理、ゲノムデータ、または高解像度画像解析に見られるような長いシーケンスにとって prohibitive となる。Linformerは、キー行列とバリュー行列を低次元空間に射影することで線形複雑性の自己注意機構を導入し、コストをO(n)に削減しつつ、下流タスクで競争力のある性能を維持する。
このアーキテクチャは、Facebook AI Research(現在はMeta AIの一部)の研究者であるSinong Wang、Belinda Z. Li、Madian Khabsa、Han Fang、Hao Maによる2020年の論文で紹介された。「Linformer: Self-Attention with Linear Complexity」と題されたこの論文は、注意行列がしばしば低ランクであり、情報の大幅な損失なしにはるかに小さな行列で近似できることを実証した。この洞察が、この手法の理論的基盤を形成している。
メカニズムと低ランク射影
Linformerの中核的な革新は、キー行列とバリュー行列の扱いにある。標準的なマルチヘッド注意では、注意スコアはクエリとキーの積のソフトマックスとして計算され、n×n行列が必要となる。Linformerは代わりに、学習された線形射影を用いて、キーとバリューをシーケンス長nよりもはるかに小さい固定次元kに射影する。この射影により、注意行列がn×nからn×kに縮小され、シーケンス長に対して線形複雑性が得られる。
kの選択は、効率と精度のバランスを取るハイパーパラメータである。著者らは、多くの実用的なタスクにおいて、数千トークンのシーケンスでもkの値が128または256程度で十分であることを示した。射影行列は一部の変種では注意ヘッド間で共有され、パラメータ数とメモリ使用量をさらに削減する。
他の効率的Transformerとの比較
Linformerは、2020年から2021年頃に開発されたより広範な効率的Transformerアーキテクチャのファミリーの一部である。これは、Reformer(局所性鋭敏型ハッシュを使用)やLongformer(スライディングウィンドウ注意を使用)としばしば比較される。ハッシュによる注意の近似を行うReformerとは異なり、Linformerは固定の低ランク射影を使用し、これはより単純でハードウェアに優しい。注意を局所ウィンドウに制限するLongformerとは異なり、Linformerは圧縮された形ではあるが、大域的な注意情報を保持する。
IMDb感情分析やテキスト分類などのベンチマークタスクでの実証評価では、Linformerは元のTransformerと同等の精度を達成しつつ、長いシーケンスではメモリと時間を大幅に削減することが示された。例えば、長さ4096のシーケンスでは、Linformerは標準Transformerと比較してメモリ使用量を最大90%削減できる。
応用と影響
Linformerの主な動機は、文書要約、長いパッセージにわたる質問応答、医療記録や法務記録の処理などのタスクに不可欠な、より長いコンテキストをTransformerが扱えるようにすることであった。その線形スケーリングは、メモリと計算が限られているモバイル端末やエッジハードウェアなどのリソース制約のあるデバイスへの展開にも魅力的である。
注意における低ランク近似のアイデアは、Performer(ランダム特徴マップを使用)やフラッシュアテンション(I/O最適化に焦点を当てる)を含むその後の研究に影響を与えた。Linformer自体は2025年時点で大規模な本番モデルで広く使用されているわけではないが、その原理はハイブリッドアーキテクチャに組み込まれ、効率的な注意機構に関する研究に情報を提供してきた。
制限と批判
Linformerの制限の1つは、低ランクの仮定がすべての種類のデータに当てはまるとは限らないことである。注意パターンが高度にスパースであるか複雑な構造を持つタスクでは、固定射影が重要な情報を失う可能性がある。さらに、射影行列はトレーニング中に学習されるため、モデルは新しいタスクに適応するためにスクラッチからトレーニングするか、ファインチューニングする必要があり、変更なしに事前学習済みTransformerに直接適用することはできない。
もう1つの批判は、線形複雑性が固定のボトルネック次元kを犠牲にして達成されており、非常に長いシーケンスではkを増やす必要がある可能性があり、効率の利点が減少する可能性があることである。一部の研究では、特定の自然言語推論ベンチマークなど、細かいトークンレベルの推論を必要とするタスクではLinformerの性能が低下することも指摘されている。
遺産と将来の方向性
Linformerの論文は、効率的な注意のアイデアを普及させた初期の研究の1つであり、Transformerをスケーラブルにする研究の波に貢献した。低ランク構造へのその強調は、適応的ランク選択や階層的射影など、さまざまな方法で拡張されてきた。2025年時点で、OpenAIやGoogle DeepMindなどの主要な大規模言語モデルは、その中核アーキテクチャに依然として標準的な二次注意を使用しているが、Linformerのような効率的な変種は、専門的な応用や長いコンテキスト処理の研究にとって引き続き関連性がある。
このアーキテクチャはまた、深層学習におけるモデルの表現力と計算効率のトレードオフを理解するための有用な教育的例でもある。その単純さと明確な理論的動機は、ニューラルネットワーク設計や人工知能システムに関する上級コースで一般的なトピックとなっている。