状態空間モデル(SSM)は、現代のAIの文脈では、シーケンス処理用のニューラルネットワークアーキテクチャの一種であり、制御理論や信号処理から借用した方程式に従って、各ステップで更新される隠れ状態を使ってシーケンスを処理する。トランスフォーマーの自己注意機構がすべてのトークンを他のすべてのトークンと比較し、シーケンス長に対して二次関数的にスケールするのとは異なり、状態空間モデルは各位置で固定サイズの隠れ状態を更新するため、コンテキスト長に対して線形またはほぼ線形のスケーリングを実現する。
最も広く議論されているニューラル状態空間モデルは、2023年12月にAlbert GuとTri Daoによって導入されたMambaで、これは以前の線形状態空間モデルに入力依存、すなわち選択的な機構を追加し、モデルが各ステップで何を記憶し、何を忘れるかを選択できるようにし、言語タスクにおける従来のSSMの重要な弱点に対処した。
歴史
状態空間モデルは制御工学で長い歴史を持ち、システムの内部状態が時間とともにどのように進化し、観測可能な出力をどのように生むかを記述する。2021年にStanford Universityの研究者らが公開したS4モデルなどの初期のニューラル適応では、慎重にパラメーター化された線形状態空間層が、長距離依存関係を重視するベンチマークで再帰的ニューラルネットや畳み込みアプローチと競合し、非常に長いシーケンスを処理できることが示された。これらの初期SSMは、言語モデリングでトランスフォーマーに劣っていましたが、Mambaの2023年の選択的機構ギャップの多くを埋め、SSMへの関心が再燃し、トランスフォーマーの代替となる可能性が注目された。
構造と機構
基本SSM層は、各シーケンス位置で線形再帰によって更新される隠れ状態ベクトルを保持し、概念的にはLSTMに似ているものの、トレーニング中の畳み込みや並列スキャンアルゴリズムによる効率的な並列計算を可能にする数学的構造を持つ。Mambaなどの選択的SSMは、再帰のパラメーターを現在の入力の関数にすることで、モデルがどの情報を動的に前方に伝播させるかを決定でき、固定線形フィルタよりも注意の内容ベースの検索に近い能力を持つ。SSM層と少数の注意層を交互に配置し、線形時間の効率と注意の表現力を併せ持つハイブリッドアーキテクチャが、2024年から2025年には複数の研究所から登場した。
トランスフォーマーとの比較
3状態空間モデルの最大の利点は、長いシーケンスに対する推論効率だ。というのは、隠れ状態のサイズが固定されているため、各新しいトークンの生成に際して、標準的なトランスフォーマーの推論と違い、キー値キャッシュで部分的に緩和されるものの、成長する全コンテキストに対する再注意が必要ない。これにより、SSMは非常に長いコンテキストウィンドウやリソース制約のある展開に魅力的な選択肢となる。しかし、2025年時点で、純粋なSSMは、ほとんどの言語ベンチマークでよく調整されたトランスフォーマーを明瞭に超えておらず、分野の活動の多くは、注意を完全に置き換えるのではなく、ハイブリッド設計に移行した。
受け入れと展望
Mambaとその後継は、2017年の元のAttention Is All You Need論文以来、トランスフォーマーの支配的アーキテクチャへのより信頼できる挑戦の一つとして受け止められ、重要な学術的関心と複数のオープンソース実装を生み出した。Yann LeCun ·イヴ・ルクンなど研究者らは、LSTMやSSMのような再帰型の状態が、本全体やコードベース、ゲノム配列の処理など、非常に長い入力にわたる推論を必要とするタスクで利点をもたらす可能性があると指摘している。2025年時点で、状態空間モデルは、プロダクションの大規模言語モデルではトランスフォーマーに比べてマイノリティなアーキテクチャであり続けているが、多くの主要研究室でのハイブリッドモデル設計に影響を与え続けている。