状态空间模型(SSM),在现代人工智能的语境下,是一类用于序列建模的神经网络架构,它通过根据控制理论和信号处理中借鉴的方程,在每一步更新一个隐藏状态来处理序列。与Transformer不同,后者的自注意力机制会将每个词元与其他所有词元进行比较,因此计算量随序列长度呈二次方增长,而状态空间模型在每个位置更新一个固定大小的隐藏状态,使其与上下文长度呈线性或近似线性扩展。
最受广泛讨论的神经状态空间模型是Mamba,由Albert Gu和Tri Dao于2023年12月提出,它在早期的线性状态空间模型基础上增加了一种依赖于输入的选择性机制,使模型能够在每一步自主决定记住或遗忘什么,从而解决了先前SSM在语言任务上的一个关键弱点。
历史
状态空间模型在控制工程中有着悠久的历史,用于描述系统内部状态如何随时间演化并产生可观测输出。早期的神经适配,例如斯坦福大学研究人员于2021年发布的S4模型,表明经过精心参数化的线性状态空间层能够在强调长程依赖的基准测试中,与循环神经网络和卷积方法竞争性地处理非常长的序列。这些早期的SSM在语言建模方面不如Transformer,直到Mamba在2023年提出的选择性机制大幅缩小了这一差距,促使人们对SSM作为Transformer潜在替代品的兴趣重新燃起。
架构与机制
一个基本的SSM层在每个序列位置通过线性递推维护一个隐藏状态向量,概念上类似于LSTM,但其数学结构允许在训练期间通过卷积或并行扫描算法进行高效的并行计算。像Mamba这样的选择性SSM使递推的参数成为当前输入的函数,让模型能够动态决定哪些信息向前传播,这种能力比固定线性滤波器更接近注意力机制中基于内容的查找。到2024年和2025年,多个实验室出现了将SSM层与较少数量的注意力层交错排列的混合架构,旨在兼顾SSM的线性时间效率与注意力机制的部分表达能力。
与Transformer的比较
状态空间模型的主要吸引力在于长序列上的推理效率:由于隐藏状态大小固定,生成每个新词元时无需重新关注整个不断增长的上下文,这与标准Transformer的推理不同,后者需要重新计算对先前词元的注意力,尽管在实践中通过键值缓存部分缓解了这一问题。这使得SSM在非常长的上下文窗口和资源受限的部署场景中具有吸引力。然而,到2025年,纯SSM在大多数语言基准测试中尚未明显超越经过良好调优的Transformer,该领域的大部分活动转向了混合设计,而非完全取代注意力机制。
反响与展望
Mamba及其后继者被视为自2017年Attention Is All You Need论文以来,对Transformer主导地位最具可信度的架构挑战之一,引发了显著的学术兴趣和多个开源实现。包括Yann LeCun在内的研究人员指出,无论是LSTM还是SSM中的循环式状态,都可能为需要处理极长输入的任务(如处理整本书籍、代码库或基因组序列)带来优势。截至2025年,状态空间模型在生产环境中的大型语言模型中仍属于少数派架构,与Transformer相比,但它们继续影响着多个主要实验室的混合模型设计。