Um modelo de espaço de estados (SSM), no contexto da IA moderna, é uma classe de arquiteturas de redes neurais para modelagem de sequências que processa uma sequência usando um estado oculto atualizado a cada etapa, de acordo com equações emprestadas da teoria de controle e do processamento de sinais. Diferentemente do transformador, cujo mecanismo de autoatenção compara cada token com todos os outros e, portanto, escala quadraticamente com o comprimento da sequência, os modelos de espaço de estados atualizam um estado oculto de tamanho fixo em cada posição, dando-lhes uma escala linear ou quase linear com o comprimento do contexto.
O modelo neural de espaço de estados mais amplamente discutido é o Mamba, introduzido por Albert Gu e Tri Dao em dezembro de 2023, que adicionou um mecanismo seletivo, ou dependente da entrada, aos modelos lineares de espaço de estados anteriores, permitindo que o modelo escolhesse o que lembrar ou esquecer a cada etapa, abordando uma fraqueza chave dos SSMs anteriores em tarefas de linguagem.
História
Os modelos de espaço de estados têm uma longa história na engenharia de controle, onde descrevem como o estado interno de um sistema evolui ao longo do tempo e produz saídas observáveis. Adaptações neurais iniciais, como o modelo S4 publicado por pesquisadores de Stanford em 2021, mostraram que uma camada linear de espaço de estados cuidadosamente parametrizada poderia lidar com sequências muito longas de forma competitiva com redes neurais recorrentes e abordagens convolucionais em benchmarks que enfatizam dependências de longo alcance. Esses SSMs iniciais tiveram desempenho inferior aos transformers na modelagem de linguagem até que o mecanismo seletivo do Mamba em 2023 fechou grande parte dessa lacuna, provocando um interesse renovado nos SSMs como uma potencial alternativa aos transformers.
Arquitetura e mecanismo
Uma camada básica de SSM mantém um vetor de estado oculto atualizado por uma recorrência linear em cada posição da sequência, conceitualmente semelhante a um LSTM, mas com uma estrutura matemática que permite computação paralela eficiente durante o treinamento por meio de algoritmos de convolução ou varredura paralela. SSMs seletivos, como o Mamba, tornam os parâmetros da recorrência uma função da entrada atual, permitindo que o modelo decida dinamicamente quais informações propagar adiante, uma capacidade mais próxima da busca baseada em conteúdo da atenção do que de um filtro linear fixo. Arquiteturas híbridas que intercalam camadas de SSM com um número menor de camadas de atenção, buscando a eficiência de tempo linear dos SSMs juntamente com parte da expressividade da atenção, surgiram em vários laboratórios até 2024 e 2025.
Comparação com transformers
O principal apelo dos modelos de espaço de estados é a eficiência de inferência em sequências longas: como o estado oculto tem tamanho fixo, gerar cada novo token não exige reatender a todo o contexto crescente, ao contrário da inferência padrão de transformers, que recalcula a atenção sobre tokens anteriores, parcialmente mitigada na prática pelo cache de chave-valor. Isso torna os SSMs atraentes para janelas de contexto muito longas e implantação com recursos limitados. No entanto, até 2025, SSMs puros não haviam superado claramente transformers bem ajustados na maioria dos benchmarks de linguagem, e grande parte da atividade do campo se deslocou para designs híbridos, em vez de substituir completamente a atenção.
Recepção e perspectivas
O Mamba e seus sucessores foram recebidos como um dos desafios arquiteturais mais credíveis ao domínio dos transformers desde o artigo original de 2017, Attention Is All You Need, gerando interesse acadêmico significativo e várias implementações de código aberto. Pesquisadores, incluindo Yann LeCun e outros, notaram que o estado recorrente, seja em um LSTM ou em um SSM, poderia oferecer vantagens para tarefas que exigem raciocínio sobre entradas muito longas, como processar livros inteiros, bases de código ou sequências genômicas. Em 2025, os modelos de espaço de estados permaneciam uma arquitetura minoritária em grandes modelos de linguagem de produção em comparação com os transformers, mas continuaram a influenciar o design de modelos híbridos em vários grandes laboratórios.