Un modelo de espacio de estados (SSM, por sus siglas en inglés), en el contexto de la inteligencia artificial moderna, es una clase de arquitecturas de redes neuronales para modelado de secuencias que procesa una secuencia mediante un estado oculto actualizado en cada paso según ecuaciones tomadas de la teoría de control y el procesamiento de señales. A diferencia del transformador, cuyo mecanismo de autoatención compara cada token con todos los demás y, por lo tanto, escala de manera cuadrática con la longitud de la secuencia, los modelos de espacio de estados actualizan un estado oculto de tamaño fijo en cada posición, lo que les confiere un escalado lineal o casi lineal con la longitud del contexto.
El modelo neuronal de espacio de estados más discutido es Mamba, presentado por Albert Gu y Tri Dao en diciembre de 2023, que añadió un mecanismo dependiente de la entrada, o selectivo, a modelos lineales anteriores de espacio de estados, permitiendo que el modelo decidiera qué recordar u olvidar en cada paso, abordando así una debilidad clave de los SSM previos en tareas de lenguaje.
Historia
Los modelos de espacio de estados tienen una larga trayectoria en la ingeniería de control, donde describen cómo el estado interno de un sistema evoluciona con el tiempo y produce salidas observables. Las primeras adaptaciones neuronales, como el modelo S4 publicado por investigadores de Stanford en 2021, demostraron que una capa lineal de espacio de estados, parametrizada con cuidado, podía manejar secuencias largas de forma competitiva con los redes neuronales recurrentes y con enfoques convolucionales en pruebas de referencia que enfatizaban dependencias de largo alcance. Estos primeros SSM tenían un rendimiento inferior al de los transformadores en el modelado del lenguaje hasta que el mecanismo selectivo de Mamba en 2023 acortó gran parte de la brecha, generando un renovado interés en los SSM como una alternativa potencial a los transformadores.
Arquitectura y mecanismo
Una capa básica de SSM mantiene un vector de estado oculto que se actualiza mediante una recurrencia lineal en cada posición de la secuencia, conceptualmente similar a un LSTM y conceptualmente similar a un LSTM, pero con una estructura matemática que permite un procesamiento en paralelo eficiente durante el entrenamiento mediante convoluciones o unos algoritmos de escaneo. Los SSM con selectivos, como Mamba, hacen que los parámetros de la recurrencia sean una función de la entrada actual, lo que habilita al modelo a decidir dinámicamente qué información propagar hacia adelante, una capacidad más cercana a la de la búsqueda basada en contenido de la atención que a la de un filtro lineal fijo. Hacia 2024 y 2025, se presentaron arquitecturas híbridas de varios laboratorios que combinan capas de SSM con un número menor de capas de atención, buscando eficiencia de tiempo lineal propia de los modelos SSM en conjunto con parte de la expresividad de la atención.
Comparación con los transformadores
El atractivo principal de los modelos de espacio de estados reside en la eficiencia de inferencia sobre secuencias largas: dado que el estado oculto tiene un tamaño fijo, generar cada nuevo token no requiere re-atender a todo el contexto en crecimiento, a diferencia del método estándar de los transformadores, que recalculan la atención sobre tokens previos, aunque en la práctica esto se mitiga parcialmente con el almacenamiento en caché de claves y valores. Esto también hace que los modelos SSM sean atractivos para contextos muy largos y despliegues con recursos limitados. Sin embargo, para 2025, los modelos SSM puros no habían superado de forma clara a los transformadores bien afinados en la mayoría de los modelos de referencia, y gran parte de la actividad en el campo se dirigió hacia diseños híbridos, en lugar de reemplazar completamente la atención.
Recepción y perspectivas
Mamba y sus sucesores fueron recibidos como uno de los desafíos arquitectónicos más creíbles al de los transformadores desde el artículo original de 2017, Atención es lo que necesitas, generando un interés académico significativo y varias implementaciones de código abierto. Investigadores como Yann LeCun y otros han destacado que el estado recurrente, ya sea en un LSTM o en un SSM, podría ofrecer ventajas para tareas que requieran razonar en entradas más extensas, como el procesamiento de libros completos, bases de código o secuencias genómicas. En 2025, los modelos de espacio de estados seguían siendo una arquitectura minoritaria en comparación con los transformadores en los modelos de lengua a gran escala en producción, pero continuaron influyendo en el diseño de modelos híbridos en varios de los laborios importantes.