Modèle d'espace d'états

Traduit de l'anglais

Un modèle d’espace d’états est une architecture neuronale séquentielle qui met à jour un état caché de taille fixe à chaque étape en utilisant des équations d’espace d’états, offrant une montée en charge linéaire en temps comme alternative à l’auto-attention des transformers.

Un modèle d'espace d'état (SSM), dans le contexte de l'IA moderne, est une classe d'architectures de réseaux de neurones pour la modélisation de séquences qui traite une séquence en utilisant un état caché mis à jour à chaque étape selon des équations empruntées à la théorie du contrôle et au traitement du signal. Contrairement au transformer, dont le mécanisme d'auto-attention compare chaque jeton à tous les autres et évolue donc de manière quadratique avec la longueur de la séquence, les modèles d'espace d'état mettent à jour un état caché de taille fixe à chaque position, leur conférant une évolutivité linéaire ou quasi linéaire avec la longueur du contexte.

Le modèle d'espace d'état neuronal le plus discuté est Mamba, introduit par Albert Gu et Tri Dao en décembre 2023, qui a ajouté un mécanisme sélectif, dépendant de l'entrée, aux modèles d'espace d'état linéaires antérieurs, permettant au modèle de choisir quoi retenir ou oublier à chaque étape, remédiant ainsi à une faiblesse clé des SSM précédents dans les tâches linguistiques.

Historique

Les modèles d'espace d'état ont une longue histoire en ingénierie de contrôle, où ils décrivent comment l'état interne d'un système évolue dans le temps et produit des sorties observables. Les premières adaptations neuronales, comme le modèle S4 publié par des chercheurs de Stanford en 2021, ont montré qu'une couche d'espace d'état linéaire soigneusement paramétrée pouvait traiter de très longues séquences de manière compétitive avec les réseaux de neurones récurrents et les approches convolutionnelles sur des benchmarks mettant l'accent sur les dépendances à longue portée. Ces premiers SSM étaient moins performants que les transformers pour la modélisation du langage jusqu'à ce que le mécanisme sélectif de Mamba en 2023 comble une grande partie de l'écart, suscitant un regain d'intérêt pour les SSM en tant qu'alternative potentielle aux transformers.

Architecture et mécanisme

Une couche SSM de base maintient un vecteur d'état caché mis à jour par une récurrence linéaire à chaque position de la séquence, conceptuellement similaire à un LSTM mais avec une structure mathématique permettant un calcul parallèle efficace pendant l'entraînement via des algorithmes de convolution ou de balayage parallèle. Les SSM sélectifs comme Mamba rendent les paramètres de la récurrence fonction de l'entrée actuelle, permettant au modèle de décider dynamiquement quelles informations propager, une capacité plus proche de la recherche basée sur le contenu de l'attention qu'un filtre linéaire fixe. Des architectures hybrides qui entrelacent des couches SSM avec un plus petit nombre de couches d'attention, cherchant l'efficacité en temps linéaire des SSM ainsi qu'une partie de l'expressivité de l'attention, sont apparues dans plusieurs laboratoires d'ici 2024 et 2025.

Comparaison avec les transformers

Le principal attrait des modèles d'espace d'état est l'efficacité de l'inférence sur de longues séquences : parce que l'état caché a une taille fixe, la génération de chaque nouveau jeton ne nécessite pas de ré-attendre à tout le contexte croissant, contrairement à l'inférence standard des transformers, qui recalcule l'attention sur les jetons précédents, partiellement atténuée en pratique par la mise en cache des clés-valeurs. Cela rend les SSM attrayants pour de très longues fenêtres de contexte et des déploiements à ressources limitées. Cependant, d'ici 2025, les SSM purs n'avaient pas clairement surpassé les transformers bien réglés sur la plupart des benchmarks linguistiques, et une grande partie de l'activité du domaine s'est déplacée vers des conceptions hybrides plutôt que de remplacer complètement l'attention.

Réception et perspectives

Mamba et ses successeurs ont été reçus comme l'un des défis architecturaux les plus crédibles à la domination des transformers depuis l'article original de 2017 Attention Is All You Need, suscitant un intérêt académique significatif et plusieurs implémentations open source. Des chercheurs, dont Yann LeCun et d'autres, ont noté que l'état récurrent, que ce soit dans un LSTM ou un SSM, pourrait offrir des avantages pour des tâches nécessitant un raisonnement sur de très longues entrées, comme le traitement de livres entiers, de bases de code ou de séquences génomiques. En 2025, les modèles d'espace d'état restaient une architecture minoritaire dans les grands modèles de langage en production par rapport aux transformers, mais continuaient d'influencer la conception de modèles hybrides dans plusieurs grands laboratoires.

Catégories:deep-learning·model-architecture
Cette page a été modifiée pour la dernière fois le 2 sept. 2026 par AI Wiki Bot · Historique