Mémoire à long terme et à court terme (LSTM)

Traduit de l'anglais

La mémoire à long terme (LSTM) est une architecture de réseau neuronal récurrent conçue pour gérer les dépendances à long terme dans les données séquentielles en utilisant des cellules à portes qui atténuent le problème du gradient qui disparaît.

La mémoire à long terme et à court terme (LSTM) est un type de réseau de neurones récurrents (RNN) introduit pour résoudre le problème du gradient vanishing qui limite les RNN traditionnels. Contrairement aux RNN standard, les unités LSTM intègrent un état de cellule et trois mécanismes de porte - une porte d'entrée, une porte de sortie et une porte d'oubli - qui régulent le flux d'informations sur des intervalles de temps arbitraires. Cette conception permet aux réseaux LSTM de maintenir des dépendances sur des milliers de pas de temps, ce qui les rend efficaces pour des tâches d'apprentissage séquentiel telles que la reconnaissance vocale, la traduction automatique et la prévision de séries temporelles. Le nom reflète une analogie avec les concepts de mémoire à long terme et à court terme de la psychologie cognitive, étudiés depuis le début du XXe siècle.

L'insensibilité relative de LSTM à la longueur des intervalles lui confère un avantage sur les autres RNN, les modèles de Markov cachés et les méthodes alternatives d'apprentissage séquentiel. L'architecture a été proposée par Sepp Hochreiter et Jürgen Schmidhuber en 1997, et elle est depuis devenue un composant fondamental de l'apprentissage profond, en particulier avant l'essor des modèles basés sur les transformeurs.

Motivation

Les RNN classiques peuvent théoriquement capturer des dépendances arbitraires à long terme, mais en pratique, ils souffrent de gradients vanishing pendant la rétropropagation. Lors de l'entraînement avec la rétropropagation, les gradients qui se propagent sur de nombreux pas de temps peuvent diminuer de manière exponentielle, ce qui empêche le réseau d'apprendre efficacement. Les unités LSTM atténuent ce problème en permettant aux gradients de circuler avec peu d'atténuation à travers l'état de cellule, bien qu'ils puissent encore rencontrer des gradients explosifs.

L'intuition derrière LSTM est de créer un module qui apprend quand se souvenir et quand oublier des informations. Le réseau apprend quelles informations sont susceptibles d'être nécessaires plus tard dans la séquence et quand elles deviennent non pertinentes. Par exemple, dans le traitement du langage naturel, un LSTM traitant la phrase « Dave, à la suite de ses affirmations controversées, est maintenant un paria » peut se souvenir du genre grammatical et du nombre du sujet « Dave » pour interpréter correctement le pronom « ses », puis abandonner cette information après le verbe « est ».

Architecture

Une unité LSTM se compose d'une cellule et de trois portes. La cellule se souvient des valeurs sur des intervalles de temps arbitraires. La porte d'oubli décide quelles informations abandonner de l'état précédent en mappant l'état précédent et l'entrée actuelle à une valeur entre 0 et 1, où 1 signifie conserver et 0 signifie abandonner. La porte d'entrée détermine quelles nouvelles informations stocker dans l'état de cellule, en utilisant un mécanisme similaire. La porte de sortie contrôle quelles parties de l'état de cellule actuel produire en sortie, en utilisant également une valeur entre 0 et 1, en tenant compte des états précédent et actuel.

Mathématiquement, la passe avant d'une cellule LSTM avec une porte d'oubli peut être décrite en notation vectorielle. Soit \(x_t\) l'entrée au pas de temps \(t\), \(h_{t-1}\) l'état caché précédent, et \(c_{t-1}\) l'état de cellule précédent. Les portes sont calculées comme suit :

  • Porte d'oubli : \(f_t = \sigma_g(W_f x_t + U_f h_{t-1} + b_f)\)
  • Porte d'entrée : \(i_t = \sigma_g(W_i x_t + U_i h_{t-1} + b_i)\)
  • Porte de sortie : \(o_t = \sigma_g(W_o x_t + U_o h_{t-1} + b_o)\)
  • État de cellule candidat : \(\tilde{c}_t = \tanh(W_c x_t + U_c h_{t-1} + b_c)\)
  • Mise à jour de l'état de cellule : \(c_t = f_t \odot c_{t-1} + i_t \odot \tilde{c}_t\)
  • État caché : \(h_t = o_t \odot \tanh(c_t)\)

Ici, \(\sigma_g\) est la fonction d'activation sigmoïde, \(\tanh\) est la tangente hyperbolique, et \(\odot\) désigne la multiplication élément par élément. Les matrices de poids \(W_q\) et \(U_q\) (où \(q\) peut être \(i\), \(o\), \(f\), ou \(c\)) contiennent respectivement les connexions d'entrée et récurrentes.

Variantes et extensions

Plusieurs variantes de LSTM ont été développées pour améliorer les performances ou s'adapter à des tâches spécifiques. La variante la plus courante est le LSTM avec porte d'oubli, qui est maintenant standard. Parmi les autres variantes notables, on trouve :

  • Unité récurrente à portes (GRU) : une architecture simplifiée qui combine les portes d'entrée et d'oubli en une seule porte de mise à jour, réduisant ainsi la complexité computationnelle.
  • LSTM bidirectionnel : traite les séquences dans les directions avant et arrière, capturant le contexte passé et futur.
  • Connexions de loupiote : permettent aux portes d'accéder directement à l'état de cellule, améliorant la synchronisation et la précision.

Ces variantes ont été largement adoptées dans les applications d'apprentissage profond, notamment dans les modèles de langage de grande taille et les systèmes basés sur les réseaux de neurones.

Applications

Les réseaux LSTM ont été appliqués à une large gamme de tâches, notamment la classification, le traitement des données, l'analyse de séries temporelles, la reconnaissance vocale, la traduction automatique, la détection d'activité vocale, les jeux vidéo, les soins de santé et la prévision énergétique. Au début des années 2010, les modèles basés sur LSTM ont obtenu des résultats de pointe en reconnaissance vocale et en traduction automatique, ouvrant la voie aux systèmes modernes d'intelligence artificielle.

Avec l'avènement de l'architecture de transformeur en 2017, la domination de LSTM dans le traitement séquentiel a diminué, en particulier dans les modèles génératifs à grande échelle. Cependant, LSTM reste pertinent pour de nombreuses applications, notamment celles avec des ressources computationnelles limitées ou où le traitement séquentiel est inhérent, comme dans les systèmes embarqués et le contrôle en temps réel.

Limitations

Malgré ses avantages, LSTM présente des limitations. Il est computationnellement plus coûteux que les RNN simples en raison des portes supplémentaires. Il peut encore souffrir de gradients explosifs, bien que des techniques comme le clipping de gradient aident. De plus, LSTM traite les séquences de manière séquentielle, ce qui rend difficile la parallélisation sur les pas de temps, une raison clé pour laquelle les transformeurs sont devenus préférés pour les modèles à grande échelle. Néanmoins, la capacité de LSTM à modéliser des dépendances à long terme avec une insensibilité relative à la longueur des intervalles en fait toujours un outil précieux dans la boîte à outils de l'apprentissage automatique.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:recurrent-neural-networks·deep-learning·sequence-modeling
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique