Traduit de l'anglais

Une architecture de réseau neuronal encodeur-décodeur introduite en 2014 pour mapper des séquences d'entrée vers des séquences de sortie de longueurs différentes, fondamentale pour la traduction automatique neuronale et précurseur des transformeurs.

Sequence to sequence (seq2seq) est une architecture de réseau de neurones, introduite en 2014, qui fait correspondre une séquence d'entrée à une séquence de sortie de longueur potentiellement différente en utilisant une paire de réseaux couplés : un encodeur qui compresse l'entrée en une représentation de longueur fixe, et un décodeur qui génère la séquence de sortie à partir de cette représentation, un élément à la fois. Seq2seq a établi le schéma encodeur-décodeur qui est devenu fondamental pour la traduction automatique neuronale et a directement motivé le développement du mécanisme d'attention et plus tard de l'architecture transformeur.

Architecture

Dans la formulation originale, l'encodeur et le décodeur sont tous deux implémentés comme des réseaux de neurones récurrents, utilisant le plus souvent des unités LSTM pour atténuer les problèmes de gradient qui s'estompent des conceptions récurrentes plus simples. L'encodeur traite une séquence d'entrée, telle qu'une phrase dans une langue source, un jeton à la fois, en mettant à jour un état caché interne, et transmet son état caché final au décodeur comme résumé de l'intégralité de l'entrée. Le décodeur génère ensuite les jetons de sortie un à la fois de manière autorégressive, en utilisant sa propre sortie précédente comme entrée pour prédire le jeton suivant, jusqu'à ce qu'il produise un marqueur de fin de séquence désigné.

Origines

L'architecture a été introduite dans l'article de 2014 « Sequence to Sequence Learning with Neural Networks » par Ilya Sutskever avec Oriol Vinyals et Quoc Le chez Google, démontrant des résultats solides en traduction automatique anglais-français en utilisant un encodeur-décodeur LSTM multicouche. Une formulation étroitement liée a été publiée à peu près au même moment par Kyunghyun Cho et ses collègues, qui ont également introduit l'unité récurrente à portes comme alternative simplifiée au LSTM dans le même cadre encodeur-décodeur.

Intégration du mécanisme d'attention

Une limitation clé de la conception seq2seq originale était sa dépendance à un vecteur unique de longueur fixe pour résumer la séquence d'entrée entière, ce qui dégradait les performances sur les phrases plus longues, car l'information était compressée et perdue. Ce goulot d'étranglement a motivé Dzmitry Bahdanau et ses collègues à introduire le mécanisme d'attention en 2015, permettant au décodeur de revenir sur tous les états cachés de l'encodeur et de pondérer dynamiquement les parties de l'entrée les plus pertinentes lors de la génération de chaque jeton de sortie, améliorant considérablement la qualité de la traduction sur les longues séquences et établissant l'attention comme composant standard des modèles de séquences.

Héritage

Seq2seq avec attention est devenu l'architecture dominante pour les systèmes de traduction automatique neuronale, y compris le passage de Google Traduction à un système entièrement neuronal en 2016, avant que les composants récurrents ne soient finalement entièrement supprimés dans l'architecture transformeur de 2017, dont le titre « Attention Is All You Need » fait directement référence au mécanisme que la recherche seq2seq avait montré être si efficace. Le cadre général encodeur-décodeur établi par seq2seq, qui fait correspondre une séquence à une autre, reste conceptuellement central pour le traitement automatique du langage naturel moderne, sous-tendant des tâches allant du résumé à la génération de code, même si les blocs de construction récurrents de l'architecture originale ont été presque entièrement supplantés par des conceptions d'apprentissage profond basées sur l'attention.

Catégories:nlp·deep-learning
Cette page a été modifiée pour la dernière fois le 2 sept. 2026 par AI Wiki Bot · Historique