Séquence-à-Séquence (Seq2Seq))

Traduit de l'anglais

Séquence-à-séquence (seq2seq) est une famille d'approches d'apprentissage automatique qui mappent une séquence d'entrée vers une séquence de sortie en utilisant une architecture de réseau neuronal encodeur-décodeur, fondamentale pour des tâches comme la traduction et le résumé.

Séquence-à-séquence (souvent abrégé en seq2seq) est une famille d'approches d'apprentissage automatique utilisées pour le traitement du langage naturel et d'autres tâches de transduction de séquences. Le cadre transforme une séquence en une autre séquence, comme convertir une phrase de l'anglais au français, générer une légende à partir d'une image, ou produire un résumé à partir d'un texte plus long. Développé à l'origine par Lê Viết Quốc, un informaticien vietnamien et pionnier de l'apprentissage automatique chez Google Brain, seq2seq est devenu fondamental dans de nombreux systèmes d'IA modernes, y compris les grands modèles de langage et les agents conversationnels.

L'idée centrale de seq2seq est d'utiliser deux réseaux neuronaux : un encodeur qui traite la séquence d'entrée et compresse ses informations en un vecteur de longueur fixe (ou un ensemble de vecteurs de contexte), et un décodeur qui génère la séquence de sortie étape par étape à partir de cette représentation. Cette architecture a été proposée pour la première fois en 2014 et a depuis évolué, avec l'introduction des mécanismes d'attention et du modèle transformer, pour remédier à des limitations telles que le problème du goulot d'étranglement et le manque de parallélisation.

Racines historiques

Les racines conceptuelles de seq2seq résident dans la théorie de l'information et le modèle de canal bruité de la traduction automatique. Dès 1947, Warren Weaver, pionnier de la traduction automatique, notait : « On se demande naturellement si le problème de la traduction pourrait être conçu comme un problème de cryptographie. Quand je regarde un article en russe, je me dis : "Ceci est vraiment écrit en anglais, mais il a été codé avec des symboles étranges. Je vais maintenant procéder au décodage." » Ce point de vue a cadré la traduction comme un processus d'encodage-transmission-décodage, qui a directement inspiré la structure encodeur-décodeur.

Au début des années 2010, les chercheurs ont commencé à développer des modèles encodeur-décodeur basés sur des réseaux neuronaux pour la transduction de séquences. Les deux articles les plus couramment cités comme originaires de seq2seq ont tous deux été publiés en 2014. L'un était d'Ilya Sutskever, Oriol Vinyals et Quoc V. Le, travaillant chez Google Brain, et l'autre de Kyunghyun Cho, Bart van Merriënboer, Dzmitry Bahdanau et Yoshua Bengio, de l'Université de Montréal et de l'Université Jacobs. Ces articles proposaient d'utiliser des réseaux neuronaux récurrents (RNN), spécifiquement des réseaux à mémoire à long terme (LSTM), pour l'encodeur et le décodeur.

Le problème du goulot d'étranglement et l'attention

Les modèles seq2seq originaux utilisaient un vecteur d'encodage de longueur fixe, ce qui créait un problème de « goulot d'étranglement » : pour les séquences d'entrée longues, l'information tendait à être perdue car il était difficile de compresser tous les détails nécessaires dans un seul vecteur. Pour y remédier, Bahdanau et al. ont introduit le mécanisme d'attention en 2014. Leur modèle, appelé RNNsearch, permettait au décodeur de « rechercher » dans la phrase source pendant le décodage, imitant efficacement le processus de revenir sur les parties pertinentes de l'entrée. L'attention calcule une somme pondérée des états cachés de l'encodeur, produisant un vecteur de contexte pour chaque étape de décodage, ce qui a résolu le goulot d'étranglement en donnant au décodeur un accès direct à toutes les positions d'entrée.

La révolution Transformer

Une limitation significative des modèles seq2seq basés sur RNN était leur difficulté à se paralléliser, car le traitement récurrent est intrinsèquement séquentiel. La publication en 2017 de l'architecture transformer par Vaswani et al. (avec des contributeurs clés comme Jakob Uszkoreit et Lukasz Kaiser) a résolu ce problème en remplaçant l'encodeur récurrent par des blocs transformer à auto-attention (appelés « blocs encodeurs ») et le décodeur récurrent par des blocs transformer à attention croisée masquée causalement (« blocs décodeurs »). Cela a permis un entraînement beaucoup plus rapide sur du matériel parallèle et a conduit au développement de modèles à grande échelle tels que les grands modèles de langage et les systèmes d'IA générative.

Architecture

L'architecture seq2seq se compose de deux composants principaux : l'encodeur et le décodeur.

Encodeur

L'encodeur traite la séquence d'entrée, généralement une séquence de jetons ou de mots, et capture ses informations essentielles. Dans un encodeur basé sur RNN, ces informations sont stockées dans l'état caché du réseau. Avec l'attention, l'encodeur produit également un ensemble d'états cachés pour chaque position d'entrée, qui sont utilisés pour calculer les vecteurs de contexte. L'encodeur peut être bidirectionnel, ce qui signifie qu'il lit l'entrée dans les deux directions pour mieux capturer le contexte.

Décodeur

Le décodeur prend les vecteurs de contexte et les états cachés de l'encodeur et génère la séquence de sortie de manière autorégressive, produisant un élément à la fois. À chaque étape, il considère les éléments précédemment générés, le vecteur de contexte et les informations d'entrée pour prédire l'élément suivant. Dans les modèles avec attention, le vecteur de contexte et l'état caché du décodeur sont concaténés pour former un vecteur caché d'attention, qui est utilisé comme entrée pour l'étape suivante. Le décodeur est souvent masqué causalement pour l'empêcher de regarder en avant les jetons futurs pendant l'entraînement.

Entraînement vs. Prédiction

Il existe une différence subtile entre l'entraînement et la prédiction dans les modèles seq2seq. Pendant l'entraînement, les séquences d'entrée et de sortie sont connues, ce qui permet l'utilisation d'une technique appelée « teacher forcing ». Dans le teacher forcing, l'entrée du décodeur à chaque étape est le jeton de sortie de référence provenant des données d'entraînement, indépendamment de ce que le modèle a prédit. Cela accélère la convergence et stabilise l'entraînement.

Pendant la prédiction (inférence), la sortie de référence n'est pas disponible, donc le décodeur doit utiliser ses propres jetons précédemment générés comme entrée pour l'étape suivante. Cela peut entraîner une accumulation d'erreurs, car une erreur en début de séquence peut se propager. Pour atténuer cela, des techniques telles que la recherche par faisceau sont souvent utilisées pour explorer plusieurs séquences candidates et sélectionner la plus probable.

Applications

Les modèles seq2seq ont été appliqués à une large gamme de tâches. En traduction automatique, ils ont permis la refonte de Google Traduction en Google Neural Machine Translation en 2016. D'autres applications incluent la génération de légendes d'images, où l'encodeur traite une image (via un réseau neuronal convolutif) et le décodeur génère une description textuelle ; les modèles conversationnels, tels que les chatbots ; la reconnaissance vocale, mappant les séquences audio en texte ; et le résumé de texte, compressant de longs documents en résumés concis. L'architecture sous-tend également de nombreux modèles basés sur transformer utilisés dans les systèmes d'intelligence artificielle modernes.

Dispute de priorité

Une dispute de priorité notable entoure l'invention de seq2seq. Tomáš Mikolov, connu pour avoir développé word2vec et RNNLM, prétend avoir conçu l'idée d'utiliser un modèle de langage neuronal sur des paires de phrases et de générer une traduction après avoir vu la première phrase, ce qu'il assimile à la traduction automatique seq2seq. Il a déclaré avoir mentionné cette idée à Ilya Sutskever et Quoc Le alors qu'il était chez Google Brain, mais ils n'ont pas reconnu sa contribution dans leur article de 2014. L'article de Sutskever et al. est largement crédité comme un originaire clé, mais les contributions de Mikolov restent un sujet de débat dans la communauté de recherche.

Héritage et impact

Seq2seq a eu un impact profond sur le domaine de l'apprentissage automatique. Il a introduit le paradigme encodeur-décodeur qui est maintenant standard dans les tâches de transduction de séquences. Le mécanisme d'attention, initialement développé pour seq2seq, est devenu un composant fondamental de l'architecture transformer, qui alimente les grands modèles de langage modernes tels que ceux développés par OpenAI, Anthropic et Google DeepMind. Les principes de seq2seq sont également appliqués dans du matériel spécialisé et des services cloud, tels que AWS Trainium et Azure, qui sont optimisés pour l'entraînement et l'inférence de tels modèles. Au début des années 2020, seq2seq reste un concept central dans les programmes d'études et la recherche en apprentissage profond, bien que de nombreux systèmes de production aient évolué vers des architectures basées sur transformer qui s'appuient sur ses fondations.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:machine-learning·natural-language-processing·deep-learning·sequence-modeling
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique