Transformer-XL est une architecture de Transformeur basée sur un réseau de neurones, introduite en janvier 2019 par des chercheurs de l'Université Carnegie Mellon et de Google DeepMind. Elle a été conçue pour remédier à la limitation de longueur de contexte fixe des Transformeurs standards, qui traitent les séquences d'entrée par segments et perdent les informations au-delà de la frontière de chaque segment. En introduisant un mécanisme de récurrence au niveau des segments et un schéma de encodage positionnel relatif, Transformer-XL peut modéliser des dépendances sur des séquences bien plus longues que ses prédécesseurs, obtenant des résultats de pointe sur plusieurs références de modélisation linguistique à l'époque de sa publication.
L'architecture a été présentée dans l'article « Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context », rédigé par Zihang Dai, Zhilin Yang, Yiming Yang, Jaime Carbonell, Quoc Le et Ruslan Salakhutdinov. Le nom du modèle dérive de sa capacité à gérer des contextes « extra longs », le « XL » signifiant extra long. Il a été publié en tant que logiciel open source, avec des implémentations en PyTorch et TensorFlow, et est devenu un composant fondamental pour les grands modèles de langage et les systèmes de traitement de séquences ultérieurs.
Récurrence au niveau des segments
L'innovation centrale de Transformer-XL est sa récurrence au niveau des segments, qui permet au modèle de réutiliser les états cachés des segments précédents lors du traitement du segment courant. Dans un Transformeur standard, chaque segment est traité indépendamment, et la mémoire du modèle est réinitialisée à chaque frontière de segment, limitant le contexte à la longueur du segment. Transformer-XL met plutôt en cache les états cachés du segment précédent et les fournit comme contexte supplémentaire aux couches d'attention du segment courant.
Ce mécanisme de récurrence crée une forme de mémoire qui persiste à travers les segments, permettant au modèle de capturer des dépendances à longue portée qui s'étendent sur plusieurs segments. Par exemple, en modélisation linguistique, un pronom ou un sujet introduit dans un segment antérieur peut être correctement résolu dans un segment ultérieur, même si la distance entre eux dépasse la longueur du segment. La récurrence est appliquée à chaque couche, les états cachés du segment précédent étant concaténés avec ceux du segment courant avant le calcul de l'attention.
Encodage positionnel relatif
Une deuxième contribution clé est l'utilisation d'un encodage positionnel relatif, qui remplace les encodages positionnels absolus utilisés dans le Transformeur original. Dans le Transformeur standard, la position de chaque jeton est encodée avec un vecteur fixe, et les scores d'attention sont calculés sur la base des positions absolues. Cette approche échoue lorsque les segments sont réutilisés, car le même jeton dans différents segments aurait des positions absolues différentes, ce qui perturbe le modèle.
Transformer-XL encode plutôt la distance relative entre les jetons, permettant au modèle de généraliser à des séquences plus longues que celles vues lors de l'entraînement. L'encodage relatif est intégré dans le calcul de l'attention, avec des paramètres apprenables séparés pour les termes basés sur le contenu et sur la position. Cette conception résout non seulement le problème de réutilisation des segments, mais améliore également la capacité du modèle à extrapoler à des contextes plus longs, car les distances relatives restent significatives indépendamment de la position absolue.
Performance et références
Transformer-XL a obtenu des améliorations significatives par rapport aux modèles de pointe précédents sur plusieurs ensembles de données de modélisation linguistique. Sur la référence WikiText-103, il a réduit la perplexité de 20,5 (atteinte par le meilleur modèle précédent) à 18,3, un gain notable. Sur l'ensemble de données enwik8, il a atteint un score de bits par caractère de 0,99, surpassant les modèles récurrents et convolutionnels antérieurs. Il a également bien performé sur la référence One Billion Word, établissant un nouveau record avec une perplexité de 21,8.
La capacité du modèle à gérer des contextes longs était particulièrement évidente dans des tâches nécessitant de la mémoire, comme la génération de texte et la classification au niveau documentaire. Son mécanisme de récurrence lui permettait de maintenir une cohérence sur des milliers de jetons, une capacité qui était auparavant difficile pour les modèles de apprentissage profond. Ces résultats ont établi Transformer-XL comme une étape importante dans la modélisation de séquences et ont influencé les architectures ultérieures, y compris les modèles encodeur-décodeur utilisés dans les systèmes modernes de IA générative.
Influence et héritage
Les principes de conception de Transformer-XL ont été adoptés et étendus par des modèles ultérieurs. L'idée de récurrence au niveau des segments a été incorporée dans les architectures basées sur Transformer-XL utilisées dans des modèles comme XLNet, qui l'a combinée avec la modélisation linguistique par permutation pour le pré-entraînement. Le schéma d'encodage positionnel relatif est également devenu un composant standard dans de nombreuses variantes de Transformeurs ultérieures, y compris celles utilisées dans les modèles GPT-2 et suivants d'OpenAI, qui employaient une version simplifiée de l'attention relative.
L'accent mis par l'architecture sur les dépendances à longue portée a contribué au développement de mécanismes d'attention plus efficaces, tels que l'attention sparse et à fenêtre glissante, qui visent à capturer des contextes longs sans le coût quadratique complet. Transformer-XL a également servi de référence pour de nombreux efforts de recherche en modélisation de séquences efficace, et ses implémentations open source ont facilité une adoption généralisée dans le monde académique et industriel.
Détails techniques et variantes
Transformer-XL est construit sur le cadre standard encodeur-décodeur du Transformeur, mais il est généralement utilisé comme un modèle décodeur seul pour la modélisation linguistique. Le mécanisme de récurrence est appliqué aux couches d'auto-attention, la taille du cache d'états cachés étant un hyperparamètre qui contrôle la quantité de contexte historique. Le modèle utilise la normalisation de couche, le dropout et le écrêtage de gradient pour la stabilité de l'entraînement, et il emploie l'optimiseur Adam.
Plusieurs variantes ont été proposées pour améliorer l'efficacité, comme la portée d'attention adaptative, qui apprend la longueur de contexte optimale par tête. Le modèle a également inspiré le développement de Transformeurs à mémoire augmentée, où des modules de mémoire externes sont utilisés pour stocker et récupérer des informations sur de très longues séquences. Bien que Transformer-XL lui-même ne soit plus l'état de l'art, ses contributions restent intégrales à la conception des modèles de séquences modernes, et ses principes sont enseignés dans les cours avancés de apprentissage automatique.
Réception et applications
Lors de sa publication, Transformer-XL a attiré l'attention pour ses résultats empiriques solides et sa clarté conceptuelle. Il a été largement cité dans la littérature sur la modélisation linguistique et le traitement de séquences à longue portée. Le modèle a été appliqué à des tâches au-delà du langage, y compris la prévision de séries temporelles et la génération musicale, où les dépendances à long terme sont cruciales. Sa capacité à traiter des séquences de jusqu'à des milliers de jetons le rendait adapté à des tâches au niveau documentaire, comme le résumé et la réponse à des questions, où le contexte s'étend sur plusieurs paragraphes.
L'architecture a également influencé la conception de systèmes d'inférence efficaces, car le mécanisme de récurrence permet un traitement incrémental des données en flux sans recalculer l'intégralité du contexte. Cette propriété était précieuse pour des applications en temps réel, comme la reconnaissance vocale et la traduction en ligne. Bien que des architectures plus récentes comme les grands modèles de langage avec attention sparse aient surpassé Transformer-XL en échelle et en performance, son héritage persiste dans les techniques fondamentales qu'il a introduites.
Voir aussi
Références
- Dai, Z., Yang, Z., Yang, Y., Carbonell, J., Le, Q., & Salakhutdinov, R. (2019). Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context. arXiv:1901.02860.
- Implémentations officielles et documentation disponibles sur GitHub.