Traduit de l'anglais

XLNet est un modèle Transformer autorégressif pour le traitement du langage naturel, publié en juin 2019 comme une amélioration par rapport à BERT. Il utilise la modélisation du langage par permutation pour capturer le contexte bidirectionnel, atteignant des résultats de pointe sur diverses tâches.

XLNet est un modèle d'intelligence artificielle pour le traitement du langage naturel, introduit le 19 juin 2019 comme une architecture Transformer (architecture) autorégressive. Il a été conçu comme une amélioration de BERT, en remédiant aux limites du masquage linguistique par l'utilisation de la modélisation linguistique par permutation pour capturer le contexte bidirectionnel. Le modèle possède 340 millions de paramètres et a été entraîné sur un corpus de 33 milliards de mots, atteignant des résultats de pointe sur des tâches telles que la modélisation linguistique, la réponse à des questions et l'inférence en langage naturel. Il a été publié sous la licence Apache 2.0, le rendant librement disponible pour une utilisation tant en recherche qu'en commercial.

XLNet appartient à la famille plus large des modèles de langage de grande taille, qui sont des réseaux de neurones entraînés sur de vastes corpus de textes pour comprendre et générer le langage humain. Son développement s'est appuyé sur les avancées en apprentissage profond et sur l'architecture Transformer (architecture), qui avait révolutionné le domaine depuis son introduction en 2017. Contrairement aux modèles antérieurs qui traitaient le texte dans un ordre fixe de gauche à droite ou de droite à gauche, XLNet a introduit un objectif d'entraînement novateur qui considère toutes les permutations possibles d'une phrase, lui permettant d'apprendre à partir du contexte gauche et droit simultanément.

Architecture

L'innovation centrale de XLNet est la modélisation linguistique par permutation. Dans la modélisation autorégressive standard, une phrase comme « Mon chien est mignon » est factorisée comme le produit de probabilités conditionnelles, où chaque mot est prédit en fonction de tous les mots précédents : Pr(Mon) × Pr(chien|Mon) × Pr(est|Mon, chien) × Pr(mignon|Mon, chien, est). Cet ordre de gauche à droite limite la capacité du modèle à utiliser le contexte futur. XLNet, cependant, permute aléatoirement l'ordre des mots pendant l'entraînement. Par exemple, avec un ordre de permutation de 3-2-4-1, le modèle prédit « est » en premier, puis « chien », puis « mignon », et enfin « Mon », en conditionnant à chaque fois sur les mots déjà générés dans cette permutation. En s'entraînant sur toutes les permutations possibles, le modèle apprend à utiliser le contexte bidirectionnel, similaire à BERT, mais sans les jetons artificiels [MASK] sur lesquels BERT repose.

Auto-attention à deux flux

Pour implémenter la modélisation linguistique par permutation, XLNet utilise un mécanisme d'auto-attention à deux flux. Le premier flux, appelé flux de contenu, encode le contenu réel de chaque mot en utilisant une auto-attention causale masquée standard, similaire à un décodeur Transformer (architecture) typique. Le second flux, appelé flux de requête, encode le contenu de chaque mot dans le contexte de ce qui a été généré jusqu'à présent dans la permutation. Il utilise un mécanisme d'attention croisée masquée où les requêtes proviennent du flux de requête et les paires clé-valeur proviennent du flux de contenu. Cette séparation permet au modèle de prédire un mot sans voir son propre contenu, ce qui est essentiel pour l'objectif de permutation. Les deux flux sont combinés pendant l'entraînement, et seul le flux de contenu est utilisé lors de l'inférence.

Entraînement et performance

XLNet a été entraîné sur un grand corpus de 33 milliards de mots, comprenant des textes provenant de livres, de pages web et d'autres sources. Le processus d'entraînement a utilisé l'objectif de modélisation linguistique par permutation, avec le modèle échantillonnant aléatoirement un ordre de permutation pour chaque exemple d'entraînement. Les 340 millions de paramètres du modèle le rendaient comparable en taille à BERT-large, mais son objectif d'entraînement lui a permis d'atteindre de meilleures performances sur plusieurs références. Par exemple, sur la référence GLUE, qui teste la compréhension du langage naturel à travers plusieurs tâches, XLNet a surpassé BERT sur la plupart des tâches, y compris l'analyse de sentiments, la réponse à des questions et l'implication textuelle. Il a également atteint des résultats de pointe sur l'ensemble de données de réponse à des questions SQuAD et sur les tâches de perplexité de modélisation linguistique.

Un avantage notable de XLNet est sa capacité à capturer des dépendances à longue portée. Parce qu'il considère toutes les permutations, le modèle peut apprendre des relations entre des mots éloignés dans la phrase originale, même s'ils sont adjacents dans une permutation particulière. Cela est particulièrement utile pour des tâches nécessitant une compréhension du contexte global, comme la classification de documents ou la résolution de coréférence.

Comparaison avec BERT

BERT, introduit en 2018, utilisait un objectif de modélisation linguistique masquée où un pourcentage de jetons d'entrée est remplacé par [MASK], et le modèle est entraîné à prédire les jetons originaux. Bien qu'efficace, cette approche présente des limites : les jetons [MASK] ne sont pas présents lors du réglage fin ou de l'inférence, créant un décalage entre l'entraînement et le déploiement. De plus, BERT suppose que les jetons masqués sont indépendants les uns des autres, ce qui n'est pas toujours vrai. XLNet remédie à ces problèmes en utilisant la modélisation linguistique par permutation, qui ne repose pas sur les jetons [MASK] et permet au modèle de capturer les dépendances entre tous les jetons. Cela rend XLNet plus cohérent entre l'entraînement et l'inférence, et il peut modéliser des distributions de probabilité conjointes plus précisément.

Cependant, l'approche par permutation a également des coûts computationnels. XLNet nécessite plus de temps d'entraînement que BERT car il doit traiter plusieurs permutations pour chaque exemple d'entraînement. Le mécanisme d'auto-attention à deux flux ajoute également de la complexité à l'architecture. Malgré ces coûts, les gains de performance ont fait de XLNet un choix populaire pour de nombreuses applications de traitement du langage naturel à l'époque de sa sortie.

Impact et héritage

XLNet a eu un impact significatif sur le domaine du apprentissage automatique et du traitement du langage naturel. Il a démontré que les modèles autorégressifs pouvaient égaler ou dépasser les performances des modèles de langage masqués tout en fournissant un objectif d'entraînement plus fondé. Son succès a inspiré des recherches supplémentaires sur les modèles basés sur la permutation et équivariants par permutation. De nombreux modèles ultérieurs, tels que ELECTRA et T5, se sont appuyés sur des idées de XLNet, et le concept de modélisation linguistique par permutation a influencé la conception de modèles de langage de grande taille ultérieurs. Bien que XLNet ait été surpassé par des modèles plus puissants comme GPT-3 et T5, il reste une étape importante dans le développement de la IA générative et des architectures basées sur Transformer (architecture). Sa publication en open source sous la licence Apache 2.0 a également contribué à la démocratisation de la recherche en IA, permettant aux chercheurs et développeurs du monde entier d'utiliser et de modifier le modèle.

Références

  • Yang, Z., Dai, Z., Yang, Y., Carbonell, J., Salakhutdinov, R., & Le, Q. V. (2019). XLNet: Generalized Autoregressive Pretraining for Language Understanding. arXiv preprint arXiv:1906.08237.
  • Devlin, J., Chang, M. W., Lee, K., & Toutanova, K. (2018). BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. arXiv preprint arXiv:1810.04805.
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:natural-language-processing·transformer-models·deep-learning·language-models
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique