XLNet est un modèle transformateur autorégressif conçu pour le traitement du langage naturel, présenté comme une amélioration par rapport à BERT. Il a été publié le 19 juin 2019 sous licence Apache 2.0, avec 340 millions de paramètres et entraîné sur 33 milliards de mots. Le modèle a obtenu des résultats de pointe sur des tâches telles que la modélisation du langage, la réponse aux questions et l'inférence en langage naturel, et constitue un exemple notable d'architecture de grand modèle de langage dans la recherche en apprentissage profond.
Contrairement à BERT, qui utilise la modélisation du langage masqué, XLNet emploie la modélisation du langage par permutation. Cette approche factorise la probabilité conjointe d'une séquence dans tous les ordres possibles, permettant au modèle de capturer un contexte bidirectionnel sans recourir au masquage. Cette conception visait à remédier à une limitation de BERT, où les jetons masqués ne sont pas vus pendant le pré-entraînement, créant un écart entre le pré-entraînement et l'ajustement fin.
Modélisation du langage par permutation
Dans la modélisation autorégressive standard, la probabilité d'une séquence est factorisée dans un ordre fixe de gauche à droite. Par exemple, la phrase « Mon chien est mignon » est modélisée comme le produit de probabilités conditionnelles : Pr(Mon) Pr(chien|Mon) Pr(est|Mon, chien) * Pr(mignon|Mon, chien, est). XLNet échantillonne plutôt une permutation aléatoire des positions des jetons et factorise la probabilité selon cet ordre. Par exemple, avec la permutation 3-2-4-1, le modèle prédit « est » en premier, puis « chien », puis « mignon », et enfin « Mon », chacun étant conditionné par les jetons prédits précédemment. En s'entraînant sur toutes les permutations, le modèle apprend à utiliser le contexte dans les deux directions, améliorant ainsi sa capacité à capturer les dépendances à longue portée.
Auto-attention à deux flux
Pour implémenter la modélisation du langage par permutation, XLNet utilise un mécanisme d'auto-attention à deux flux. Le premier flux, appelé flux de contenu, encode le contenu de chaque jeton en utilisant une auto-attention causale standard. Le second flux, le flux de requête, encode le contenu de chaque jeton dans le contexte des jetons prédits précédemment, en utilisant une attention croisée masquée où les requêtes proviennent du flux de requête et les paires clé-valeur proviennent du flux de contenu. Cette conception permet au modèle de prédire un jeton sans voir son propre contenu, tout en exploitant le contenu des autres jetons dans l'ordre permuté.
Entraînement et performance
XLNet a été entraîné sur un vaste corpus de 33 milliards de mots, en utilisant un modèle de 340 millions de paramètres. Le processus d'entraînement impliquait à la fois la modélisation du langage par permutation et un objectif de réordonnancement de segments, ce qui a aidé le modèle à apprendre les relations entre les phrases. Lors de sa publication, XLNet a surpassé BERT sur une gamme de références, notamment le Stanford Question Answering Dataset (SQuAD), le benchmark General Language Understanding Evaluation (GLUE) et plusieurs tâches de compréhension de lecture. Son succès a démontré l'efficacité du pré-entraînement basé sur la permutation et a influencé les travaux ultérieurs en IA générative et en apprentissage automatique.
Impact et héritage
XLNet a contribué à l'évolution des modèles de langage pré-entraînés en mettant en évidence les compromis entre les approches autorégressives et auto-encodantes. Alors que la stratégie de masquage de BERT permettait un contexte bidirectionnel, elle introduisait un écart entre pré-entraînement et ajustement fin ; l'approche par permutation de XLNet offrait un moyen d'obtenir un contexte bidirectionnel tout en maintenant la propriété autorégressive. Cette idée a été intégrée dans des modèles ultérieurs, tels que Transformer-XL et d'autres variantes. Bien que des architectures plus récentes aient depuis surpassé XLNet en performance, il reste une étape importante dans l'histoire de la recherche en intelligence artificielle et en réseaux neuronaux.
Voir aussi
- BERT (non inclus dans les slugs fournis, mais pourrait être lié comme transformateur)
- grand modèle de langage
- apprentissage profond
- apprentissage automatique