Modélisation de langage masqué

Traduit de l'anglais

Le masquage de langage est un objectif de pré-entraînement auto-supervisé où un modèle prédit des jetons masqués dans une séquence, permettant une compréhension bidirectionnelle du contexte, comme popularisé par BERT.

Le masquage de langage (MLM, pour Masked Language Modeling) est un objectif d'apprentissage auto-supervisé utilisé en traitement du langage naturel, où un modèle est entraîné à prédire des jetons masqués aléatoirement dans une séquence, en se basant sur le contexte environnant. Contrairement aux modèles de langage traditionnels qui prédisent le jeton suivant de gauche à droite, le MLM permet au modèle d'utiliser à la fois le contexte gauche et droit, permettant une compréhension bidirectionnelle plus profonde du langage. Cette approche a été popularisée par le modèle basé sur le Transformer BERT (Bidirectional Encoder Representations from Transformers), introduit par Google en 2018, et est depuis devenue une pierre angulaire de nombreux grands modèles de langage et systèmes de apprentissage profond.

L'idée centrale du MLM est de corrompre une partie du texte d'entrée en remplaçant certains jetons par un jeton spécial [MASK], puis d'entraîner le modèle à reconstruire les jetons d'origine. Cela force le modèle à apprendre des représentations contextuelles qui capturent les relations syntaxiques et sémantiques. Le MLM est une forme d'intelligence artificielle d'entraînement qui ne nécessite pas de données étiquetées par des humains, ce qui le rend hautement évolutif pour le pré-entraînement sur de vastes corpus de texte.

Contexte historique

Le concept de prédiction de mots manquants dans un texte a des racines dans des modèles statistiques et neuronaux antérieurs, mais la formulation moderne du MLM a émergé avec l'avènement de l'apprentissage profond. En 2018, Jacob Devlin et ses collègues de Google AI ont introduit BERT, qui utilisait le MLM comme objectif principal de pré-entraînement. Le succès de BERT a démontré que le pré-entraînement bidirectionnel pouvait améliorer considérablement les performances sur une large gamme de tâches de traitement du langage naturel, y compris la réponse aux questions et l'analyse des sentiments.

Avant BERT, des modèles comme ELMo utilisaient des LSTM bidirectionnels mais ne conditionnaient pas conjointement les deux directions en profondeur. L'architecture Transformer, introduite en 2017 par Vaswani et al., a fourni la base du mécanisme d'attention bidirectionnelle de BERT. Le MLM est devenu une innovation clé qui distinguait BERT des modèles unidirectionnels antérieurs comme GPT.

Comment fonctionne le masquage de langage

Dans une configuration MLM typique, une séquence d'entraînement est traitée comme suit :

  1. Tokenisation : Le texte d'entrée est divisé en jetons à l'aide d'un tokeniseur (par exemple, WordPiece).
  2. Masquage : Un sous-ensemble aléatoire de jetons (généralement 15 %) est sélectionné. Pour chaque jeton sélectionné, il y a 80 % de chances de le remplacer par [MASK], 10 % de chances de le remplacer par un jeton aléatoire et 10 % de chances de le laisser inchangé.
  3. Prédiction : Le modèle traite la séquence masquée et produit une distribution de probabilité sur le vocabulaire pour chaque position masquée.
  4. Perte : La perte est calculée comme l'entropie croisée entre la distribution prédite et le jeton réel, et les gradients sont rétropropagés pour mettre à jour les poids du modèle.

Cette stratégie de masquage, connue sous le nom de « LM masqué avec remplacement aléatoire », a été introduite dans BERT pour atténuer l'inadéquation entre le pré-entraînement (où [MASK] apparaît) et l'ajustement fin (où [MASK] est absent).

Avantages et limites

Le MLM offre plusieurs avantages :

  • Contexte bidirectionnel : Les modèles peuvent exploiter les informations des deux côtés d'un jeton, ce qui conduit à des représentations plus riches.
  • Évolutivité : Le pré-entraînement peut être effectué sur du texte non étiqueté, permettant aux modèles d'apprendre à partir de corpus massifs.
  • Apprentissage par transfert : L'ajustement fin d'un modèle MLM pré-entraîné sur des tâches en aval donne souvent des résultats de pointe avec des données étiquetées limitées.

Cependant, le MLM présente également des limites :

  • Coût de calcul : L'entraînement nécessite des ressources de calcul importantes, utilisant souvent du matériel spécialisé comme les systèmes AWS Trainium ou Cerebras.
  • Inefficacité du masquage : Seule une petite fraction des jetons est utilisée pour la prédiction à chaque étape d'entraînement, ce qui rend l'entraînement moins efficace en termes d'échantillons que les méthodes autorégressives.
  • Inadéquation pré-entraînement/ajustement fin : Le jeton [MASK] n'est pas présent lors de l'ajustement fin, ce qui peut provoquer un décalage de distribution.

Variantes et améliorations

Plusieurs variantes du MLM ont été proposées pour remédier à ses limites :

  • RoBERTa : Développé par Facebook AI (maintenant Meta AI), RoBERTa supprime l'objectif de prédiction de phrase suivante et utilise un masquage dynamique, où le motif de masquage change à chaque époque. Il s'entraîne également avec des lots plus importants et plus de données.
  • ALBERT : Introduit le partage de paramètres et la prédiction d'ordre de phrases pour réduire l'utilisation de la mémoire tout en maintenant les performances.
  • ELECTRA : Utilise une tâche de détection de jeton remplacé, où le modèle apprend à distinguer les jetons réels des remplacements générés par un générateur, rendant l'entraînement plus efficace.
  • Masquage par plages : Des modèles comme SpanBERT masquent des plages contiguës de jetons plutôt que des jetons individuels, améliorant les performances sur les tâches liées aux plages.

Ces variantes ont été adoptées dans divers grands modèles de langage et ont influencé la conception de nouvelles architectures.

Applications dans l'IA moderne

Le MLM n'est pas seulement utilisé pour le pré-entraînement de modèles de langage à usage général, mais aussi dans des modèles spécifiques à un domaine. Par exemple, BioBERT applique le MLM aux textes biomédicaux, et ClinicalBERT est entraîné sur des notes cliniques. De plus, le MLM a été étendu à d'autres modalités, comme l'image et l'audio, grâce aux autoencodeurs masqués (par exemple, MAE pour les images).

Dans le contexte de l'IA générative, le MLM est souvent utilisé comme composant dans des modèles hybrides qui combinent des objectifs bidirectionnels et autorégressifs, comme T5 et BART, qui utilisent un objectif de débruitage similaire au MLM mais avec une architecture séquence-à-séquence.

Relation avec d'autres objectifs de pré-entraînement

Le MLM est l'un des nombreux objectifs de pré-entraînement dans le domaine du apprentissage automatique. Parmi les autres, on trouve :

  • Modélisation autorégressive : Prédit le jeton suivant en fonction des jetons précédents (par exemple, GPT). C'est unidirectionnel et constitue la base de nombreux grands modèles de langage comme ceux d'OpenAI.
  • Débruitage séquence-à-séquence : Des modèles comme T5 et BART corrompent l'entrée et entraînent le modèle à reconstruire la séquence d'origine, ce qui peut être considéré comme une forme généralisée de MLM.
  • Apprentissage contrastif : Utilisé dans des modèles comme SimCSE pour apprendre des plongements de phrases en rapprochant des phrases similaires et en éloignant des phrases dissemblables.

La nature bidirectionnelle du MLM le rend particulièrement adapté aux tâches qui nécessitent une compréhension complète du contexte, comme la reconnaissance d'entités nommées et l'extraction de relations.

Impact sur le domaine

L'introduction du MLM avec BERT a marqué un changement de paradigme dans le traitement du langage naturel. Il a démontré que le pré-entraînement sur de grands corpus avec un objectif simple pouvait produire des représentations qui se transfèrent bien à une large gamme de tâches. Cela a conduit au développement de nombreux modèles de type BERT, tels que DistilBERT, TinyBERT et MobileBERT, qui visent à réduire la taille du modèle tout en préservant les performances.

Le MLM a également influencé la conception de modèles basés sur le Transformer dans d'autres domaines, comme la vision par ordinateur (par exemple, BEiT, MAE) et le traitement de la parole (par exemple, wav2vec 2.0). Le concept de masquage et de reconstruction est devenu un principe général de l'apprentissage auto-supervisé.

Orientations futures

En 2025, la recherche continue d'explorer des objectifs de pré-entraînement plus efficaces et plus performants. Certaines directions incluent :

  • Modèles unifiés : Combiner le MLM avec des objectifs autorégressifs dans un seul modèle, comme on le voit dans des modèles comme UniLM et XLNet (qui utilise la modélisation de langage par permutation).
  • Attention efficace : Réduire le coût de calcul de l'attention bidirectionnelle, permettant le MLM sur des séquences plus longues.
  • MLM multimodal : Étendre le MLM pour modéliser conjointement le texte, les images et l'audio, comme dans des modèles comme CLIP et Flamingo.

Des entreprises comme Google DeepMind, OpenAI et Anthropic continuent d'investir dans la recherche sur le pré-entraînement, et le MLM reste une technique fondamentale dans leurs boîtes à outils.

Conclusion

Le masquage de langage est devenu une technique fondamentale de l'IA moderne, permettant aux modèles d'apprendre des représentations bidirectionnelles riches à partir de texte non étiqueté. Son introduction avec BERT en 2018 a révolutionné le domaine du traitement du langage naturel et a depuis été adaptée à diverses modalités et architectures. Bien que de nouveaux objectifs et modèles aient émergé, les principes du MLM que sont le masquage et la reconstruction continuent d'influencer la conception des systèmes de pointe. À mesure que le domaine progresse, le MLM restera probablement un composant clé du développement de modèles d'IA plus performants et plus efficaces.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:natural-language-processing·self-supervised-learning·pretraining·transformer
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique