DeBERTa (Decoding-enhanced BERT with disentangled attention) est une famille d'architectures de réseaux de neurones transformeurs pour le traitement du langage naturel (NLP), introduite par des chercheurs de Microsoft en 2021. Elle s'appuie sur le modèle BERT antérieur en intégrant deux innovations clés : un mécanisme d'attention désenchevêtré qui modélise séparément les informations de contenu et de position relative, et un décodeur de masques amélioré qui optimise la prédiction des jetons masqués lors du pré-entraînement. Ces changements permettent à DeBERTa d'obtenir des performances supérieures sur une gamme de références NLP, notamment le classement SuperGLUE, où elle a dépassé pour la première fois les scores de référence humains en janvier 2021.
Contexte et motivation
DeBERTa s'inscrit dans l'évolution plus large des grands modèles de langage qui a commencé avec l'introduction de l'architecture transformeur en 2017. BERT, publié par Google en 2018, a démontré que le pré-entraînement d'un encodeur transformeur bidirectionnel sur de grands corpus de texte pouvait produire des représentations transférables pour de nombreuses tâches en aval. Cependant, le mécanisme d'attention de BERT encode les positions des jetons comme des incorporations absolues ajoutées à l'entrée, ce qui peut limiter sa capacité à généraliser à des séquences plus longues ou à des combinaisons de positions inédites. DeBERTa répond à cette limitation en découplant les informations de contenu et de position, permettant ainsi au modèle d'apprendre des relations plus flexibles entre les jetons.
Architecture
DeBERTa conserve la structure globale d'encodeur uniquement de BERT, comprenant une couche d'incorporation, plusieurs couches d'encodeur transformeur et une tête de sortie spécifique à la tâche. Les principales différences architecturales résident dans le calcul de l'attention et le processus de décodage des masques.
Attention désenchevêtrée
Dans l'attention transformeur standard, chaque jeton est représenté par un vecteur unique qui combine son contenu et sa position absolue. DeBERTa représente plutôt chaque jeton avec deux vecteurs distincts : l'un pour le contenu et l'autre pour la position relative. Le score d'attention entre deux jetons est alors calculé comme la somme de quatre termes distincts : contenu-contenu, contenu-position, position-contenu et position-position. Ce désenchevêtrement permet au modèle de capturer indépendamment les relations sémantiques et positionnelles, ce qui est particulièrement bénéfique pour les tâches nécessitant une compréhension fine de l'ordre des mots et des distances entre eux.
Décodeur de masques amélioré
L'objectif de pré-entraînement de DeBERTa est la modélisation du langage masqué, similaire à BERT. Cependant, DeBERTa introduit un décodeur de masques amélioré qui utilise à la fois les informations de contenu et de position du jeton masqué pour prédire le mot original. Cela est réalisé en incorporant la position absolue du jeton masqué dans la couche de décodage, ce qui aide le modèle à résoudre les ambiguïtés qui surviennent lorsque plusieurs jetons partagent des positions relatives similaires. Ce décodeur amélioré augmente l'efficacité du pré-entraînement et conduit à de meilleures performances en aval.
Entraînement et variantes
DeBERTa a été pré-entraîné sur le même corpus que BERT, comprenant l'anglais Wikipédia et BookCorpus, totalisant environ 16 Go de texte. Le modèle de base, DeBERTa-base, possède 12 couches, 768 unités cachées et 12 têtes d'attention, soit environ 140 millions de paramètres. Une variante plus grande, DeBERTa-large, comporte 24 couches, 1024 unités cachées et 16 têtes d'attention, avec environ 400 millions de paramètres. En 2021, Microsoft a également publié DeBERTa-v3, qui a introduit une nouvelle méthode de pré-entraînement appelée détection de jetons remplacés, améliorant encore l'efficacité et les performances.
Performances et impact
DeBERTa a obtenu des résultats de pointe sur plusieurs références NLP majeures. En janvier 2021, DeBERTa avec une taille de modèle importante et des données d'entraînement supplémentaires a dépassé la référence humaine sur le benchmark SuperGLUE, une étape importante qui a souligné les progrès rapides des grands modèles de langage. DeBERTa a également obtenu de bonnes performances sur le benchmark GLUE et l'ensemble de données de questions-réponses SQuAD. Ses innovations ont influencé les modèles ultérieurs, notamment ceux des familles GPT et T5, et ont contribué au développement de mécanismes d'attention plus efficaces dans les architectures ultérieures.