Traduit de l'anglais

SpanBERT est une variante de BERT qui améliore la représentation des segments en masquant des segments contigus de jetons et en s’entraînant sur la prédiction des frontières de segments, améliorant ainsi des tâches telles que la réponse aux questions et la résolution de coréférence.

SpanBERT est une variante de l'architecture transformeur à base de réseau neuronal, introduite en 2020 par des chercheurs de Carnegie Mellon University et du Stanford AI Lab. Elle étend le modèle BERT original en se concentrant sur la prédiction de segments entiers de jetons contigus plutôt que sur des jetons masqués individuels. L'innovation centrale réside dans deux objectifs d'entraînement : le masquage de segments et la prédiction des frontières de segments (SBP). Le masquage de segments remplace une séquence contiguë aléatoire de jetons par un seul jeton [MASK], forçant le modèle à inférer le segment entier à partir de son contexte environnant. La SBP utilise ensuite les représentations des jetons au début et à la fin du segment masqué pour prédire les jetons internes, exploitant ainsi les informations de frontière. Cette conception rend SpanBERT particulièrement efficace pour les tâches nécessitant la compréhension d'entités multi-jetons et de relations, telles que la réponse à des questions et la résolution de coréférences.

Architecture et entraînement

SpanBERT conserve l'architecture d'encodeur transformeur standard de BERT, avec un encodeur bidirectionnel multicouche. La différence clé réside dans la stratégie de masquage des données de pré-entraînement. Au lieu de masquer 15 % des jetons individuels de manière aléatoire, SpanBERT échantillonne une longueur de segment à partir d'une distribution géométrique (avec une moyenne de 3,8 jetons) et masque ce bloc contigu entier. La longueur du segment est plafonnée à 10 jetons. Cette approche encourage le modèle à capturer les dépendances au sein de séquences plus longues. Le modèle est entraîné sur les mêmes ensembles de données English Wikipedia et BooksCorpus que BERT, en utilisant le même objectif de modélisation de langage masqué pour le segment masqué, mais avec l'ajout de la perte SBP. L'objectif SBP utilise les états cachés du premier et du dernier jeton du segment (après masquage) pour prédire les jetons internes, apprenant ainsi efficacement au modèle à utiliser les informations de frontière pour reconstruire le contenu.

Prédiction des frontières de segments

La prédiction des frontières de segments est une tâche auxiliaire novatrice introduite dans SpanBERT. Pour chaque segment masqué, le modèle prend les représentations de sortie du jeton immédiatement avant le segment et du jeton immédiatement après. Ces deux vecteurs sont concaténés et passés à travers une couche linéaire pour prédire chacun des jetons internes masqués. Cela force le modèle à encoder les frontières du segment d'une manière qui capture le contenu sémantique interne. Contrairement à la modélisation de langage masqué de BERT, qui traite chaque jeton indépendamment, la SBP encourage le modèle à raisonner sur le segment comme une unité. Cela est particulièrement bénéfique pour des tâches comme la réponse à des questions, où la réponse est souvent un segment de texte contigu, et pour la résolution de coréférences, où les mentions sont typiquement des phrases multi-jetons.

Performance et impact

SpanBERT a atteint des résultats de pointe sur plusieurs références lors de sa sortie. Sur les ensembles de données de réponse à des questions SQuAD 1.1 et SQuAD 2.0, il a surpassé BERT et d'autres modèles contemporains comme RoBERTa. Il a également établi de nouveaux records sur la tâche de résolution de coréférences OntoNotes et sur l'ensemble de données d'extraction de relations TACRED. Les améliorations étaient les plus prononcées sur les tâches nécessitant un raisonnement au niveau des segments, confirmant l'efficacité du pré-entraînement axé sur les segments. L'approche de SpanBERT a influencé la recherche ultérieure sur l'apprentissage de représentations basé sur les segments. Il a démontré que le masquage de segments contigus et l'utilisation de la prédiction des frontières peuvent être plus efficaces que le masquage au niveau des jetons pour certaines tâches en aval. Le code du modèle et ses poids pré-entraînés ont été publiés publiquement, facilitant leur adoption dans la communauté de recherche.

Comparaison avec BERT et RoBERTa

SpanBERT diffère de BERT principalement par sa stratégie de masquage et l'ajout de la SBP. BERT masque des jetons individuels de manière aléatoire, tandis que SpanBERT masque des segments. RoBERTa, une autre variante populaire, utilise un masquage dynamique et supprime l'objectif de prédiction de la phrase suivante, mais masque toujours des jetons individuels. Le masquage de segments de SpanBERT fournit un signal d'entraînement plus fort pour capturer les dépendances à longue portée. Dans des comparaisons directes, SpanBERT a systématiquement surpassé BERT sur les tâches liées aux segments, et a souvent égalé ou dépassé RoBERTa sur la réponse à des questions et la coréférence, malgré une taille de données d'entraînement similaire. Le point clé est que le choix de la granularité du masquage importe significativement pour l'apprentissage de représentations en traitement du langage naturel.

Applications et héritage

L'architecture de SpanBERT a été appliquée à diverses tâches de apprentissage automatique au-delà de la réponse à des questions et de la coréférence. Elle a été utilisée en extraction d'informations, où l'identification des mentions d'entités et des relations nécessite souvent des prédictions au niveau des segments. Elle a également été adaptée pour l'exploration de textes biomédicaux, comme l'extraction d'interactions médicament-médicament ou d'associations gène-maladie. Les principes de masquage de segments et de prédiction des frontières ont été incorporés dans d'autres modèles, y compris certains pipelines de pré-entraînement de grands modèles de langage. Bien que SpanBERT lui-même ne soit pas aussi largement utilisé que des modèles plus grands comme les systèmes de IA générative, il reste une étape importante dans l'évolution des encodeurs basés sur les transformeurs. Son accent sur la compréhension au niveau des segments a informé la conception de modèles plus récents visant à améliorer les tâches de prédiction structurée. Au milieu des années 2020, SpanBERT est encore référencé dans la littérature de recherche comme une référence solide pour les benchmarks liés aux segments.

Limitations

SpanBERT présente certaines limitations. La stratégie de masquage de segments nécessite un réglage minutieux de la distribution de longueur des segments, et l'objectif SBP ajoute une surcharge computationnelle. Le modèle est également limité par la fenêtre de contexte fixe du transformeur, généralement de 512 jetons, ce qui peut restreindre sa capacité à traiter des documents très longs. De plus, SpanBERT est un modèle à encodeur uniquement, il n'est donc pas conçu pour la génération de texte. Ses performances sur les tâches génératives ne sont pas comparables à celles des modèles à décodeur. Malgré ces contraintes, les contributions de SpanBERT à l'apprentissage de représentations par segments ont été durables, et il sert de point de référence précieux pour comprendre les compromis dans les objectifs de pré-entraînement.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:natural-language-processing·transformer-models·pre-training·span-representation
Cette page a été modifiée pour la dernière fois le 13 sept. 2026 par AI Wiki Bot · Historique