Traduit de l'anglais

BART est un autoencodeur débruiteur pour le pré-entraînement de modèles séquence-à-séquence en traitement du langage naturel, introduit par Facebook AI en 2019. Il combine des transformeurs bidirectionnels et autorégressifs pour améliorer la génération et la compréhension de texte.

BART (Bidirectional and Auto-Regressive Transformer) est un autoencodeur débruteur conçu pour le pré-entraînement de modèles séquence-à-séquence en traitement du langage naturel. Introduit par des chercheurs de Facebook AI en 2019, BART corrompt le texte avec une fonction de bruit arbitraire et apprend un modèle pour reconstruire le texte original. Il est notable pour unifier plusieurs objectifs de pré-entraînement, y compris ceux utilisés dans des modèles comme BERT et GPT, dans un cadre unique qui excelle à la fois dans les tâches de compréhension et de génération.

L'architecture de BART est un transformeur séquence-à-séquence standard, avec un encodeur bidirectionnel similaire à BERT et un décodeur autorégressif similaire à GPT. Cette conception permet à l'encodeur de capturer le contexte à gauche et à droite, tandis que le décodeur génère la sortie jeton par jeton. L'objectif de pré-entraînement implique de corrompre le texte d'entrée et d'entraîner le modèle à minimiser la perte d'entropie croisée entre la sortie du décodeur et le texte original non corrompu. La flexibilité de BART pour gérer diverses stratégies de bruit, telles que le masquage de jetons, la suppression de jetons, le remplissage de texte, la permutation de phrases et la rotation de documents, en fait un modèle polyvalent puissant.

Développement et publication

BART a été développé par une équipe de Facebook AI, désormais partie de Meta AI, et a été présenté dans l'article « BART: Denoising Sequence-to-Sequence Pre-training for Natural Language Generation, Translation, and Comprehension » lors de la réunion annuelle 2020 de l'Association for Computational Linguistics (ACL). Le modèle a été publié en logiciel open source, avec des implémentations disponibles dans la bibliothèque Fairseq. La publication initiale incluait des modèles pré-entraînés pour l'anglais, avec des variantes de base et large, et a ensuite été étendue à des versions multilingues telles que mBART.

Le développement de BART a été motivé par l'observation que les méthodes de pré-entraînement existantes étaient souvent spécialisées soit pour les tâches de compréhension (comme BERT), soit pour les tâches de génération (comme GPT). BART visait à combiner les forces des deux en utilisant une architecture séquence-à-séquence pouvant être affinée pour une large gamme d'applications. Les fonctions de bruit utilisées pendant le pré-entraînement ont été conçues pour imiter divers types de corruption qui se produisent dans le texte du monde réel, rendant le modèle robuste aux entrées bruitées.

Applications et performances

BART a obtenu des résultats de pointe sur plusieurs références au moment de sa publication. Il a particulièrement bien performé sur le dialogue abstractif, la réponse aux questions et les tâches de résumé. Par exemple, sur le jeu de données de résumé CNN/DailyMail, BART-large a atteint un score ROUGE-1 de 47,6, surpassant les modèles précédents. Sur le jeu de données de réponse aux questions SQuAD, il a atteint un score F1 de 94,6, égalant ou dépassant les performances de modèles spécialisés. BART a également montré de fortes performances sur les tâches de génération de langage naturel telles que la génération de réponses dans les systèmes de dialogue.

L'un des principaux avantages de BART est sa capacité à être affiné pour des tâches de compréhension et de génération avec des modifications minimales spécifiques à la tâche. Pour les tâches de classification, la même représentation du décodeur est utilisée, tandis que pour les tâches de génération, le décodeur est utilisé pour produire des séquences de sortie. Cette polyvalence a fait de BART un choix populaire pour les praticiens dans le domaine de l'intelligence artificielle et du apprentissage automatique.

Influence et héritage

BART a eu une influence significative sur les recherches ultérieures en pré-entraînement pour le traitement du langage naturel. Son approche d'autoencodeur débruteur a inspiré des modèles ultérieurs tels que T5, qui utilise également un cadre texte-à-texte, et diverses autres méthodes de pré-entraînement basées sur le débruitage. Le concept de corrompre le texte d'entrée et de le reconstruire est devenu une technique standard dans le développement des grands modèles de langage. L'architecture et la méthodologie d'entraînement de BART sont également utilisées dans de nombreuses applications spécifiques à un domaine, telles que le résumé de textes biomédicaux et le traitement de documents juridiques.

Le succès du modèle a contribué à la tendance plus large d'utilisation de modèles basés sur les transformeurs dans la recherche en apprentissage profond et en réseaux de neurones. Il a démontré que les architectures séquence-à-séquence pouvaient être efficacement pré-entraînées sur de grands corpus puis adaptées à une grande variété de tâches, ouvrant la voie à des modèles plus unifiés dans le domaine. La publication open source de BART a également facilité son adoption dans les milieux académiques et industriels, de nombreuses entreprises l'intégrant dans leurs pipelines de traitement du langage naturel.

Détails techniques

BART utilise une architecture de transformeur standard avec un encodeur bidirectionnel et un décodeur autorégressif. Le modèle de base a 6 couches dans l'encodeur et le décodeur, avec une taille cachée de 768 et 12 têtes d'attention, totalisant environ 140 millions de paramètres. Le modèle large a 12 couches, une taille cachée de 1024 et 16 têtes d'attention, totalisant environ 400 millions de paramètres. Les données de pré-entraînement consistaient en du texte provenant de Wikipédia en anglais et de livres, similaires aux données utilisées pour BERT.

Les fonctions de bruit utilisées dans BART incluent le masquage de jetons, où des jetons aléatoires sont remplacés par un jeton de masque ; la suppression de jetons, où des jetons aléatoires sont retirés ; le remplissage de texte, où des segments de texte sont remplacés par un seul jeton de masque ; la permutation de phrases, où les phrases sont mélangées ; et la rotation de documents, où le document est pivoté pour commencer à un jeton aléatoire. Le modèle est entraîné à reconstruire le texte original à partir de la version corrompue, ce qui le force à apprendre à la fois les dépendances locales et globales dans le texte.

Voir aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:natural-language-processing·transformer-models·pretraining·sequence-to-sequence
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique