Traduit de l'anglais

RoBERTa est une variante robustement optimisée de BERT, introduite par Facebook AI en 2019, qui améliore le pré-entraînement grâce au masquage dynamique, à des lots plus grands et à la suppression de la prédiction de phrase suivante, obtenant des résultats de pointe sur les benchmarks de NLP.

RoBERTa (approche de pré-entraînement BERT robustement optimisée) est un modèle de langage introduit en 2019 par des chercheurs de Facebook AI. Il s'agit d'une variante de BERT qui modifie la procédure de pré-entraînement pour obtenir de meilleures performances sur les tâches de traitement du langage naturel en aval. RoBERTa conserve l'architecture de transformeur à encodeur uniquement de BERT, mais change des détails clés de l'entraînement, notamment le masquage dynamique, des tailles de lots plus grandes et la suppression de l'objectif de prédiction de phrase suivante. Ces ajustements conduisent à de meilleures représentations et à des scores plus élevés sur des références telles que GLUE et SQuAD.

Le modèle a été publié en tant que projet open source, avec des poids et un code mis à disposition de la communauté de recherche. RoBERTa est rapidement devenu une référence courante dans la recherche en TAL et a influencé des modèles ultérieurs comme XLNet et ALBERT. Son succès a souligné l'importance des hyperparamètres de pré-entraînement et de l'échelle des données dans les modèles de apprentissage profond.

Architecture

RoBERTa utilise la même architecture de transformeur à encodeur uniquement que BERT. Il se compose d'un tokeniseur, d'une couche d'intégration, d'une pile de blocs de transformeur et d'une tête de tâche pour le pré-entraînement. Le tokeniseur est WordPiece, avec une taille de vocabulaire de 30 000, et les jetons inconnus sont remplacés par un jeton spécial [UNK]. La couche d'intégration combine les intégrations de type de jeton, de position et de type de segment, qui sont additionnées et normalisées via LayerNorm pour produire un vecteur de 768 dimensions pour chaque jeton dans le modèle de base.

La pile d'encodeurs est paramétrée par le nombre de couches (L) et la taille cachée (H), avec des têtes d'auto-attention égales à H/64 et une taille de feed-forward de 4H. RoBERTa est disponible dans des configurations telles que base (12L/768H) et large (24L/1024H), correspondant aux tailles de BERT. Pour les tâches en aval, la tête de tâche est généralement remplacée par un module spécifique à la tâche, et le modèle est affiné, permettant un apprentissage par transfert efficace.

Différences d'entraînement

RoBERTa modifie le pré-entraînement de BERT de plusieurs manières. Le changement le plus notable est l'utilisation du masquage dynamique, où les jetons masqués sont générés à la volée pendant l'entraînement, plutôt que d'utiliser un masque statique appliqué une fois aux données. Cela augmente la diversité des exemples d'entraînement et aide le modèle à mieux généraliser. De plus, RoBERTa supprime la tâche de prédiction de phrase suivante (NSP), que BERT utilisait pour apprendre les relations entre phrases. Des études ont montré que NSP n'était pas nécessaire pour de bonnes performances, et sa suppression a simplifié l'objectif d'entraînement.

RoBERTa s'entraîne également avec des tailles de lots plus grandes et pendant plus d'étapes que BERT, en utilisant un corpus plus vaste qui inclut des données supplémentaires au-delà du BookCorpus et de Wikipedia d'origine. L'entraînement utilise un tokeniseur de codage par paires d'octets (BPE) au niveau des octets, qui gère les mots hors vocabulaire plus élégamment que WordPiece. Ces changements contribuent collectivement à l'amélioration des performances de RoBERTa.

Performance et impact

RoBERTa a obtenu des résultats de pointe sur plusieurs références au moment de sa publication. Sur le benchmark GLUE, il a surpassé BERT et d'autres modèles, atteignant un score de 88,5, contre 82,1 pour BERT. Sur SQuAD 2.0, il a atteint un score F1 de 89,4, dépassant les modèles précédents. Ces résultats ont démontré qu'une optimisation minutieuse du pré-entraînement peut produire des gains significatifs sans changements architecturaux.

Le succès du modèle a stimulé davantage de recherches sur les stratégies de pré-entraînement, conduisant à des développements comme GPT-3 et d'autres modèles à grande échelle. RoBERTa est également devenu un outil standard pour des tâches telles que la classification de texte, la réponse aux questions et la reconnaissance d'entités nommées. Sa disponibilité en open source a facilité son adoption généralisée dans le monde académique et industriel.

Applications

RoBERTa est utilisé dans une variété d'applications de traitement du langage naturel. Il sert de base pour l'analyse des sentiments, où il classe le texte comme positif ou négatif. Dans la réponse aux questions, il peut extraire des réponses de passages, comme démontré dans SQuAD. Il est également appliqué au résumé de texte, à l'inférence de langage et aux tâches de similarité sémantique. De nombreux systèmes de production, y compris ceux du service client et de la modération de contenu, ont intégré des modèles basés sur RoBERTa.

Parce que RoBERTa est un modèle pré-entraîné, il peut être affiné sur des ensembles de données spécifiques avec relativement peu d'exemples, ce qui le rend pratique pour des domaines avec des données étiquetées limitées. Sa robustesse et ses performances en ont fait un choix privilégié pour de nombreux pipelines de TAL, même à mesure que de nouveaux modèles ont émergé.

Héritage

RoBERTa a eu une influence durable sur le domaine du apprentissage automatique. Il a souligné l'importance de la dynamique d'entraînement et de la qualité des données, incitant les chercheurs à revoir les protocoles de pré-entraînement. Les principes de conception du modèle, tels que le masquage dynamique et la suppression des objectifs auxiliaires, ont été adoptés dans des modèles ultérieurs comme DeBERTa et ELECTRA. RoBERTa reste un point de référence pour évaluer de nouvelles méthodes de pré-entraînement et continue d'être utilisé dans la recherche et l'industrie en 2026.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:language-model·natural-language-processing·deep-learning·transformer
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique