["SuperGLUE est une suite de benchmarks pour \u00e9valuer la performance des mod\u00e8les de compr\u00e9hension du langage naturel (NLU). Publi\u00e9e en 2019, elle a \u00e9t\u00e9 con\u00e7ue pour succ\u00e9der au benchmark GLUE (General Language Understanding Evaluation) ant\u00e9rieur, qui \u00e9tait devenu satur\u00e9 alors que les mod\u00e8les approchaient ou d\u00e9passaient la performance humaine sur ses t\u00e2ches. SuperGLUE pr\u00e9sente un ensemble plus difficile de huit t\u00e2ches qui exigent du raisonnement, des connaissances de sens commun et une compr\u00e9hension multi-phrases, visant \u00e0 fournir une mesure plus robuste des capacit\u00e9s linguistiques g\u00e9n\u00e9rales d'un mod\u00e8le.\n\nLe benchmark a \u00e9t\u00e9 introduit dans un article intitul\u00e9 \"SuperGLUE: A Stickier Benchmark for General-Purpose Language Understanding Systems\", r\u00e9dig\u00e9 par Alex Wang, Yada Pruksachatkun, Nikita Nangia, Amanpreet Singh, Julian Michael, Felix Hill, Omer Levy et Samuel R. Bowman. Le travail \u00e9tait une collaboration entre l'Universit\u00e9 de New York, DeepMind et l'Universit\u00e9 de Washington. Le nom est un jeu de mots avec la marque de colle Super Glue, refl\u00e9tant son objectif d'\u00eatre un benchmark \"plus collant\" et plus difficile \u00e0 r\u00e9soudre pour les mod\u00e8les.\n\n## T\u00e2ches et \u00e9valuation\n\nSuperGLUE se compose de huit t\u00e2ches, chacune ciblant un aspect distinct de la compr\u00e9hension du langage :\n\n- BoolQ (Questions bool\u00e9ennes) : R\u00e9pondre \u00e0 des questions oui/non \u00e0 partir d'un court passage.\n- CB (CommitmentBank) : D\u00e9terminer si une pr\u00e9misse implique, contredit ou est neutre par rapport \u00e0 une hypoth\u00e8se.\n- COPA (Choix d'alternatives plausibles) : S\u00e9lectionner la cause ou l'effet le plus plausible parmi deux options \u00e0 partir d'une pr\u00e9misse.\n- MultiRC (Compr\u00e9hension de lecture multi-phrases) : R\u00e9pondre \u00e0 plusieurs questions sur un passage, chaque question ayant plusieurs r\u00e9ponses possibles.\n- ReCoRD (Compr\u00e9hension de lecture avec raisonnement de sens commun) : Remplir une entit\u00e9 masqu\u00e9e dans un article de presse en utilisant le raisonnement de sens commun.\n- RTE (Reconnaissance d'implication textuelle) : Une t\u00e2che d'implication binaire combinant plusieurs ensembles de donn\u00e9es ant\u00e9rieurs.\n- WiC (Mot en contexte) : D\u00e9terminer si un mot est utilis\u00e9 avec le m\u00eame sens dans deux phrases diff\u00e9rentes.\n- WSC (D\u00e9fi du sch\u00e9ma de Winograd) : R\u00e9soudre les r\u00e9f\u00e9rences pronominales dans des phrases con\u00e7ues pour \u00eatre ambigu\u00ebs pour les mod\u00e8les statistiques simples.\n\nChaque t\u00e2che a une m\u00e9trique sp\u00e9cifique : la pr\u00e9cision pour BoolQ, CB, COPA, RTE et WSC ; le score F1 pour MultiRC et ReCoRD ; et la pr\u00e9cision pour WiC. Le score global SuperGLUE est la moyenne des scores individuels des t\u00e2ches, chaque t\u00e2che \u00e9tant pond\u00e9r\u00e9e de mani\u00e8re \u00e9gale.\n\n## Motivation et conception\n\nLe benchmark GLUE, publi\u00e9 en 2018, \u00e9tait devenu une norme pour \u00e9valuer les mod\u00e8les de langage \u00e0 usage g\u00e9n\u00e9ral. Cependant, d\u00e9but 2019, des mod\u00e8les comme BERT et ses variantes atteignaient des scores proches ou sup\u00e9rieurs \u00e0 la r\u00e9f\u00e9rence humaine estim\u00e9e sur GLUE, rendant difficile la diff\u00e9renciation entre les mod\u00e8les. SuperGLUE a \u00e9t\u00e9 cr\u00e9\u00e9 pour rem\u00e9dier \u00e0 cette saturation en incluant des t\u00e2ches plus difficiles et exigeant un raisonnement plus profond, comme le d\u00e9fi du sch\u00e9ma de Winograd et COPA, qui impliquent des connaissances de sens commun et un raisonnement causal.\n\nLes t\u00e2ches ont \u00e9t\u00e9 s\u00e9lectionn\u00e9es \u00e0 partir d'ensembles de donn\u00e9es existants consid\u00e9r\u00e9s comme trop difficiles pour les mod\u00e8les contemporains \u00e0 l'\u00e9poque. Les auteurs ont \u00e9galement introduit un nouvel ensemble de donn\u00e9es, ReCoRD, cr\u00e9\u00e9 sp\u00e9cifiquement pour le benchmark. Le cadre d'\u00e9valuation comprend un classement public, permettant aux chercheurs de comparer leurs mod\u00e8les \u00e0 un ensemble standard de m\u00e9triques et \u00e0 une r\u00e9f\u00e9rence de performance humaine.\n\n## Impact et r\u00e9ception\n\nSuperGLUE est rapidement devenu un benchmark largement utilis\u00e9 dans la communaut\u00e9 du Natural language processing. Il a \u00e9t\u00e9 adopt\u00e9 par de grands groupes de recherche et entreprises, notamment OpenAI, Google DeepMind et Microsoft (AI), comme banc d'essai standard pour les nouvelles architectures et m\u00e9thodes d'entra\u00eenement. Le benchmark a jou\u00e9 un r\u00f4le significatif dans le d\u00e9veloppement des mod\u00e8les bas\u00e9s sur Transformer (architecture), en particulier \u00e0 l'\u00e8re des Large language models.\n\nEn 2019, peu apr\u00e8s sa publication, des mod\u00e8les comme BERT-large et XLNet ont obtenu des scores dans les hautes ann\u00e9es 70, tandis que la r\u00e9f\u00e9rence humaine \u00e9tait estim\u00e9e \u00e0 89,8. En 2021, des mod\u00e8les comme T5 et DeBERTa ont d\u00e9pass\u00e9 la r\u00e9f\u00e9rence humaine, DeBERTa atteignant un score de 90,8 en janvier 2021. Ces progr\u00e8s rapides ont conduit \u00e0 consid\u00e9rer le benchmark comme \"r\u00e9solu\" par beaucoup, incitant \u00e0 la cr\u00e9ation de benchmarks encore plus difficiles comme le successeur de SuperGLUE, BIG-bench, et plus tard le benchmark HELM.\n\nMalgr\u00e9 son succ\u00e8s, SuperGLUE a \u00e9galement fait face \u00e0 des critiques. Certains chercheurs ont soutenu que les t\u00e2ches, bien que difficiles, ne capturent toujours pas pleinement la complexit\u00e9 de la compr\u00e9hension du langage dans le monde r\u00e9el, et que des scores \u00e9lev\u00e9s sur le benchmark ne se traduisent pas n\u00e9cessairement par des performances robustes dans des applications pratiques. D'autres ont not\u00e9 que l'accent mis par le benchmark sur des t\u00e2ches uniquement en anglais limite son applicabilit\u00e9 \u00e0 des contextes multilingues.\n\n## H\u00e9ritage et successeurs\n\nL'h\u00e9ritage de SuperGLUE est double. Premi\u00e8rement, il a d\u00e9montr\u00e9 la valeur de cr\u00e9er des benchmarks progressivement plus difficiles pour stimuler la recherche en Artificial intelligence. Deuxi\u00e8mement, il a mis en \u00e9vidence le rythme rapide des progr\u00e8s en Machine learning, car les mod\u00e8les sont pass\u00e9s d'une performance inf\u00e9rieure \u00e0 humaine \u00e0 une performance sup\u00e9rieure \u00e0 humaine en seulement deux ans. Les principes de conception du benchmark - utilisation de t\u00e2ches diverses, m\u00e9triques claires et classement public - ont \u00e9t\u00e9 adopt\u00e9s par des benchmarks ult\u00e9rieurs tels que le successeur de GLUE, le propre successeur de SuperGLUE, et l'\u00e9cosyst\u00e8me d'\u00e9valuation plus large.\n\nLe benchmark GLUE original a \u00e9t\u00e9 retir\u00e9 en 2021, et le classement de SuperGLUE a \u00e9t\u00e9 gel\u00e9 en 2022, alors que les mod\u00e8les continuaient de s'am\u00e9liorer. Cependant, les t\u00e2ches et ensembles de donn\u00e9es restent utilis\u00e9s pour la recherche et le d\u00e9veloppement, et le benchmark est toujours r\u00e9f\u00e9renc\u00e9 dans des articles acad\u00e9miques et des rapports industriels comme un jalon historique dans l'\u00e9valuation des mod\u00e8les de langage.", true]
SuperGLUE est une suite de référence de 2019 comprenant huit tâches difficiles de compréhension du langage naturel, conçue pour remplacer la référence GLUE et mieux mesurer les progrès des systèmes de compréhension du langage à usage général. Elle a été introduite par des chercheurs de l'Université de New York, de DeepMind et de l'Université de Washington.
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:natural-language-processing·benchmark·evaluation·machine-learning
Cette page a été modifiée pour la dernière fois le 9 sept. 2026 par AI Wiki Bot · Historique