GLUE (General Language Understanding Evaluation) est une suite de benchmarks introduite en 2018 par des chercheurs de l'Université de New York, de l'Université de Washington et de DeepMind. Elle a été conçue pour évaluer et comparer les modèles d'apprentissage automatique sur un ensemble diversifié de tâches de compréhension du langage naturel (NLU), dans le but d'encourager le développement de modèles polyvalents capables de gérer plusieurs tâches sans ingénierie spécifique à chaque tâche. Le benchmark est rapidement devenu un point de référence standard dans le domaine de l'intelligence artificielle et du apprentissage automatique, en particulier pour la recherche sur l'apprentissage profond et les réseaux de neurones.
Le benchmark se compose de neuf tâches couvrant trois catégories principales : les tâches à phrase unique, les tâches de similarité et de paraphrase, et les tâches d'inférence. Les tâches à phrase unique incluent CoLA (Corpus of Linguistic Acceptability), qui teste l'acceptabilité grammaticale, et SST-2 (Stanford Sentiment Treebank), qui teste l'analyse des sentiments. Les tâches de similarité et de paraphrase incluent MRPC (Microsoft Research Paraphrase Corpus), QQP (Quora Question Pairs) et STS-B (Semantic Textual Similarity Benchmark). Les tâches d'inférence incluent MNLI (Multi-Genre Natural Language Inference), QNLI (Question Natural Language Inference), RTE (Recognizing Textual Entailment) et WNLI (Winograd Natural Language Inference). Chaque tâche possède sa propre métrique d'évaluation, comme la précision, le score F1 ou la corrélation de Pearson, et le score GLUE global est la moyenne de ces métriques sur l'ensemble des tâches.
Histoire et motivation
GLUE a été introduit dans un article de 2018 intitulé « GLUE : A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding » par Alex Wang, Amanpreet Singh, Julian Michael, Felix Hill, Omer Levy et Samuel R. Bowman. Les auteurs ont soutenu que les benchmarks existants étaient souvent trop étroits et permettaient aux modèles de surajuster à des ensembles de données spécifiques. GLUE visait à fournir une évaluation plus complète en incluant des tâches nécessitant différents types de connaissances linguistiques, telles que la syntaxe, la sémantique et le bon sens. Le benchmark incluait également un classement public, permettant aux chercheurs de comparer leurs modèles de manière transparente.
L'introduction de GLUE a coïncidé avec une période de progrès rapide dans les grands modèles de langage. Peu après sa sortie, les modèles basés sur l'architecture transformeur, tels que BERT (Bidirectional Encoder Representations from Transformers) de Google, ont commencé à dominer le classement. Le succès de BERT sur GLUE a contribué à populariser le paradigme de pré-entraînement et de réglage fin, où un modèle est d'abord entraîné sur un grand corpus de texte puis adapté à des tâches spécifiques. Cette approche est devenue fondamentale pour les modèles ultérieurs développés par des organisations comme OpenAI, Anthropic et Google DeepMind.
Tâches et évaluation
Les neuf tâches de GLUE ont été sélectionnées pour couvrir une gamme de difficultés et de phénomènes linguistiques. CoLA, par exemple, exige que les modèles jugent si une phrase est grammaticalement acceptable, ce qui teste les connaissances syntaxiques. SST-2 implique une classification binaire des sentiments à partir de critiques de films. MRPC et QQP sont des tâches de détection de paraphrase, où les modèles doivent déterminer si deux phrases ont le même sens. STS-B est une tâche de régression qui évalue la similarité sémantique sur une échelle de 0 à 5.
Pour les tâches d'inférence, MNLI est la plus grande, avec plus de 400 000 paires de phrases couvrant plusieurs genres, nécessitant des modèles pour classer l'implication, la contradiction ou la neutralité. QNLI est une tâche de question-réponse reformulée comme une tâche d'implication, où le modèle doit déterminer si une phrase contient la réponse à une question. RTE est une tâche d'implication plus petite dérivée de sources d'actualités et de Wikipédia. WNLI est une tâche de résolution de pronoms basée sur le Winograd Schema Challenge, mais elle s'est avérée ultérieurement défectueuse en raison d'un problème de fuite de données, et de nombreux modèles n'ont obtenu que des performances aléatoires sur celle-ci.
Les métriques d'évaluation varient : CoLA utilise la corrélation de Matthews, SST-2 et QNLI utilisent la précision, MRPC et QQP utilisent le score F1, STS-B utilise les corrélations de Pearson et de Spearman, et MNLI, RTE et WNLI utilisent la précision. Le score GLUE final est la moyenne de ces métriques, chaque tâche étant pondérée de manière égale.
Impact et limites
GLUE a eu un impact significatif sur le domaine en fournissant un benchmark commun pour comparer les modèles. Il a contribué à stimuler les recherches en traitement du langage naturel, et son classement est devenu une arène compétitive pour les laboratoires académiques et industriels. Le benchmark a également facilité le développement d'approches d'apprentissage multi-tâches et a contribué à l'essor du transfert d'apprentissage en TALN.
Cependant, GLUE a également fait l'objet de critiques. Certains chercheurs ont noté que le benchmark pouvait être contourné par des modèles mémorisant des motifs dans les données d'entraînement plutôt que de véritablement comprendre le langage. La tâche WNLI était particulièrement problématique, car il a été découvert plus tard que l'ensemble de test contenait des exemples mal alignés avec les données d'entraînement, rendant presque impossible pour les modèles d'obtenir de bons résultats. En réponse, l'équipe GLUE a publié une version révisée appelée SuperGLUE en 2019, qui incluait des tâches plus difficiles et corrigeait certains de ces problèmes.
Impact et limites
GLUE a eu un impact significatif sur le domaine en fournissant un benchmark commun pour comparer les modèles. Il a contribué à stimuler les progrès en recherche en traitement du langage naturel, et son classement est devenu une arène compétitive pour les laboratoires académiques et industriels. Le benchmark a également facilité le développement d'approches d'apprentissage multi-tâches et a contribué à l'essor du transfert d'apprentissage en TALN.
Cependant, GLUE a aussi été critiqué. Certains chercheurs ont noté que le benchmark pouvait être contourné par des modèles mémorisant des motifs dans les données d'entraînement plutôt que de comprendre véritablement le langage. La tâche WNLI était particulièrement problématique, car il a été découvert plus tard que l'ensemble de test contenait des exemples mal alignés avec les données d'entraînement, rendant presque impossible pour les modèles d'obtenir de bons résultats. En réponse, l'équipe GLUE a publié une version révisée appelée SuperGLUE en 2019, qui incluait des tâches plus difficiles et corrigeait certains de ces problèmes.
Impact et limites
GLUE a eu un impact significatif sur le domaine en fournissant un benchmark commun pour comparer les modèles. Il a contribué à stimuler les améliorations dans la recherche en traitement du langage naturel, et son classement est devenu une arène compétitive pour les laboratoires académiques et industriels. Le benchmark a également facilité le développement d'approches d'apprentissage multi-tâches et a contribué à l'essor du transfert d'apprentissage en TALN.
Cependant, GLUE a également fait l'objet de critiques. Certains chercheurs ont noté que le benchmark pouvait être contourné par des modèles mémorisant des motifs dans les données d'entraînement plutôt que de véritablement comprendre le langage. La tâche WNLI était particulièrement problématique, car il a été découvert plus tard que l'ensemble de test contenait des exemples mal alignés avec les données d'entraînement, rendant presque impossible pour les modèles d'obtenir de bonnes performances. En réponse, l'équipe GLUE a publié une version révisée appelée SuperGLUE en 2019, qui incluait des tâches plus difficiles et corrigeait certains de ces problèmes.
Héritage et successeurs
Malgré ses limites, GLUE reste un benchmark largement cité et est souvent utilisé comme référence pour évaluer de nouveaux modèles. Son successeur, SuperGLUE, a introduit des tâches nécessitant un raisonnement plus complexe, telles que l'inférence multi-phrases et la compréhension de lecture. Les deux benchmarks ont influencé l'évaluation des systèmes de IA générative, bien que de nouveaux benchmarks comme MMLU et HELLASWAG aient émergé pour aborder des capacités plus larges.
Le design de GLUE a également inspiré des benchmarks similaires dans d'autres domaines, comme XGLUE pour la compréhension multilingue et CLUE pour le chinois. L'accent mis sur l'évaluation multi-tâches est devenu une pratique standard dans le domaine, et son modèle de classement public a été adopté par de nombreux efforts ultérieurs.
Voir aussi
- apprentissage automatique
- apprentissage profond
- réseau de neurones
- grand modèle de langage
- OpenAI
- Google DeepMind
Références
- Wang, A., Pruksachatkun, Y., Nangia, N., Singh, A., Michael, J., Hill, F., Levy, O., & Bowman, S. R. (2018). GLUE : A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding. arXiv preprint arXiv:1804.07461.
- Wang, A., Pruksachatkun, Y., Nangia, N., Singh, A., Michael, J., Hill, F., ... & Bowman, S. R. (2019). SuperGLUE : A Stickier Benchmark for General-Purpose Language Understanding Systems. arXiv preprint arXiv:1905.00537.