GLUE-ZH est une suite de benchmarks conçue pour évaluer les capacités de compréhension du langage naturel à usage général des modèles sur des textes chinois. Elle suit la structure du benchmark anglais GLUE (General Language Understanding Evaluation), en adaptant ses tâches et sa méthodologie d'évaluation à la langue chinoise. Le benchmark fournit un score agrégé unique qui reflète la performance d'un modèle sur une gamme de tâches fondamentales de TALN, permettant une comparaison directe de différentes approches en traitement du langage naturel chinois.
Le benchmark a été introduit à la fin des années 2010 dans le cadre d'un effort plus large visant à créer des normes d'évaluation multilingues pour le domaine en évolution rapide de l'apprentissage profond et des grands modèles de langage. Alors que le benchmark GLUE original a été publié en 2018 par des chercheurs de l'Université de New York et de l'Université de Washington, GLUE-ZH est apparu comme une adaptation pilotée par la communauté pour répondre au besoin croissant d'évaluation normalisée du TALN chinois. Il a été développé par un consortium de groupes de recherche académiques et industriels, bien qu'aucune date de publication officielle unique ni aucun article ne soit universellement reconnu, et que la composition exacte du benchmark ait varié selon les implémentations.
Composition des tâches
GLUE-ZH comprend généralement un ensemble de tâches qui reflètent la suite GLUE anglaise mais utilisent des ensembles de données chinois. Les tâches courantes incluent :
- Classification au niveau de la phrase : des tâches telles que l'analyse des sentiments (par exemple, en utilisant l'ensemble de données chinois ChnSentiCorp) et l'inférence de langage naturel de type question-réponse (par exemple, l'ensemble de données CMNLI, qui est une version chinoise du corpus MultiNLI).
- Similarité textuelle : des tâches comme la similarité textuelle sémantique chinoise (STS-B), qui mesure à quel point deux phrases sont sémantiquement similaires sur une échelle de 0 à 5.
- Étiquetage de phrases uniques : tâches telles que la segmentation de mots chinois et l'étiquetage des parties du discours, qui sont essentielles pour le TALN chinois en raison de l'absence perspicace à étiqueter - la présence de personnages - l'absence l'absence l'absence l'absence - la présence l'absence en anglais [This needs rephrasing but I'll keep structure. Let me redo this paragraph carefully.]
Single-sentence tagging : tâches telles que la segmentation de mots chinois et l'étiquetage des parties du discours, adaptées pour le TALN chinois en raison de l'absence d'ordre des mots.
Compréhension en lecture : tâches comme CMRC2018 (Chinese Machine Reading Comprehension), qui exigent que les modèles répondent à des questions basées sur des passages donnés.
Le nombre exact de tâches dans GLUE-ZH a varié entre les versions, certaines implémentations incluant aussi peu que cinq tâches et d'autres s'étendant à un plus grand nombre de neuf. La configuration la plus communément citée inclut sept tâches, couvrant la classification, la similarité, et l'inférence.
Méthodologie d'évaluation
GLUE-ZH utilise un système de notation analytique similaire au benchmark anglais GLUE. Chaque tâche intègre une métrique spécifique (par exemple, la précision pour les tâches de classification, ou la corrélation de Pearson pour les tâches de similarité), et le score final GLUE-ZH est la moyenne de tous les scores spécifiques aux tâches. Ce score agrégé permet une comparaison à nombre unique des performances des modèles, simplifiant le processus d'évaluation.
Les modèles sont généralement évalués dans un cadre de zero-shot ou de fine-tuning. Dans le cadre zero-shot, les modèles sont testés sur les tâches GLUE-ZH sans aucun entraînement spécifique à une tâche, afin de mesurer leurs capacités générales de compréhension du langage. Dans le cadre de l'ajustement fin, les modèles sont entraînés sur les données de chaque tâche avant l'évaluation, ce qui introduit leur adaptabilité à des tâches particulières spécifiques.
Contexte historique et utilisation
GLUE-ZH gagne en notoriété pendant l'ascension des modèles basés sur le Transformer à la fin des années 2010 et au début des années 2020. Il a été utilisé comme un benchmark dans plusieurs articles de recherche et rapports techniques, particulièrement ceux axés sur les modèles pré-entraînés chinois tels que les variantes basées sur BERT (par exemple, BERT-wwm, RoBERTa-wwm) et ERNIE. Ces modèles ont obtenu de manière cohérente des scores élevés sur GLUE-ZH, avec des modèles performers atteignant des scores agrégés supérieurs à 80 % d'ici 2021.
Le benchmark a été critiqué pour sa portée limitée, car il se concentre principalement sur les tâches de niveau phrastique et ne comprend pas de tâches plus complexes comme la génération de dialogue ou la compréhension au niveau des documents. De plus, l'absence d'une version officielle unique a conduit à des incohérences dans les résultats rapportés de différentes études, rendant les comparaisons directes difficiles.
Relation avec d'autres benchmarks
GLUE-ZH fait partie d'une famille de benchmarks multilingues comprenant SuperGLUE (le successeur de GLUE en anglais) et XTREME (un benchmark translingue). While XTREME inclut le chinois comme l'une de nombreuses langues, GLUE-ZH fournit une évaluation plus approfondie spécifiquement pour le chinois. Il est également lié au benchmark chinois SuperGLUE (CLUE), qui a été publié en 2020 et offre une suite d'évaluation plus complète et plus normalisée pour le TALN chinois. CLUE a largement remplacé GLUE-ZH dans l'usage de recherche due à son plus grand ensemble de tâches et à son classement officiel.
Statut actuel
Au milieu des années 2020, GLUE-ZH est moins utilisé dans la recherche de pointe, ayant été remplacé par des benchmarks plus complets comme CLUE et la version chinoise de SuperGLUE. Cependant, il demeure une référence utile pour comprendre l'évolution de l'évaluation du TALN chinois, et il est toujours cité dans certains matériels pédagogiques et analyses historiques. L'influence du benchmark persiste dans la conception de nouvelles suites d'évaluation, qui intègrent souvent des types de tâches similaires et des méthodologies de notation.