CLUE (Chinese Language Understanding Evaluation) est une suite de références conçue pour évaluer les performances des modèles de compréhension du langage naturel sur des textes chinois. Introduite en 2020, elle fournit un ensemble standardisé de tâches qui évaluent la capacité d'un modèle à traiter divers aspects du traitement du langage chinois, notamment la classification de textes, l'inférence en langage naturel et la compréhension de lecture. CLUE est devenue un point de référence largement adopté pour les chercheurs et développeurs travaillant sur des modèles chinois de traitement du langage naturel, comparable au rôle de GLUE et SuperGLUE pour l'anglais.
La référence a été créée pour combler le manque d'outils d'évaluation complets pour le chinois, qui possède des caractéristiques linguistiques uniques telles que l'absence de frontières de mots et un système riche de caractères et d'idiomes. CLUE agrège plusieurs ensembles de données, chacun ciblant une compétence spécifique de compréhension du langage, et fournit un classement pour suivre les progrès des modèles au fil du temps. Elle a joué un rôle déterminant dans l'amélioration des grands modèles de langage chinois et d'autres approches de apprentissage profond.
Composition des tâches
CLUE se compose de neuf tâches distinctes, chacune dérivée d'ensembles de données NLP chinois existants. Ces tâches couvrent une gamme de difficultés et de phénomènes linguistiques. Les tâches principales incluent :
- TNEWS : Une tâche de classification de textes courts basée sur des titres de presse, exigeant des modèles qu'ils catégorisent le texte en 15 classes thématiques.
- IFLYTEK : Une tâche de classification de textes longs avec 119 catégories, issue de descriptions d'applications générées par les utilisateurs, testant la capacité à gérer des textes bruités et informels.
- CMNLI : Une tâche d'inférence en langage naturel où les modèles doivent déterminer si une hypothèse implique, contredit ou est neutre par rapport à une prémisse, basée sur le corpus chinois Multi-Genre NLI.
- OCNLI : Une autre tâche d'inférence, dérivée de l'ensemble de données Original Chinese NLI, se concentrant sur des scénarios de raisonnement plus difficiles.
- CLUEWSC2020 : Une tâche de résolution de coréférence basée sur des phrases de type Winograd Schema, exigeant un raisonnement de sens commun pour résoudre les références pronominales.
- CSL : Une tâche de reconnaissance de mots-clés où les modèles identifient si un mot-clé donné est présent dans un résumé d'article scientifique, testant la compréhension spécifique au domaine.
- DRCD : Une tâche de compréhension de lecture avec réponse à des questions extractives, basée sur la version chinoise de l'ensemble de données de type SQuAD.
- CMRC2018 : Une autre tâche de compréhension de lecture, se concentrant sur l'extraction de segments dans des passages chinois.
- CHID : Une tâche de type texte à trous où les modèles sélectionnent l'idiome correct parmi un ensemble de candidats pour remplir un vide, testant la connaissance des idiomes chinois.
Chaque tâche est conçue pour sonder différentes capacités, de la classification de base au raisonnement complexe, fournissant une évaluation holistique de la compréhension du chinois par un modèle.
Score et classement
CLUE fournit un mécanisme de notation unifié, chaque tâche ayant une métrique spécifique. Pour les tâches de classification, la précision est utilisée ; pour les tâches d'inférence, la précision est également la métrique principale ; pour la compréhension de lecture, le score F1 et la correspondance exacte sont rapportés. Le score global CLUE est calculé comme la moyenne des scores individuels des tâches, permettant une comparaison directe entre les modèles. Le classement officiel, hébergé sur le site Web de CLUE, classe les soumissions en fonction de ce score moyen, encourageant un développement compétitif.
Depuis son introduction, le classement a connu une amélioration constante. Les premiers modèles basés sur des architectures transformers comme BERT ont obtenu des scores dans la plage de 60 à 70, tandis que les grands modèles de langage plus récents ont poussé les scores au-dessus de 90, reflétant des avancées significatives dans le NLP chinois. La référence a également été mise à jour avec des tâches supplémentaires, telles que CLUE-ABSA pour l'analyse de sentiments basée sur les aspects, afin de suivre le rythme des besoins de recherche en évolution.
Impact et utilisation
CLUE a eu un impact substantiel sur la communauté NLP chinoise. Elle sert d'outil d'évaluation standard pour la recherche académique, de nombreux articles rapportant des résultats sur les tâches CLUE pour démontrer l'efficacité des modèles. Elle est également utilisée dans l'industrie pour comparer les modèles commerciaux et guider le développement de produits. Par exemple, les entreprises technologiques et les institutions de recherche chinoises utilisent fréquemment CLUE pour valider leurs modèles propriétaires avant leur déploiement.
La référence a également stimulé le développement d'architectures de modèles et de techniques d'entraînement spécifiques au chinois. Par exemple, des modèles comme RoBERTa-wwm-ext et ERNIE, qui intègrent le masquage de mots entiers et un pré-entraînement amélioré par connaissances, ont été optimisés en tenant compte de CLUE. Les tâches ont également mis en évidence l'importance de gérer les défis spécifiques au chinois, tels que la granularité de la tokenisation et l'utilisation d'idiomes, conduisant à des innovations en tokenisation et en augmentation de données.
Limites et critiques
Malgré sa popularité, CLUE a fait face à des critiques. Certains chercheurs soutiennent que les tâches sont relativement étroites et ne capturent pas pleinement la complexité de la compréhension du langage chinois dans le monde réel. La référence se concentre principalement sur des tâches de classification et extractives, avec une couverture limitée des tâches génératives comme le résumé ou le dialogue. De plus, les ensembles de données peuvent contenir des biais ou des artefacts que les modèles peuvent exploiter, conduisant à des scores gonflés qui ne reflètent pas une véritable généralisation.
Une autre limite est la nature statique de la référence. À mesure que les modèles s'améliorent, les tâches peuvent devenir saturées, rendant difficile la différenciation entre les systèmes les plus performants. Pour remédier à cela, l'équipe CLUE a périodiquement introduit de nouvelles tâches et des versions plus difficiles, mais le rythme de développement des modèles dépasse souvent ces mises à jour. Certains ont également noté que le classement encourage le surapprentissage sur les ensembles de données spécifiques, plutôt que de favoriser des modèles robustes et généralisables.
Orientations futures
L'avenir de CLUE implique probablement une expansion vers des tâches plus diverses et plus difficiles, y compris la compréhension générative et le dialogue multi-tours. Il y a également une poussée vers des références plus dynamiques qui peuvent s'adapter aux capacités des modèles, similaire aux efforts comme SuperGLUE pour l'anglais. Alors que les grands modèles de langage chinois continuent d'évoluer, CLUE devra évoluer avec eux, garantissant qu'elle reste une norme d'évaluation pertinente et rigoureuse pour la communauté.