Le Corpus of Linguistic Acceptability (CoLA) est un ensemble de données de référence conçu pour évaluer la capacité des réseaux de neurones artificiels, y compris les grands modèles de langage, à juger si des phrases anglaises sont grammaticalement correctes. Il contient 10 657 phrases tirées de la littérature linguistique publiée, chacune étant étiquetée manuellement comme grammaticale ou non grammaticale. L'ensemble de données sert de test standard pour mesurer la sensibilité d'un modèle à la bonne formation syntaxique, une tâche distincte de la compréhension sémantique ou du rappel factuel.
CoLA a été introduit pour répondre au besoin d'une ressource vaste et fiable pour sonder les connaissances linguistiques des systèmes d'apprentissage automatique. Ses phrases couvrent un large éventail de phénomènes syntaxiques, notamment l'accord sujet-verbe, les contraintes d'îlots et la structure argumentale, ce qui en fait un défi rigoureux pour les modèles entraînés principalement sur du texte naturel. Les étiquettes reflètent les jugements de locuteurs natifs issus de sources académiques, fournissant une vérité terrain cohérente pour l'acceptabilité.
Composition de l'ensemble de données
L'ensemble de données CoLA complet comprend 10 657 phrases, chacune associée à une étiquette binaire indiquant l'acceptabilité. Les phrases proviennent de recherches linguistiques publiées, garantissant qu'elles représentent des contrastes grammaticaux diversifiés et souvent subtils. La version publique de CoLA contient 9 594 phrases, réparties en ensembles d'entraînement et de développement. Les 1 063 phrases restantes sont réservées à un ensemble de test non publié, qui n'est pas rendu public pour éviter le surapprentissage et garantir une évaluation équitable.
Chaque phrase de l'ensemble de données est accompagnée de métadonnées, notamment sa publication source et le phénomène linguistique spécifique qu'elle illustre. Cette structure permet aux chercheurs d'analyser les performances du modèle à travers différentes catégories grammaticales. L'étiquetage binaire simplifie la tâche, mais la complexité inhérente des jugements d'acceptabilité signifie que même les annotateurs humains peuvent être en désaccord sur des cas limites, une nuance reflétée dans la conception de l'ensemble de données.
Rôle dans l'évaluation en TAL
CoLA est devenu un benchmark largement utilisé en traitement du langage naturel, en particulier pour évaluer les capacités linguistiques des modèles basés sur les transformeurs. Il est inclus dans le benchmark GLUE, une collection de tâches qui mesurent la compréhension générale du langage. Dans GLUE, CoLA teste le jugement grammatical d'un modèle, complétant des tâches comme l'analyse de sentiment et l'inférence textuelle. Les performances sur CoLA sont généralement rapportées via le coefficient de corrélation de Matthew, qui tient compte du déséquilibre entre les exemples grammaticaux et non grammaticaux.
Pour les grands modèles de langage tels que ceux développés par OpenAI, Anthropic et Google DeepMind, CoLA fournit une mesure contrôlée de la compétence syntaxique. Contrairement aux tâches génératives, CoLA exige des décisions binaires explicites, ce qui facilite l'isolation des connaissances grammaticales d'un modèle par rapport à sa fluidité. Cependant, les modèles obtiennent souvent de moins bons résultats sur CoLA que sur d'autres tâches GLUE, soulignant la difficulté de capturer des jugements d'acceptabilité nuancés.
Applications et limites
Les chercheurs utilisent CoLA pour comparer les capacités linguistiques de différentes architectures, y compris les réseaux de neurones et les systèmes de apprentissage profond. Il a été essentiel pour étudier si les modèles apprennent des règles grammaticales abstraites ou s'appuient sur des schémas statistiques dans les données d'entraînement. Des études ont montré que les performances sur CoLA corrèlent avec la taille du modèle et les données d'entraînement, mais même les systèmes les plus avancés peinent avec des constructions rares ou complexes.
Les limites de l'ensemble de données incluent sa dépendance à des phrases écrites et formelles issues de sources académiques, qui peuvent ne pas refléter l'usage quotidien du langage. De plus, le schéma d'étiquetage binaire simplifie à l'excès la nature graduelle de l'acceptabilité, car certaines phrases sont marginalement acceptables. Malgré ces contraintes, CoLA reste une référence standard pour évaluer le jugement grammatical dans la recherche en intelligence artificielle.
Benchmarks et extensions connexes
CoLA a inspiré des ensembles de données et des extensions similaires qui sondent d'autres aspects de la compétence linguistique. Par exemple, le benchmark BLiMP offre une gamme plus large de phénomènes syntaxiques avec des paires minimales, tandis que la suite SuperGLUE inclut des tâches plus difficiles. Ces ressources complètent CoLA en fournissant des diagnostics plus fins. La méthodologie de l'ensemble de données, qui exploite la littérature linguistique publiée, a été adoptée dans d'autres langues, bien que l'anglais reste le principal axe d'intérêt.
Au début des années 2020, CoLA continue d'être un outil d'évaluation standard dans la recherche académique et industrielle. Son intégration dans des benchmarks largement utilisés garantit sa pertinence continue, même à mesure que de nouveaux ensembles de données émergent. L'ensemble de test non publié, bien qu'inaccessible, encourage des rapports honnêtes et empêche le « gaming » des benchmarks, une pratique devenue de plus en plus importante dans le domaine.