MultiNLI, abréviation de Multi-Genre Natural Language Inference, est un corpus à grande échelle pour la recherche en inférence en langage naturel (NLI). Publié en 2017 par des chercheurs de l'Université de Stanford, il étend le jeu de données SNLI antérieur en incorporant des textes provenant de dix genres distincts, notamment la fiction, les documents gouvernementaux, les conversations téléphoniques et les guides de voyage. Le corpus est conçu pour évaluer la capacité d'un modèle à déterminer la relation logique entre une prémisse et une hypothèse, en la classant comme implication, contradiction ou neutralité.
Le jeu de données contient plus de 430 000 paires de phrases, ce qui en fait l'une des plus grandes ressources NLI à sa sortie. Chaque paire est étiquetée par des annotateurs humains, la prémisse étant tirée d'un texte source et l'hypothèse générée par des contributeurs en ligne. MultiNLI a constitué une référence clé pour la compréhension du langage naturel, poussant les modèles à généraliser à travers les domaines plutôt qu'à se spécialiser sur un seul style d'écriture.
Construction et annotation
MultiNLI a été construit par une équipe dirigée par Adina Williams, Nikita Nangia et Samuel Bowman à l'Université de Stanford. Les phrases de prémisse ont été échantillonnées à partir de dix genres : fiction, documents gouvernementaux, conversations téléphoniques, guides de voyage, lettres, rapports du 11 septembre, magazine Slate, transcriptions verbatim, discours en face à face et articles académiques. Cette diversité visait à tester la robustesse face au changement de domaine, un mode de défaillance courant dans les modèles NLI antérieurs.
Les hypothèses ont été générées par des contributeurs d'Amazon Mechanical Turk, à qui il était demandé d'écrire des phrases qui impliquaient, contredisaient ou étaient neutres par rapport à la prémisse. Chaque hypothèse a ensuite été validée par un second ensemble d'annotateurs, garantissant des étiquettes de haute qualité. Le jeu de données final a été divisé en ensembles d'entraînement, de développement et de test, les ensembles de développement et de test étant eux-mêmes subdivisés en conditions appariées et non appariées selon que les genres chevauchaient ou non les données d'entraînement.
Importance dans le traitement du langage naturel
MultiNLI est devenu une référence standard pour l'évaluation des modèles de compréhension du langage. Il a été inclus dans le benchmark GLUE, une collection de tâches conçues pour mesurer la compréhension générale du langage. Des modèles tels que BERT et ses successeurs ont obtenu des améliorations significatives sur MultiNLI, démontrant la valeur du pré-entraînement sur de grands corpus de textes. Le corpus a également influencé des jeux de données ultérieurs comme ANLI, axé sur les exemples adversariaux, et SuperGLUE, qui incluait des tâches NLI plus difficiles.
La conception multi-genres a mis en évidence l'importance de l'adaptation au domaine. Les modèles entraînés sur un seul genre obtenaient souvent de mauvais résultats sur des genres non vus, et MultiNLI a fourni un cadre contrôlé pour étudier ce problème. Il a également stimulé la recherche sur la généralisation inter-domaines, avec des méthodes comme l'entraînement adversarial par domaine et l'augmentation de données étant évaluées sur son ensemble de test non apparié.
Relation avec d'autres jeux de données NLI
MultiNLI s'appuie sur le corpus Stanford Natural Language Inference (SNLI), qui consiste en des légendes d'images. Alors que SNLI se limite à un seul genre, MultiNLI élargit la portée aux textes écrits et parlés. Les deux jeux de données sont souvent utilisés ensemble, SNLI servant de source de pré-entraînement et MultiNLI d'évaluation plus difficile. Plus tard, le jeu de données XNLI a étendu le NLI à plusieurs langues, et le jeu de données HANS a introduit une évaluation basée sur des heuristiques pour sonder les faiblesses des modèles.
MultiNLI partage également des principes de conception avec les tâches de Recognizing Textual Entailment (RTE) du défi PASCAL, qui utilisaient des jeux de données plus petits et annotés manuellement. L'échelle et la diversité des genres de MultiNLI en ont fait une ressource d'entraînement plus pratique pour les modèles modernes de Machine learning.
Impact et héritage
La publication de MultiNLI a coïncidé avec l'essor des modèles basés sur les transformeurs dans le apprentissage profond. Son inclusion dans GLUE a aidé à standardiser l'évaluation entre les groupes de recherche, accélérant les progrès en compréhension du langage naturel. Au début des années 2020, les modèles de pointe tels que les grands modèles de langage atteignent des performances proches de celles des humains sur MultiNLI, bien qu'ils rencontrent encore des difficultés avec les exemples adversariaux et hors distribution.
Le corpus a été largement cité dans la littérature académique et reste une référence pour la recherche en NLI. Sa méthodologie d'échantillonnage multi-genres a influencé les efforts de création de jeux de données ultérieurs, notamment pour la réponse à des questions et le raisonnement de sens commun. MultiNLI est disponible gratuitement pour la recherche et est hébergé sur des plateformes comme Hugging Face et le site web du benchmark GLUE.
Voir aussi
- intelligence artificielle
- traitement du langage naturel (si disponible)
- glue-benchmark (si disponible)
- SNLI (si disponible)
Références
- Williams, A., Nangia, N., & Bowman, S. (2018). A Broad-Coverage Challenge Corpus for Sentence Understanding through Inference. Proceedings of NAACL-HLT.
- Wang, A., et al. (2018). GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding. Proceedings of ICLR.