QNLI, abréviation de Question Natural Language Inference, est un jeu de données de référence dans le domaine de l'intelligence artificielle et de l'apprentissage automatique. Il a été introduit dans le cadre du benchmark GLUE (General Language Understanding Evaluation), une collection de tâches conçue pour évaluer les performances des modèles sur divers défis de compréhension du langage naturel. Le jeu de données est dérivé du Stanford Question Answering Dataset (SQuAD), plus précisément de sa version v1.1, et transforme la tâche de réponse aux questions en un problème de classification binaire.
La tâche principale de QNLI consiste à déterminer si une phrase donnée contient la réponse à une question donnée. Chaque exemple comprend une question et une phrase, et le modèle doit classer la paire comme « entailment » (la phrase fournit la réponse) ou « not entailment » (la phrase ne la fournit pas). Cette formulation convertit la tâche originale de réponse extractive aux questions en un problème d'inférence en langage naturel, d'où son nom de Question Natural Language Inference.
Origine et construction
QNLI a été créé par l'équipe du laboratoire d'intelligence artificielle de Stanford dans le cadre du benchmark GLUE, publié en 2018. Le jeu de données a été construit en prenant des paires question-réponse de SQuAD v1.1 et en associant chaque question à des phrases du contexte correspondant. Pour chaque question, la phrase contenant la réponse correcte est étiquetée comme « entailment », tandis que les autres phrases du même contexte sont étiquetées comme « not entailment ». Ce processus aboutit à un jeu de données équilibré avec un nombre approximativement égal d'exemples positifs et négatifs.
Le jeu de données SQuAD original contient plus de 100 000 paires question-réponse basées sur des articles de Wikipédia. Pour QNLI, les créateurs ont sélectionné un sous-ensemble et l'ont reformaté, ce qui a donné environ 108 000 exemples d'entraînement et 5 700 exemples de validation. L'ensemble de test est réservé et utilisé pour le classement officiel de GLUE, qui suit les performances sur les neuf tâches du benchmark.
Définition de la tâche et évaluation
Dans QNLI, chaque entrée est une paire de segments de texte : une question et une phrase. Le modèle doit produire une étiquette binaire indiquant si la phrase implique la réponse à la question. La métrique d'évaluation est la précision, qui mesure le pourcentage de paires correctement classifiées. Cette métrique simple rend la tâche facile à comparer entre différents modèles et approches.
La tâche est conçue pour tester la capacité d'un modèle à effectuer une inférence en langage naturel et à comprendre la relation entre une question et un morceau de texte. Elle exige du modèle non seulement d'identifier les informations pertinentes, mais aussi de raisonner sur la question de savoir si ces informations répondent directement à la question. Cela implique une compréhension syntaxique et sémantique, ainsi que la capacité de gérer les paraphrases et les questions reformulées.
Rôle dans le benchmark GLUE
QNLI est l'une des neuf tâches du benchmark GLUE, qui a été introduit pour fournir une évaluation standardisée des modèles de compréhension du langage à usage général. Le benchmark comprend des tâches telles que l'analyse des sentiments, l'implication textuelle et la réponse aux questions, chacune avec son propre jeu de données et sa propre métrique d'évaluation. GLUE a été conçu pour encourager le développement de modèles capables de bien performer sur plusieurs tâches, plutôt que d'être spécialisés dans une seule.
Depuis sa publication, QNLI est devenu un banc d'essai standard pour évaluer les modèles basés sur les transformeurs, y compris les grands modèles de langage. De nombreux modèles importants, tels que BERT, RoBERTa et T5, ont rapporté leurs performances sur QNLI dans le cadre de leurs résultats de benchmark. La tâche a également été incluse dans le benchmark SuperGLUE, un successeur plus difficile de GLUE, où elle est appelée BoolQ mais avec une formulation différente.
Impact et importance
L'introduction de QNLI a eu un impact significatif sur le domaine du traitement du langage naturel. En convertissant une tâche de réponse aux questions en un problème de classification, il a fourni un moyen plus simple mais efficace d'évaluer les capacités de compréhension de lecture et d'inférence d'un modèle. Cela a facilité des progrès rapides dans le développement de modèles, car les chercheurs pouvaient itérer rapidement sur les architectures et les techniques d'entraînement.
De plus, QNLI a contribué à une meilleure compréhension de la manière dont les modèles gèrent des phénomènes linguistiques complexes, tels que la résolution de coréférence et le raisonnement logique. Il a également été utilisé comme outil de diagnostic pour identifier les faiblesses des modèles, comme leur tendance à s'appuyer sur des indices superficiels plutôt que sur une compréhension profonde. Par conséquent, il reste un benchmark pertinent même si des ensembles de données plus récents et plus complexes ont été introduits.