Traduit de l'anglais

SQuAD 2.0 est un ensemble de données de réponse aux questions combinant 100 000 questions auxquelles on peut répondre avec 50 000 questions sans réponse, exigeant des modèles qu'ils s'abstiennent lorsqu'aucune réponse n'existe. Il a été introduit en 2018 par des chercheurs de l'Université de Stanford pour tester la compréhension de lecture et la robustesse.

SQuAD 2.0 (Stanford Question Answering Dataset 2.0) est un benchmark de compréhension de lecture par machine qui étend le jeu de données original SQuAD 1.1 en ajoutant 50 000 questions sans réponse. Ces questions sans réponse sont conçues pour être plausibles mais n'ont aucune réponse valide dans l'article Wikipédia correspondant, forçant les modèles à déterminer quand aucune réponse n'existe plutôt que d'extraire toujours un passage. Le jeu de données contient plus de 150 000 questions au total, issues de 536 articles couvrant 10 catégories de Wikipédia, et a été publié en juin 2018 par Pranav Rajpurkar, Robin Jia et Percy Liang au Stanford AI Lab.

La motivation principale de SQuAD 2.0 était de remédier à une limitation des jeux de données de compréhension de lecture antérieurs, où les modèles pouvaient obtenir des scores élevés en sélectionnant toujours un passage de texte, même lorsque la question était sans réponse. En incluant des questions sans réponse, le jeu de données exige des systèmes qu'ils décident d'abord si une réponse existe, puis qu'ils extraient le passage correct si tel est le cas. Cela rend la tâche plus réaliste pour des applications pratiques telles que les grands modèles de langage utilisés dans les moteurs de recherche et les assistants virtuels, où les questions manquent souvent de réponses définitives.

Construction du Jeu de Données

Les questions sans réponse de SQuAD 2.0 ont été créées par des travailleurs en ligne qui, après avoir vu un paragraphe d'un article Wikipédia, devaient rédiger des questions auxquelles on ne pouvait pas répondre à partir de ce seul paragraphe, mais qu'un lecteur humain pourrait raisonnablement poser. Chaque question sans réponse était associée à une question avec réponse similaire en termes de sujet et de formulation, garantissant que les questions sans réponse n'étaient pas triviales à détecter. Le jeu de données final contient 100 000 questions avec réponse issues de SQuAD 1.1 et 50 000 nouvelles questions sans réponse, soit un total de 150 000 paires question-réponse. Les données sont réparties en ensembles d'entraînement (130 000 questions), de développement (11 873) et de test (8 862), l'ensemble de test étant caché pour l'évaluation officielle.

Métriques d'Évaluation

SQuAD 2.0 utilise deux métriques principales : Exact Match (EM) et le score F1. EM mesure le pourcentage de prédictions qui correspondent exactement à l'une des réponses de référence, tandis que F1 calcule la moyenne harmonique du rappel et de la précision sur le chevauchement de tokens entre la prédiction et la référence. Pour les questions sans réponse, un modèle doit produire « aucune réponse » pour être crédité ; toute prédiction de passage est considérée comme incorrecte. Le classement officiel classe les systèmes par la moyenne de EM et F1, avec une ligne de base qui prédit toujours « aucune réponse » atteignant un F1 de 0,0, démontrant la difficulté de la tâche.

Impact sur la Recherche en Traitement Automatique des Langues

SQuAD 2.0 est devenu une référence standard pour évaluer les systèmes de compréhension de lecture et de question-réponse, stimulant des recherches significatives en intelligence artificielle et en apprentissage automatique. Il a souligné l'importance de l'abstention et de l'estimation de confiance dans les modèles de réseaux de neurones, conduisant au développement d'architectures intégrant des mécanismes de vérification ou de rejet des réponses. De nombreux systèmes les plus performants du classement ont utilisé des modèles basés sur les transformeurs tels que BERT, RoBERTa et ALBERT, pré-entraînés sur de grands corpus et affinés sur SQuAD 2.0. Le jeu de données a également influencé des benchmarks ultérieurs comme Natural Questions et TyDi QA, qui intègrent des instances sans réponse comme composante centrale.

Limites et Critiques

Malgré son adoption généralisée, SQuAD 2.0 a été critiqué pour certaines limites. Les questions sans réponse sont générées artificiellement par des travailleurs en ligne et peuvent ne pas refléter la distribution des requêtes sans réponse du monde réel, qui impliquent souvent une ambiguïté ou un manque de contexte. De plus, le jeu de données repose sur des articles Wikipédia, relativement bien structurés et factuels, ce qui facilite l'identification des contradictions ou des informations manquantes par les modèles. Certains chercheurs ont noté que des performances élevées sur SQuAD 2.0 ne se traduisent pas nécessairement par des performances robustes en question-réponse à domaine ouvert, où le modèle doit récupérer des passages pertinents dans un large corpus. En 2025, le classement est saturé, les meilleurs modèles atteignant des scores F1 supérieurs à 95, mais le jeu de données reste un outil précieux pour évaluer la robustesse et la calibration des modèles.

Travaux Connexes et Extensions

SQuAD 2.0 a inspiré plusieurs extensions et variantes. Le défi SQuAD 2.0 a été présenté à l'atelier EMNLP 2018, et le jeu de données a été utilisé dans des contextes éducatifs pour enseigner le traitement automatique des langues. Il a également été intégré à des benchmarks d'apprentissage multitâches et utilisé pour évaluer les capacités de raisonnement des modèles de apprentissage profond. Le concept de questions sans réponse a été adopté dans d'autres domaines, tels que la réponse à des questions visuelles et l'IA conversationnelle, où les modèles doivent apprendre à demander des clarifications ou à indiquer quand ils ne connaissent pas la réponse. Le jeu de données reste une ressource clé pour les chercheurs étudiant la compréhension de lecture, et ses principes de conception continuent d'informer la création de benchmarks plus exigeants.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:natural-language-processing·question-answering·dataset·reading-comprehension
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique