SQuAD 2.0 (Stanford Question Answering Dataset, version 2.0) est un benchmark largement utilisé pour évaluer les capacités de compréhension en lecture des systèmes de traitement du langage naturel. Publié en 2018 par des chercheurs de Université Stanford, il s'appuie sur le jeu de données original SQuAD 1.1 en introduisant un défi critique : les questions sans réponse. Dans SQuAD 2.0, chaque paragraphe est associé à des questions, dont certaines n'ont aucune réponse présente dans le texte, forçant les modèles à non seulement extraire des segments corrects, mais aussi à reconnaître quand une question est sans réponse. Cette conception teste directement la capacité d'un système à raisonner sur la présence ou l'absence d'informations, allant au-delà du simple appariement de motifs.
Le jeu de données se compose de plus de 100 000 paires question-réponse dérivées de plus de 500 articles Wikipédia. Plus précisément, il contient environ 50 000 questions avec réponse (conservées de SQuAD 1.1) et 50 000 questions sans réponse supplémentaires, rédigées de manière adversarial par des travailleurs en ligne. Ces questions sans réponse sont conçues pour être plausibles et similaires en style aux questions avec réponse, utilisant souvent des entités ou des faits liés mais incorrects, ce qui rend la tâche nettement plus difficile. La métrique d'évaluation pour SQuAD 2.0 est le score Exact Match (EM), qui exige que la réponse prédite par un modèle corresponde exactement à la vérité terrain, et le score F1, qui mesure le chevauchement des tokens entre la prédiction et la réponse réelle. Pour les questions sans réponse, un modèle ne reçoit de crédit que s'il prédit « aucune réponse » (un segment vide).
Contexte et motivation
Le SQuAD 1.1 original, publié en 2016, est devenu la norme de facto pour la réponse à des questions extractives, où les modèles reçoivent un paragraphe et une question et doivent sélectionner un segment contigu de texte comme réponse. Cependant, cette configuration présentait une limitation significative : chaque question était garantie d'avoir une réponse dans le contexte fourni. Cela permettait aux modèles d'exploiter la structure du jeu de données, s'appuyant souvent sur des indices lexicaux superficiels plutôt que sur une compréhension réelle. Pour remédier à cela, les créateurs de SQuAD 2.0, dirigés par Pranav Rajpurkar et Percy Liang, ont introduit des questions sans réponse. L'objectif était de créer une évaluation plus réaliste reflétant des scénarios du monde réel où les utilisateurs peuvent poser des questions sans réponse dans les documents disponibles, et un système robuste devrait être capable de dire « je ne sais pas » plutôt que d'halluciner une réponse.
Construction du jeu de données
La construction de SQuAD 2.0 a impliqué un processus en deux étapes. Premièrement, les questions avec réponse ont été directement tirées de SQuAD 1.1, qui avaient été générées par des travailleurs en ligne à qui on montrait un paragraphe et demandait d'écrire des questions pouvant être répondues par un segment du texte. Deuxièmement, pour chaque paragraphe, d'autres travailleurs en ligne ont été chargés d'écrire des questions sans réponse. Ils ont reçu pour instruction de créer des questions grammaticalement correctes, pertinentes par rapport au sujet du paragraphe et plausibles, mais pour lesquelles aucun segment du paragraphe ne fournissait de réponse correcte. Pour garantir la qualité, les travailleurs ont reçu des exemples de bonnes et de mauvaises questions sans réponse. Le jeu de données final a ensuite été filtré et validé, résultant en une répartition équilibrée de questions avec et sans réponse par paragraphe. Les paragraphes eux-mêmes proviennent d'articles Wikipédia couvrant une gamme diversifiée de sujets, y compris l'histoire, la science et la culture.
Impact sur le développement des modèles
SQuAD 2.0 a eu un impact profond sur le domaine du apprentissage automatique et du traitement du langage naturel. Il est rapidement devenu un benchmark standard pour évaluer les modèles de compréhension en lecture, et son introduction a stimulé des recherches significatives sur la gestion des questions sans réponse. Les premiers modèles, tels que ceux basés sur des réseaux de neurones récurrents et des mécanismes d'attention, ont eu du mal avec le nouveau défi, prédisant souvent une réponse même lorsqu'aucune n'existait. Le benchmark a conduit au développement d'architectures plus sophistiquées, y compris celles intégrant un classifieur « sans réponse » ou utilisant un seuil sur le score de confiance du segment de réponse. La publication de modèles basés sur Transformers, en particulier BERT (Bidirectional Encoder Representations from Transformers) fin 2018, a conduit à des améliorations rapides sur SQuAD 2.0. Le pré-entraînement de BERT sur un large corpus lui a permis d'atteindre des performances quasi humaines sur les questions avec réponse et des performances nettement meilleures sur celles sans réponse, établissant un nouvel état de l'art.
Évaluation et signification
SQuAD 2.0 est considéré comme un benchmark plus difficile et plus réaliste que son prédécesseur. L'inclusion de questions sans réponse teste la capacité d'un modèle à effectuer un raisonnement logique et à distinguer les informations pertinentes des informations non pertinentes. Un modèle qui devine simplement une réponse pour chaque question obtiendra un score médiocre, car il échouera sur toutes les instances sans réponse. Le benchmark a été utilisé pour comparer une large gamme de modèles, des systèmes traditionnels basés sur des caractéristiques aux grands modèles de langage modernes. En 2024, les meilleurs modèles sur SQuAD 2.0 atteignent des scores EM supérieurs à 90 %, dépassant les performances humaines, estimées à environ 86,8 % EM. Cependant, même avec ces scores élevés, les chercheurs notent que les modèles peuvent encore être fragiles et échouer sur des exemples adversariales ou des données hors distribution. SQuAD 2.0 reste une ressource fondamentale pour évaluer la compréhension en lecture et continue d'être cité dans les articles de recherche et utilisé dans les cours académiques sur l'intelligence artificielle.
Limites et orientations futures
Malgré son utilisation répandue, SQuAD 2.0 présente des limites. Le jeu de données est extractif, ce qui signifie que les réponses doivent être un segment contigu du texte, ne reflétant pas la nature générative de nombreux systèmes modernes de réponse aux questions. Il repose également sur des articles Wikipédia, qui ont un style et une structure particuliers, limitant potentiellement la généralisation à d'autres domaines. De plus, les questions sans réponse, bien que soigneusement conçues, peuvent ne pas capturer pleinement la complexité des requêtes du monde réel, qui peuvent être ambiguës ou nécessiter la synthèse d'informations provenant de plusieurs sources. En réponse, de nouveaux benchmarks tels que Natural Questions et RACE ont été introduits, mais SQuAD 2.0 reste un point de référence clé. Les orientations futures de la recherche incluent le développement de modèles capables de gérer des questions ouvertes, de fournir des explications pour leurs réponses et de détecter de manière robuste quand ils manquent d'informations suffisantes, en s'appuyant sur la base posée par SQuAD 2.0.