Traduit de l'anglais

SQuAD v2.0 est un ensemble de données de compréhension de lecture qui étend SQuAD 1.1 avec des questions sans réponse, testant la capacité des modèles à s'abstenir lorsqu'aucune réponse n'existe. Il combine 100 000 questions avec réponse et 50 000 questions sans réponse provenant d'articles Wikipédia, introduit en 2018 par des chercheurs de l'Université de Stanford.

SQuAD v2.0 (Stanford Question Answering Dataset version 2.0) est un jeu de données de référence pour la compréhension de lecture automatique et la réponse aux questions. Il étend le jeu de données original SQuAD 1.1 en ajoutant un ensemble substantiel de questions sans réponse, exigeant des modèles qu'ils extraient non seulement les segments de réponse corrects, mais aussi qu'ils reconnaissent quand une question ne peut pas être répondue à partir du contexte donné. Cette conception répond à une limitation clé des jeux de données antérieurs, où les modèles pouvaient obtenir des scores élevés en devinant des segments de réponse sans vraiment comprendre le texte.

Le jeu de données a été introduit en juin 2018 par une équipe de Stanford University, dirigée par Pranav Rajpurkar, Robin Jia et Percy Liang. Il comprend 100 000 questions avec réponse et 50 000 questions sans réponse, toutes dérivées du même ensemble d'articles Wikipédia utilisé dans SQuAD 1.1. Les questions sans réponse sont élaborées par des annotateurs humains qui reformulent des questions plausibles qui ne sont pas réellement soutenues par le texte de l'article, ce qui les rend difficiles à distinguer de celles avec réponse.

Motivation et Conception

La motivation principale de SQuAD v2.0 était de résoudre le problème de « surconfiance » dans les systèmes de compréhension de lecture. Dans SQuAD 1.1, chaque question avait un segment de réponse garanti dans le contexte, donc les modèles pouvaient être entraînés à toujours extraire quelque chose, même si c'était incorrect. Cela a conduit à des systèmes qui performaient bien sur le benchmark mais échouaient dans des applications réelles où les questions n'ont souvent pas de réponse. En introduisant des questions sans réponse, SQuAD v2.0 force les modèles à apprendre une compétence plus robuste : déterminer la répondabilité avant d'extraire un segment.

Le processus de construction impliquait des travailleurs de foule qui écrivaient d'abord des questions avec réponse basées sur un paragraphe, puis écrivaient des questions supplémentaires plausibles mais sans réponse, souvent en modifiant des entités, des nombres ou des relations. Cela garantit que les questions sans réponse sont sémantiquement similaires à celles avec réponse, rendant la tâche véritablement difficile.

Métriques d'Évaluation

SQuAD v2.0 utilise deux métriques principales : Exact Match (EM) et score F1. Cependant, contrairement à SQuAD 1.1, le scoring traite les questions sans réponse spécialement. Pour les questions sans réponse, un modèle reçoit un crédit complet (EM=1, F1=1) s'il prédit « aucune réponse » (un segment vide). S'il prédit un segment non vide, il obtient zéro pour les deux métriques. Pour les questions avec réponse, le EM et le F1 standard au niveau du segment sont calculés. Le score global est la moyenne sur toutes les questions, donnant un poids égal aux instances avec et sans réponse.

Ce schéma de scoring incite les modèles à être conservateurs : ils doivent équilibrer la précision pour répondre aux questions avec réponse contre le risque de répondre incorrectement aux questions sans réponse. Un modèle qui devine toujours une réponse obtiendra un score proche de zéro sur la moitié sans réponse, tandis qu'un modèle qui s'abstient toujours obtiendra zéro sur la moitié avec réponse.

Impact sur la Recherche

SQuAD v2.0 est rapidement devenu un benchmark standard dans la communauté NLP, aux côtés de son prédécesseur. Il a poussé le développement de modèles plus sophistiqués qui intègrent la prédiction de répondabilité comme composant explicite. De nombreuses approches deep learning précoces, comme celles basées sur les transformers, ont été évaluées sur ce jeu de données, menant à des améliorations rapides.

Le jeu de données a également influencé la conception de benchmarks ultérieurs comme Natural Questions et TriviaQA, qui incluent naturellement des questions sans réponse. Il a souligné l'importance de la calibration et de l'abstention dans la réponse aux questions, un sujet qui reste pertinent dans les large language models modernes.

Leaderboard et État de l'Art

Lors de la sortie, les meilleurs modèles obtenaient des scores EM autour de 60-65 %, significativement inférieurs aux scores de 80 %+ sur SQuAD 1.1, reflétant la difficulté ajoutée. Au fil du temps, les modèles se sont considérablement améliorés. En 2019, les systèmes utilisant BERT et ses variantes atteignaient des scores EM supérieurs à 80 %. En 2023, les meilleures entrées sur le leaderboard officiel obtiennent des scores EM supérieurs à 90 %, utilisant souvent des méthodes d'ensemble et des connaissances externes.

Malgré ces scores élevés, les chercheurs notent que SQuAD v2.0 a encore des limitations, comme sa dépendance à Wikipédia et le fait que les questions sans réponse sont artificiellement construites. Néanmoins, il reste un outil précieux pour évaluer la robustesse de la compréhension de lecture.

Travaux Connexes et Extensions

SQuAD v2.0 a inspiré plusieurs jeux de données et tâches de suivi. Par exemple, squad-shift a introduit des décalages de distribution pour tester la généralisation, tandis que d'autres travaux ont exploré des perturbations adverses. Le concept de répondabilité a été incorporé dans de nombreux systèmes de réponse aux questions, y compris ceux utilisés en production par des entreprises comme Google Cloud et Amazon Web Services.

Le jeu de données est librement disponible pour la recherche et est hébergé sur le site officiel de SQuAD, avec des scripts d'évaluation et un leaderboard public. Il continue d'être un point de référence pour comparer de nouvelles architectures et techniques d'entraînement dans le domaine de la compréhension automatique.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:natural-language-processing·question-answering·dataset·machine-learning
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique