Traduit de l'anglais

SQuAD v1.1 est un ensemble de données de compréhension de lecture comprenant plus de 100 000 paires question-réponse dérivées d'articles Wikipédia, utilisé pour évaluer les systèmes de réponse aux questions extractives. Il a été introduit par l'Université de Stanford en 2016.

SQuAD v1.1 (Stanford Question Answering Dataset) est un ensemble de données de référence largement utilisé pour la lecture compréhensive extractive et la réponse aux questions. Il se compose de plus de 100 000 paires question-réponse générées par des travailleurs participatifs à partir d'un ensemble de 536 articles de Wikipédia. La tâche exige qu'un modèle identifie la bonne réponse comme un segment contigu de texte dans un passage donné, ce qui en fait une évaluation fondamentale pour les systèmes de compréhension du langage naturel.

L'ensemble de données a été introduit par des chercheurs du Stanford AI Lab en 2016, avec la version initiale publiée en juin 2016 et la mise à jour v1.1 publiée en décembre 2016. Il a été conçu pour encourager le développement de modèles capables de lire et de comprendre des textes à un niveau plus proche de la performance humaine. Les questions sont conçues pour être répondables uniquement à partir du paragraphe fourni, sans nécessiter de connaissances externes, et chaque question a une seule réponse correcte sous forme de segment.

Structure et création

SQuAD v1.1 a été construit en sélectionnant 536 articles de Wikipédia en anglais couvrant une gamme diversifiée de sujets, notamment la science, l'histoire et la biographie. Les travailleurs participatifs d'Amazon Mechanical Turk ont été invités à lire chaque paragraphe et à générer des questions et des réponses correspondantes. Chaque réponse devait être un segment textuel verbatim du passage, garantissant que l'ensemble de données puisse être utilisé pour des tâches de QA extractive. L'ensemble final contient 107 785 paires question-réponse, réparties en un ensemble d'entraînement de 87 599 paires, un ensemble de développement de 10 570 paires et un ensemble de test caché utilisé pour l'évaluation officielle.

L'ensemble de données comprend une grande variété de types de questions, telles que les questions qui, quoi, quand, où, pourquoi et comment. Cette diversité met les modèles au défi d'effectuer différents types de raisonnement, notamment la reconnaissance d'entités, le raisonnement temporel et l'inférence causale. Les segments de réponse vont de jetons uniques à des passages de plusieurs phrases, bien que la plupart soient des phrases courtes.

Métriques d'évaluation

Les modèles sont évalués sur deux métriques principales : la correspondance exacte (EM) et le score F1. EM mesure le pourcentage de prédictions qui correspondent exactement à la réponse de référence, en ignorant la ponctuation et les articles. Le score F1 calcule la moyenne harmonique de la précision et du rappel entre les jetons prédits et ceux de la référence, offrant une mesure plus indulgente qui récompense les correspondances partielles. Ces métriques sont devenues standard dans le domaine de la compréhension en lecture et sont utilisées dans de nombreux ensembles de données ultérieurs.

La performance humaine sur SQuAD v1.1 est estimée à 82,3 EM et 91,2 F1, fournissant un point de référence pour la comparaison des modèles. Les premiers modèles avaient du mal à dépasser 50 % de F1, mais les progrès rapides dans les architectures de deep learning et de réseaux neuronaux ont conduit à des améliorations significatives en quelques années.

Impact et héritage

SQuAD v1.1 a joué un rôle central dans l'avancement de la recherche en apprentissage automatique et en intelligence artificielle. Il a fourni un benchmark standardisé à grande échelle permettant aux chercheurs de comparer objectivement les performances des modèles. L'ensemble de données a stimulé le développement de nombreuses architectures influentes, y compris les modèles basés sur le Transformer qui sont devenus plus tard la base des grands modèles de langage modernes.

Notamment, la sortie de SQuAD v1.1 a coïncidé avec l'essor des mécanismes d'attention et de l'attention multi-têtes dans le traitement du langage naturel. Des modèles tels que BiDAF (Bidirectional Attention Flow) et plus tard BERT ont atteint des résultats de pointe sur ce benchmark, démontrant la puissance des paradigmes de pré-entraînement et de fine-tuning. Le succès de ces modèles sur SQuAD v1.1 a contribué à valider l'efficacité des cadres encodeur-décodeur et séquence à séquence.

L'ensemble de données a également influencé la création de benchmarks ultérieurs, notamment SQuAD v2.0, qui a ajouté des questions sans réponse pour tester la robustesse des modèles. De nombreux autres ensembles de données de compréhension en lecture, tels que RACE et TriviaQA, ont été conçus avec des principes similaires, mais SQuAD v1.1 reste l'un des benchmarks les plus cités et les plus utilisés dans le domaine.

Limites et critiques

Malgré son succès, SQuAD v1.1 présente plusieurs limites. La nature extractive de la tâche signifie que les modèles n'ont qu'à identifier un segment de texte, plutôt que de générer des réponses nouvelles. Cela peut conduire à des modèles qui sont bons pour localiser des informations mais moins capables de synthétiser ou de raisonner à leur sujet. L'ensemble de données repose également sur des articles de Wikipédia, ce qui peut introduire des biais dans la couverture des sujets et le style d'écriture.

De plus, les questions issues du crowdsourcing contiennent parfois des ambiguïtés ou nécessitent un raisonnement de sens commun qui n'est pas explicitement énoncé dans le passage. À mesure que les modèles se sont améliorés, l'écart entre la performance humaine et celle des machines s'est réduit, suscitant des inquiétudes quant à la capacité de l'ensemble de données à différencier les systèmes les plus performants. Ces problèmes ont motivé la création de benchmarks plus difficiles et l'exploration d'approches de IA générative qui vont au-delà de la réponse extractive.

Voir aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:natural-language-processing·dataset·question-answering·benchmark
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique