SQuAD-Shifts est un ensemble de données de référence conçu pour évaluer la robustesse des modèles de question-réponse face aux changements de distribution. Il a été introduit en 2019 par des chercheurs de Google (dont John Miller, Karl Krauth et Ludwig Schmidt) comme complément au Stanford Question Answering Dataset (SQuAD). L'ensemble de données se compose de nouvelles paires question-réponse collectées à partir d'articles Wikipédia qui n'étaient pas présents dans les données d'entraînement originales de SQuAD, créant ainsi un changement naturel dans la distribution des sujets et le style d'écriture. L'objectif principal est de mesurer dans quelle mesure les modèles entraînés sur SQuAD généralisent à des données non vues, une propriété essentielle pour le déploiement réel des systèmes d'intelligence artificielle.
Le benchmark comprend trois sous-ensembles distincts : SQuAD-Shifts-New, qui contient des questions sur des articles Wikipédia entièrement nouveaux ; SQuAD-Shifts-Wiki, qui utilise des articles existant lors de la création de SQuAD mais non inclus dans l'ensemble de données original ; et SQuAD-Shifts-Reddit, qui inclut des questions posées par des utilisateurs de Reddit sur des articles Wikipédia. Chaque sous-ensemble introduit un type différent de changement de distribution, allant de la nouveauté thématique à la variation stylistique. L'ensemble de données est construit sur le même format que SQuAD, chaque exemple contenant un paragraphe de contexte, une question et un ensemble de segments de réponse.
Motivation et Conception
Le changement de distribution est un défi fondamental en apprentissage automatique, où les modèles entraînés sur une distribution de données performent souvent mal lorsqu'ils sont appliqués à une autre. SQuAD-Shifts a été créé pour fournir une évaluation contrôlée mais réaliste de ce phénomène. Contrairement aux perturbations synthétiques, les changements dans SQuAD-Shifts proviennent de variations naturelles dans le contenu généré par les humains. La conception suit le principe selon lequel la robustesse doit être mesurée sur des données susceptibles d'être rencontrées en déploiement, et non seulement sur des exemples conçus de manière adversarial.
L'ensemble de données exploite la structure de Wikipédia, qui est continuellement éditée et enrichie. En collectant de nouveaux articles et questions après la publication originale de SQuAD, les créateurs ont garanti que les données de test sont temporellement disjointes des données d'entraînement. Cette séparation temporelle est une caractéristique clé, car elle empêche les modèles de mémoriser des articles spécifiques et les oblige à s'appuyer sur des compétences générales de compréhension.
Protocole d'Évaluation
L'évaluation standard sur SQuAD-Shifts utilise les mêmes métriques que SQuAD : Exact Match (EM) et score F1. EM mesure le pourcentage de prédictions qui correspondent exactement à l'une des réponses de référence, tandis que F1 calcule la moyenne harmonique de la précision et du rappel sur le chevauchement au niveau des tokens. Les modèles sont généralement entraînés sur l'ensemble d'entraînement original de SQuAD puis évalués sur les trois sous-ensembles de SQuAD-Shifts sans aucune adaptation. La baisse de performance par rapport à l'ensemble de développement SQuAD dans la distribution quantifie la sensibilité du modèle au changement de distribution.
Dans l'article original, les auteurs ont évalué plusieurs modèles de référence, notamment BiDAF et BERT. Ils ont constaté que tous les modèles présentaient une dégradation significative des performances sur les sous-ensembles décalés, avec des baisses plus importantes sur SQuAD-Shifts-Reddit, qui contient des formulations de questions plus informelles et variées. Cela a mis en évidence que même les modèles puissants de apprentissage profond comme les architectures basées sur transformers n'étaient pas robustes aux changements de distribution naturels, motivant ainsi des recherches supplémentaires sur l'adaptation de domaine et l'entraînement robuste.
Relation avec d'Autres Benchmarks
SQuAD-Shifts fait partie d'une famille plus large de benchmarks de changement de distribution en traitement du langage naturel. Il complète des ensembles de données comme GLUE-X et RobustQA, qui testent également la généralisation sous diverses perturbations. Cependant, SQuAD-Shifts est unique en ce qu'il utilise des changements naturels plutôt que des modifications artificielles. Cela en fait un proxy plus réaliste des conditions réelles, où les distributions de données évoluent au fil du temps en raison de changements dans le comportement des utilisateurs, la création de contenu et l'usage de la langue.
Le benchmark a été influent dans le développement de l'évaluation des grands modèles de langage. De nombreuses études ultérieures ont utilisé SQuAD-Shifts pour évaluer la robustesse de modèles comme la série GPT de OpenAI et les modèles de Google DeepMind. Il a également été utilisé pour comparer différentes stratégies d'entraînement, telles que l'augmentation de données et l'adaptation de domaine, montrant que ces techniques peuvent atténuer mais non éliminer l'écart de performance.
Limites et Critiques
Une limite de SQuAD-Shifts est qu'il ne couvre que la compréhension de lecture, une tâche étroite dans la compréhension du langage naturel. Les changements sont également limités au contenu basé sur Wikipédia, qui peut ne pas refléter les changements dans d'autres domaines comme les actualités, les médias sociaux ou les documents techniques. De plus, l'ensemble de données est relativement petit par rapport aux corpus d'entraînement modernes, ce qui peut entraîner une variance élevée dans les résultats d'évaluation. Certains chercheurs ont noté que la baisse de performance sur SQuAD-Shifts peut être en partie due à des différences dans la difficulté des questions plutôt qu'à un pur changement de distribution, bien que les créateurs aient contrôlé cela en appariant les types de questions.
Malgré ces limites, SQuAD-Shifts reste un benchmark largement utilisé pour la recherche sur la robustesse. Il a été intégré dans plusieurs classements et suites d'évaluation, y compris le Robustness Gym. L'ensemble de données est publiquement disponible et peut être téléchargé depuis le dépôt officiel, permettant aux chercheurs de reproduire les résultats et d'étendre l'analyse.
Impact et Héritage
L'introduction de SQuAD-Shifts a contribué à une prise de conscience croissante du problème du changement de distribution en intelligence artificielle. Il a fourni des preuves empiriques que des modèles atteignant des résultats de pointe sur des benchmarks standards pouvaient échouer dramatiquement sur des données légèrement différentes. Cela a influencé la conception de benchmarks ultérieurs, comme la suite WILDS, qui inclut plusieurs domaines et tâches avec des changements naturels. Cela a également stimulé la recherche sur des techniques comme l'apprentissage de représentations invariantes au domaine et l'adaptation au moment du test.
Dans le contexte de la IA générative, SQuAD-Shifts a été utilisé pour évaluer la robustesse de modèles comme Claude de Anthropic et les services IA de Google Cloud. L'accent mis par le benchmark sur les changements naturels le rend particulièrement pertinent pour des applications où les données évoluent constamment, comme les moteurs de recherche et les assistants virtuels. En 2024, SQuAD-Shifts continue d'être cité dans des articles sur la robustesse des modèles et est considéré comme un outil standard pour évaluer la généralisation en question-réponse.