WikiHop est un ensemble de données de compréhension de lecture automatique conçu pour évaluer et faire progresser les capacités de raisonnement multi-étapes dans les systèmes d'intelligence artificielle. Introduit en 2016 par des chercheurs de l'University College London et de DeepMind, l'ensemble de données a été créé pour remédier à une limitation fondamentale des benchmarks antérieurs de compréhension de lecture : la nécessité de raisonner sur plusieurs documents pour répondre à une seule question. Contrairement aux ensembles de données plus simples où la réponse est contenue dans un seul passage, WikiHop exige des modèles qu'ils rassemblent et synthétisent des informations provenant de plusieurs sources distinctes, imitant le type de raisonnement complexe de collecte de preuves que les humains effectuent lorsqu'ils recherchent un sujet.
L'ensemble de données a été construit à partir d'articles Wikipédia, chaque instance consistant en une question, un ensemble de documents de support et un ensemble de réponses candidates. Les questions sont conçues de sorte qu'aucun document ne contienne la réponse complète ; à la place, le modèle doit identifier les informations pertinentes à travers plusieurs documents et déduire la réponse correcte en reliant les informations. Par exemple, une question pourrait porter sur la nationalité d'une personne mentionnée dans un article, la réponse nécessitant des informations provenant d'un autre article sur le lieu de naissance de cette personne. Cette structure force les modèles à effectuer un raisonnement multi-étapes, où chaque étape correspond à une inférence qui relie un élément de preuve à un autre.
Construction et conception
La création de WikiHop a impliqué un pipeline semi-automatisé. Les chercheurs ont commencé par sélectionner des articles Wikipédia sur une gamme diversifiée de sujets, notamment des biographies, des événements et des entités. Ils ont ensuite utilisé un ensemble de modèles pour générer des questions et des réponses candidates. Pour chaque question, ils ont identifié un ensemble de documents « de support » contenant collectivement les informations nécessaires. Une caractéristique clé de l'ensemble de données est son accent sur la « suppression » des réponses triviales : les réponses candidates incluent des distracteurs plausibles qui sont présents dans les documents mais ne constituent pas la réponse correcte, forçant les modèles à raisonner soigneusement plutôt qu'à se fier à un simple appariement lexical.
L'ensemble de données a été publié en deux versions : WikiHop (original) et WikiHop (masqué). La version masquée supprime les options de réponses candidates, obligeant les modèles à générer directement la réponse, ce qui constitue une tâche plus difficile. La version originale contient 43 738 questions pour l'entraînement, 5 129 pour la validation et 2 451 pour les tests, avec une moyenne d'environ 4,5 documents de support par question. Les questions couvrent un large éventail de domaines, de l'histoire et la géographie à la science et la culture populaire.
Importance et impact
WikiHop est devenu un benchmark standard pour évaluer le raisonnement multi-étapes dans les modèles de apprentissage automatique et de apprentissage profond. Il a mis en évidence une lacune critique dans les capacités des premiers systèmes neuronaux de compréhension de lecture, qui excellaient souvent dans les tâches à document unique mais peinaient lorsqu'il fallait intégrer des informations provenant de plusieurs sources. L'ensemble de données a stimulé le développement de nouvelles architectures et de nouvelles techniques d'entraînement, notamment les réseaux à mémoire augmentée et les modèles de raisonnement basés sur des graphes, conçus pour suivre et combiner explicitement les preuves à travers les documents.
Le benchmark a également influencé la conception d'ensembles de données ultérieurs, tels que HotpotQA et MultiHop, qui ont affiné le défi du raisonnement multi-étapes. L'accent mis par WikiHop sur le raisonnement multi-documents a été particulièrement pertinent pour le développement des grands modèles de langage, car ces modèles sont de plus en plus utilisés pour des tâches nécessitant la synthèse d'informations provenant de sources diverses, telles que la réponse à des questions en domaine ouvert et la vérification des faits.
Limites et critiques
Malgré son influence, WikiHop a fait l'objet de critiques. Certains chercheurs ont noté que les questions de l'ensemble de données pouvaient parfois être résolues à l'aide d'indices superficiels, tels que la cooccurrence d'entités, sans véritable raisonnement multi-étapes. Les réponses candidates étaient souvent présentes dans les documents de support, permettant aux modèles d'utiliser un simple appariement de formes. De plus, la nature synthétique des questions, générées à partir de modèles, signifiait qu'elles ne saisissaient pas pleinement la complexité et l'ambiguïté des requêtes du monde réel. Ces limites ont conduit à une reconnaissance croissante de la nécessité de benchmarks plus difficiles et plus réalistes, ce qui a incité à la création d'ensembles de données avec un langage plus naturel et des exigences de raisonnement plus complexes.
Une autre limite est l'échelle relativement petite de l'ensemble de données par rapport aux benchmarks modernes, ce qui peut conduire à un surajustement. Par conséquent, WikiHop est souvent utilisé en conjonction avec d'autres ensembles de données pour fournir une évaluation plus complète des capacités de raisonnement d'un modèle.
Héritage et pertinence continue
Malgré son âge, WikiHop reste un outil utile pour sonder les capacités de raisonnement des modèles de réseaux de neurones. Il est fréquemment utilisé dans la recherche sur l'interprétabilité de l'intelligence artificielle et dans les études qui analysent les modes de défaillance des modèles basés sur les transformers. Les principes de conception de l'ensemble de données, en particulier l'accent mis sur les preuves multi-documents et les réponses distractrices, ont informé le développement de cadres d'évaluation plus sophistiqués. Environ au milieu des années 2020, WikiHop continue d'être cité dans la littérature, et sa méthodologie a été adaptée à d'autres domaines, tels que le raisonnement médical et juridique, où l'inférence multi-étapes est essentielle.
L'ensemble de données sert également de marqueur historique dans l'évolution des benchmarks de traitement du langage naturel, illustrant le passage de la réponse simple à des questions factuelles à des tâches plus complexes et plus exigeantes en raisonnement. Sa création a été un effort collaboratif impliquant des chercheurs de l'Université de Toronto et d'autres institutions, reflétant la nature interdisciplinaire du domaine.