HotpotQA est un ensemble de données à grande échelle conçu pour entraîner et évaluer les systèmes d'intelligence artificielle sur le question-réponse multi-sauts. Il a été introduit en 2018 par une équipe de chercheurs de l'Université Carnegie Mellon et de l'Université de Washington. L'ensemble de données comprend plus de 113 000 paires de questions-réponses, chacune exigeant que le modèle raisonne sur plusieurs documents sources de Wikipédia pour parvenir à la bonne réponse. Contrairement aux références de question-réponse plus simples qui reposent sur un seul passage, HotpotQA teste explicitement la capacité d'un système à effectuer un raisonnement multi-sauts, ce qui implique de relier des informations provenant de plusieurs sources dans une chaîne logique.
L'objectif principal de HotpotQA est de faire progresser la recherche en compréhension de lecture et en raisonnement automatiques. Il répond à une limitation importante des ensembles de données antérieurs, qui contenaient souvent des questions auxquelles on pouvait répondre à partir d'un seul paragraphe. En exigeant la synthèse d'informations provenant de deux documents ou plus, HotpotQA pousse les modèles vers une compréhension et une inférence plus sophistiquées. L'ensemble de données est largement utilisé comme référence dans les domaines du apprentissage automatique et de l'intelligence artificielle, en particulier pour évaluer les capacités de raisonnement des grands modèles de langage et d'autres architectures neuronales.
Construction de l'ensemble de données
L'ensemble de données HotpotQA a été créé à l'aide d'un pipeline de crowdsourcing en deux étapes. Premièrement, les travailleurs devaient rédiger des questions nécessitant des informations provenant de plusieurs articles de Wikipédia, avec la contrainte que la réponse ne pouvait pas être trouvée dans un seul article. Deuxièmement, ces questions étaient validées et les faits de soutien étaient identifiés par des annotateurs. Chaque question est accompagnée d'une liste de faits de soutien, qui sont des phrases spécifiques des documents sources fournissant les preuves nécessaires pour répondre à la question. Cette conception permet à la fois la prédiction de réponses et l'extraction de preuves, ce qui facilite une évaluation plus transparente du raisonnement du modèle.
L'ensemble de données comprend deux principaux types de questions : les questions de pont et les questions de comparaison. Les questions de pont exigent de relier une entité d'un document à un autre, par exemple en identifiant le lieu de naissance d'une personne en reliant un film à son réalisateur. Les questions de comparaison exigent de contraster les attributs de deux entités, par exemple en déterminant lequel de deux fleuves est le plus long. Cette variété garantit que les modèles doivent gérer différents schémas de raisonnement, et pas seulement une simple récupération de faits.
Métriques d'évaluation
HotpotQA est généralement évalué à l'aide de plusieurs métriques. Pour la prédiction de réponses, la métrique principale est la correspondance exacte (EM), qui mesure le pourcentage de prédictions correspondant exactement à la réponse de référence. De plus, le score F1 est utilisé pour tenir compte des correspondances partielles, en considérant le chevauchement des jetons entre les réponses prédites et réelles. Pour la tâche de prédiction des faits de soutien, les scores F1 et EM conjoints sont calculés, exigeant que les modèles identifient les phrases de preuve correctes. Ces métriques fournissent une évaluation complète à la fois de la précision de la réponse finale et du processus de raisonnement.
Dans la version originale de 2018, l'ensemble de données était divisé en ensembles d'entraînement, de développement et de test, l'ensemble de test étant utilisé pour un classement public. Le classement permettait aux chercheurs de comparer leurs modèles aux approches de pointe, favorisant des progrès rapides dans le domaine. Au fil du temps, HotpotQA est devenu une référence standard dans la communauté du traitement du langage naturel, bien qu'il ne soit pas explicitement listé dans les slugs de liens fournis.
Impact sur la recherche en IA
HotpotQA a eu un impact significatif sur le développement des modèles de raisonnement. Il a stimulé des innovations dans les architectures intégrant des mécanismes d'attention, des réseaux de mémoire et un raisonnement basé sur des graphes. Par exemple, les premiers modèles utilisaient des encodeurs basés sur transformers pour encoder conjointement la question et plusieurs documents, tandis que les approches ultérieures employaient des réseaux de neurones graphiques pour modéliser les relations entre entités à travers les documents. L'ensemble de données a également souligné l'importance de l'explicabilité, car les annotations de faits de soutien permettent aux chercheurs d'analyser pourquoi un modèle a fait une prédiction particulière.
L'ensemble de données a été utilisé pour évaluer les capacités de raisonnement des grands modèles de langage modernes, tels que ceux développés par OpenAI, Anthropic et Google DeepMind. Ces modèles, souvent affinés ou sollicités avec des exemples à quelques coups, ont obtenu des scores élevés sur HotpotQA, démontrant leur capacité d'inférence multi-étapes. Cependant, l'ensemble de données reste difficile, car les modèles peinent encore avec des questions exigeant un raisonnement temporel ou causal complexe. Ces dernières années, les systèmes de pointe atteignent plus de 90 % de correspondance exacte sur l'ensemble de développement, mais le classement de l'ensemble de test montre encore une marge d'amélioration.
Limites et critiques
Malgré sa popularité, HotpotQA a fait l'objet de critiques. Une limite est que les questions sont générées par des travailleurs en ligne, ce qui peut introduire des biais ou une formulation artificielle. De plus, l'ensemble de données se concentre sur Wikipédia comme seule source de connaissances, ce qui limite la diversité des sujets et peut ne pas refléter les scénarios réels de question-réponse où les informations sont dispersées dans divers domaines. Certains chercheurs ont noté que les modèles peuvent exploiter des raccourcis, comme se fier aux schémas de co-occurrence d'entités, plutôt que d'effectuer un raisonnement authentique. Cela a conduit au développement de références plus difficiles visant à atténuer ces problèmes.
Une autre préoccupation est la nature statique de l'ensemble de données. Étant donné que Wikipédia est constamment mis à jour, les documents utilisés dans HotpotQA peuvent devenir obsolètes, ce qui pourrait affecter la validité des évaluations au fil du temps. Cependant, l'ensemble de données reste une ressource précieuse pour des expériences contrôlées, car il fournit un ensemble fixe de documents et d'annotations.
Références connexes
HotpotQA fait partie d'une famille plus large d'ensembles de données de question-réponse multi-sauts. Il est souvent comparé à d'autres références telles que QAngaroo, ComplexWebQuestions et MuSiQue. Ces ensembles de données varient en échelle, en complexité des questions et en nombre de sauts requis. L'accent mis par HotpotQA sur les annotations de faits de soutien le distingue de nombreux autres, ce qui le rend particulièrement utile pour étudier le raisonnement basé sur des preuves. Dans le contexte du apprentissage profond et des réseaux de neurones, HotpotQA sert de banc d'essai rigoureux pour développer de nouvelles architectures et paradigmes d'entraînement.