WebQuestions est un ensemble de données de référence dans le domaine de l'intelligence-artificielle et de l'apprentissage-automatique pour évaluer les systèmes de réponse aux questions sur le graphe de connaissances structuré Freebase. L'ensemble de données contient 5 810 paires question-réponse, où chaque question est une requête en langage naturel et la réponse est un ensemble d'entités ou de valeurs de Freebase. Il a été introduit en 2013 par des chercheurs de Google pour remédier au manque de références à grande échelle et réalistes pour l'analyse sémantique et la réponse aux questions sur les bases de connaissances.
WebQuestions a été construit en utilisant l'API Google Suggest pour trouver des questions que les gens tapent réellement, puis des annotateurs ont associé chaque question à des entités et des réponses dans Freebase. Cette conception rend les questions plus représentatives des requêtes réelles des utilisateurs que les références synthétiques antérieures. L'ensemble de données se divise en un ensemble d'entraînement de 3 778 questions et un ensemble de test de 2 032 questions. Un ensemble de développement de 200 questions, couramment utilisé, a également été créé, bien qu'il ne fasse pas partie de la distribution officielle. La référence est rapidement devenue un banc d'essai standard pour les systèmes qui transforment le langage naturel en formes logiques ou directement en réponses dans une base de connaissances.
Construction et annotation
Les questions ont été sélectionnées à partir des journaux de suggestions de recherche de Google, en ciblant spécifiquement les questions commençant par des phrases comme « quoi », « qui », « quand » et « où ». Chaque question a été annotée manuellement avec une requête de type SPARQL correspondante utilisant un lexique prédéfini, et la réponse finale est le résultat de l'exécution de cette requête contre la base de données Freebase. Les annotations ont été créées via le crowdsourcing (Amazon Mechanical Turk) puis vérifiées par un second tour de travailleurs. Un aspect notable de l'ensemble de données est que certaines questions sont ambiguës - une question peut avoir plusieurs réponses valides selon l'interprétation, et les annotateurs ont reçu pour instruction de choisir la réponse la plus couramment attendue.
L'article officiel de la référence, « Semantic Parsing on Freebase from Question-Answer Pairs » (EMNLP 2013), a introduit l'ensemble de données et les résultats de référence. Les auteurs Michael J. Cafarella, Jonathan Berant, Andrew Chou et Percy Liang - l'auteur principal - étaient à l'Université de Californie à Berkeley. L'ensemble de données WebQuestions a servi de ressource d'évaluation centrale pour plusieurs systèmes ultérieurs, y compris l'analyseur sémantique basé sur lambda-DCS de l'article lui-même.
Pertinence pour la recherche sur la réponse aux questions
WebQuestions a été conçu pour contrer les ensembles de données d'analyse syntaxique dominants des années 2000, tels que l'analyse sémantique de GeoQuery ou ATIS, qui utilisaient des questions synthétiques et des domaines limités. En revanche, WebQuestions est ouvert et possède un vocabulaire beaucoup plus large et une couverture plus étendue des entités Freebase. Il a permis le développement de systèmes combinant l'analyse sémantique lexicalisée avec la similarité basée sur les plongements. Dans les années qui ont suivi sa publication, les chercheurs ont construit de nombreuses extensions, notamment WebQSP (WebQuestions - une division d'implication plus fine) et une extraction de réponses améliorée à l'aide de modèles neuronaux.
Une limitation notable de WebQuestions est que les réponses sont directement liées à Freebase, un graphe de connaissances qui a été interrompu par Google en 2015 (bien que les données restent accessibles via des instantanés). Cela affecte la transférabilité de nombreux modèles aux bases de connaissances actuelles. Néanmoins, la référence reste un pilier pour évaluer la généralisation compositionnelle dans la réponse aux questions.
L'ensemble de données expose également un défi clé : l'écart lexical entre le langage naturel libre et les termes du schéma de la base de connaissances. De nombreuses questions nécessitent de reconnaître des synonymes, des abréviations ou des relations indirectes. Cela a inspiré une ligne de recherche pour apprendre ou étendre la détection de mentions latentes et le liage d'entités de manière semi-supervisée, qui a ensuite alimenté les approches modernes de l'ère des grands-modèles-de-langage.
Méthodologie et métriques
La métrique d'évaluation principale est la moyenne F1, où pour chaque question, le système prédit un ensemble d'entités/valeurs Freebase comparé à l'ensemble de réponses de référence. La précision est la fraction des réponses prédites trouvées dans l'ensemble de référence, le rappel est la fraction des réponses de référence que le système trouve, et le score F1 est la moyenne harmonique. Le code d'évaluation officiel a été partagé sur le dépôt GitHub de WebQuestions. Les premiers systèmes de référence ont obtenu des scores F1 autour de 0,30, et les systèmes contemporains sur l'ensemble de test original ont atteint près de 0,78 à 0,79 vers 2020, principalement en utilisant des approches neuronales de bout en bout comme GrailQA ou des lecteurs basés sur Transformer. En 2023, des performances de pointe redoutées proches de 0,84 ont été rapportées, mais certaines impliquent des stratégies étendues de liage d'entités.
Héritage et influence
WebQuestions a influencé d'autres efforts de création de références, tels que « ComplexQuestions » et « QALD » (Question Answering over Linked Data). Il a également été utilisé comme base pour des tests contradictoires de modèles avec des plongements de graphes de connaissances. De nombreux cadres de réponse aux questions open source populaires (comme KELT-DELER, ou freebase) utilisent WebQuestions pour des vérifications de cohérence. Il reste une référence fréquemment utilisée pour la robustesse de l'analyse sémantique, en particulier lors de la combinaison d'un modèle de langage pré-entraîné avec une base de connaissances externe.
L'ensemble de données WebQuestions est maintenu par ses créateurs, mais depuis 2023, il est archivé sur GitHub (« webquestions ») et accessible librement. L'ensemble de données contient un fichier avec des identifiants de questions qui renvoient à des paires d'entités QR distinctes, ce qui facilite son utilisation avec l'indexation de graphes de connaissances, mais les utilisateurs doivent s'assurer que leur version du dump Freebase correspond aux annotations.
Voir aussi
--sont quelques exemples qui s'appuient sur la même idée d'espace de représentation conjoint.