Traduit de l'anglais

TriviaQA est un jeu de données de questions-réponses à grande échelle introduit en 2017, contenant plus de 650 000 triplets question-réponse-preuve provenant de sites de trivia, conçu pour tester la compréhension en lecture et les systèmes de questions-réponses en domaine ouvert.

TriviaQA est un ensemble de données de référence à grande échelle pour la réponse aux questions (QA) et la compréhension de lecture, introduit en 2017 par des chercheurs de l'Université de Washington. Il a été créé pour remédier aux limites des ensembles de données QA antérieurs en fournissant des questions naturellement formulées avec des réponses complexes et multi-phrases, accompagnées de preuves substantielles. Cet ensemble de données est devenu un outil d'évaluation standard pour les modèles de Machine learning, en particulier ceux basés sur les architectures Deep learning et Transformer (architecture).

L'ensemble comprend plus de 650 000 triplets question-réponse-évidence, dérivés de 95 000 paires question-réponse collectées sur trois sites Web de trivia : QuizLeague, Wikipedia et un crawl Web de pages de trivia. Chaque question est associée à plusieurs documents de preuve, généralement issus d'articles de Wikipedia, qui contiennent la réponse. Cette conception force les modèles à extraire et à raisonner sur de longs passages, ce qui la rend plus difficile que des ensembles plus anciens comme SQuAD, qui se concentraient sur l'extraction de paragraphes uniques.

Construction et Statistiques

TriviaQA a été construit en extrayant d'abord des questions et réponses de trivia sur le Web. Les questions sont formulées naturellement, impliquant souvent un raisonnement multi-étapes, un raisonnement temporel ou des connaissances générales du monde. Pour chaque question, les auteurs ont utilisé une combinaison de recherche Bing et de correspondance de liens Wikipedia pour rassembler des documents de preuve pertinents, ce qui résulte en une moyenne de six documents par question.

L'ensemble est divisé en ensembles d'entraînement, de développement et de test. L'ensemble d'entraînement contient 78 785 paires question-réponse, l'ensemble de développement 8 837 paires et l'ensemble de test 11 313 paires. Une caractéristique notable est l'inclusion d'une décomposition « uniquement Web » et une décomposition « uniquement Wikipedia », où les preuves sont respectivement restreintes aux documents Web ou exclusives à Wikipedia, afin de permettre aux chercheurs d'isoler les effets de la récupération par domaine.

#### Évaluation et métriques

L'évaluation standard de TriviaQA utilise la correspondance exacte (EM) et le score F1, similaires à d'autres repères de QA-EM. EM mesure le pourcentage de prédictions qui correspondent exactement à l'une des réponses acceptées, tandis que F1 estime la similarité au niveau token. Les modèles sont généralement évalués Dans les deux paramètres : à livre fermé (sans récupération externe, s'appuyant sur les connaissances paramétriques) et à livre ouvert (avec récupération à partir des preuves fournies).

Depuis sa sortie, TriviaQA a été un moteur essentiel des progrès dans la recherche sur Large language model. Les premiers modèles de Neural network tels que BiDAF et DrQA ont obtenu des scores modestes, mais l'avènement de modèles basés sur les Transformer (architecture) comme BERT et T5 a entraîné des améliorations significatives. Dès 2021, des modèles comme OpenAI's GPT-3 et T5 de Google pouvaient dépasser 70 % d'EM sur l'ensemble de développement, et dès 2023, des systèmes de Generative AI tels que GPT-4 et Claude ont montré des performances proches de celles des humains, certaines rapports rapportant plus de 90 % d'EM sur certains sous-ensembles.

Impact sur la recherche en IA

TriviaQA a influencé plusieurs domaines de la recherche en Artificial intelligence. Il a popularisé l'utilisation de questions naturelles à grande échelle pour entraîner et évaluer des systèmes de compréhension de lecture. Cet ensemble de données a également stimulé le travail sur la réponse ouverte, où les systèmes doivent interroger et raisonner à la sur un grand corpus sans éléments de preuve pré-sélectionnés. Cette ligne de recherche a contribué au développement de la récupération de passages dense (DPR) et d'autres techniques de génération augmentée par récupération (RAG), désormais intégrales à de nombreux systèmes de production de QA.

En outre, TriviaQA a été utilisé pour étudier la robustesse et la calibration des modèles. Les chercheurs ont analysé comment les modèles gèrent les questions ambiguës, le raisonnement multi-étapes et les formats de réponse. Les divers types de questions de cet ensemble en ont fait un repère couramment utilisé pour sonder les connaissances et les capacités de raisonnement des Large language model, aux côtés de lui-même d'autres ensembles comme Natural Questions et HotpotQA.

Limites et critiques

Malgré sa popularité, TriviaQA présente des limites évidentes. Les questions sont majoritairement basées sur des faits et des trivia, ce qui peut ne pas refléter les besoins réels en matière de QA, tels que les requêtes conversationnelles ou orientées vers des tâches. Les documents de evidence sont parfois bruyants ou contiennent la réponse sous multiples formes, ce qui peut entraîner des incohérences d'évaluation. De plus, l'ensemble a été critiqué pour une éventuelle fuite de réponses : enconstruit à partir d'écriture sur le Web, certaines réponses peuvent être présentes dans les corpus du développement de modèles de langage génératifs, ce qui gonfle les performances dans à configuration fermée le.

Pour atténuer ces problèmes, les chercheurs ont proposé des versions filtrées ou ont combiné TriviaQA avec d'autres ensembles de données pour créer des benchmarks plus fragiles. Néanmoins, TriviaQA demeure un point de repère largement utilisé pour comparer les performances de modèles, en particulier dans le contexte de QA ouverte et de tâches intensives en connaissances.

Héritage et utilisation continue

TriviaQA continue de figurer en tant qu'élément central dans la suite d'évaluation des grandes organisations de recherche en IA, y compris Google DeepMind, Anthropic et des laboratoires académiques comme Stanford AI Lab et BAIR (Berkeley AI Research) (laboratoires de Stanford et de Ber la toute dernière). Il est couramment inclus dans les fiches de modèles et les rapports techniques en tant que mesure de la connaissance générale et du raisonnement. La conception de cet ensemble de données a également donné naissance à des benchmarks ultérieurs comme Natural Questions et WebQuestions, qui adoptent des structures multiples-formes similaires.

au cours la fin des années 2020, TriviaQA maintient une conduit, bien que les modèles à la pointe technologie atteignent souvent des scores proches ou dépassant les références humaines, ce qui amène certains à soutenir que la benchmark est sur le point à saturation. Toutefois, il sert de jalon historique dans l'évolution de systèmes de QA et continue à être réutilisé pour le réglage fin et l'évaluation dans des milieux académiques comme dans l'industrie.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:question-answering·dataset·natural-language-processing·benchmark
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique