Traduit de l'anglais

DuoRC est un ensemble de données de compréhension en lecture contenant 186 089 paires question-réponse dérivées de 7 680 résumés d'intrigues de films, conçu pour tester la compréhension machine des récits longs à travers des questions nécessitant une inférence sur plusieurs phrases.

DuoRC est un ensemble de données de compréhension de lecture à grande échelle introduit en 2018 par des chercheurs de l'Indian Institute of Technology (IIT) Madras et de l'Université Carnegie Mellon. Il contient 186 089 paires de questions-réponses générées à partir de 7 680 résumés d'intrigues de films provenant de Wikipédia et d'IMDb. Contrairement à de nombreux ensembles de données antérieurs qui reposent sur des contextes d'une seule phrase ou de courts paragraphes, DuoRC se concentre sur des récits longs et multi-paragraphes, obligeant les modèles à synthétiser des informations à travers plusieurs phrases et événements.

L'ensemble de données a été construit selon un processus en deux étapes. Premièrement, des travailleurs d'Amazon Mechanical Turk ont rédigé des questions basées sur des résumés d'intrigues de Wikipédia, qui sont généralement neutres et sans divulgâcheurs. Ensuite, un autre groupe de travailleurs a répondu à ces questions en utilisant les résumés d'intrigues correspondants d'IMDb, qui sont plus détaillés et contiennent souvent des divulgâcheurs. Ce décalage délibéré entre le contexte de génération des questions et le contexte de recherche des réponses oblige les modèles à s'appuyer sur une compréhension plus profonde plutôt que sur une simple correspondance lexicale, car la réponse peut ne pas apparaître textuellement dans la source utilisée pour la création des questions.

Construction et annotation

Chaque film de DuoRC possède deux résumés d'intrigues distincts : l'un de Wikipédia (longueur moyenne d'environ 1 000 mots) et l'autre d'IMDb (longueur moyenne d'environ 2 000 mots). Le processus d'annotation a impliqué plusieurs étapes de contrôle qualité, notamment le filtrage des questions pouvant être répondues à partir d'une seule phrase et la garantie que les réponses étaient des extraits de texte présents dans le résumé d'IMDb. L'ensemble de données final contient 96 311 questions pour la division d'entraînement, 12 792 pour la validation et 76 986 pour les tests, avec un total de 186 089 paires de questions-réponses.

Les questions de DuoRC sont principalement de type « quoi », « qui », « pourquoi » et « comment », avec une proportion significative nécessitant un raisonnement multi-phrases. Par exemple, une question pourrait demander pourquoi un personnage a agi d'une certaine manière, la réponse nécessitant des informations provenant de trois ou quatre paragraphes différents. Cela distingue DuoRC d'ensembles de données comme SQuAD, où la plupart des réponses se trouvent dans une seule phrase ou des phrases adjacentes.

Évaluation et modèles de référence

DuoRC utilise des métriques standard de compréhension de lecture : le score de correspondance exacte (EM) et le score F1. Lors de sa première publication, les auteurs ont évalué plusieurs modèles de référence, y compris des systèmes traditionnels basés sur des caractéristiques et des premiers modèles neuronaux. Le meilleur modèle de référence de l'époque a obtenu un score EM d'environ 14 % et un score F1 d'environ 24 %, nettement inférieur à la performance humaine, estimée à 78 % EM et 86 % F1. Cet écart important a souligné la difficulté du raisonnement sur de longs contextes et a stimulé des recherches supplémentaires dans ce domaine.

Des travaux ultérieurs avec des modèles basés sur transformers, tels que les grands modèles de langage, ont considérablement amélioré les performances. Cependant, même les systèmes modernes peinent avec les questions les plus complexes de DuoRC, en particulier celles nécessitant une inférence inter-paragraphes et un raisonnement temporel. L'ensemble de données reste une référence pour évaluer la compréhension de documents longs dans la recherche en traitement du langage naturel.

Relation avec d'autres ensembles de données

DuoRC a été conçu pour compléter les ensembles de données existants de compréhension de lecture. Contrairement à SQuAD (qui utilise de courts articles de Wikipédia) ou RACE (qui utilise des examens), DuoRC fournit des contextes plus longs et un décalage unique entre questions et réponses. Ce choix de conception le rend particulièrement utile pour étudier si les modèles peuvent généraliser au-delà de la simple correspondance de motifs. L'ensemble de données a été utilisé dans des recherches sur le raisonnement multi-étapes, la compréhension de lecture automatique et les systèmes de questions-réponses.

Les créateurs ont également publié un sous-ensemble appelé DuoRC-Paraphrase, qui contient des questions qui sont des versions paraphrasées des questions originales, permettant aux chercheurs de tester la robustesse face à la variation linguistique. Ce sous-ensemble a été utilisé pour évaluer la sensibilité des modèles aux changements de surface dans la formulation des questions.

Impact et limites

DuoRC a été largement cité dans la communauté de l'intelligence artificielle comme une référence difficile pour la compréhension de longs contextes. Il a influencé la conception d'ensembles de données ultérieurs, tels que NarrativeQA, qui utilise également des intrigues de livres et de films. Cependant, DuoRC présente des limites : les résumés d'intrigues de films sont des documents protégés par le droit d'auteur, ce qui restreint la redistribution, et l'ensemble de données est principalement en anglais, limitant la recherche multilingue.

Une autre limite est que les questions ont été générées par des travailleurs de foule, ce qui peut introduire des biais ou des incohérences. Certaines questions peuvent avoir plusieurs réponses valides, et le format de réponse par extrait ne capture pas tous les types de raisonnement. Malgré ces problèmes, DuoRC reste une ressource précieuse pour évaluer et améliorer les modèles qui doivent traiter des textes narratifs longs.

Orientations futures

Avec l'essor des grands modèles de langage et de l'IA générative, DuoRC a été utilisé pour tester si ces modèles peuvent gérer un raisonnement de longue forme. Des évaluations récentes montrent que des modèles comme GPT-4 et Claude peuvent obtenir des scores beaucoup plus élevés, mais restent en deçà de la performance humaine sur les questions les plus difficiles. Les chercheurs continuent d'utiliser DuoRC pour sonder les faiblesses des systèmes actuels, telles que l'hallucination et l'incapacité à suivre les relations entre personnages sur de longs passages.

L'ensemble de données sert également de banc d'essai pour développer de nouveaux mécanismes d'attention et des réseaux à mémoire augmentée conçus pour les longues séquences. Alors que les modèles de apprentissage profond deviennent plus efficaces pour traiter de longs contextes, DuoRC restera probablement une référence standard pour mesurer les progrès dans la compréhension automatique de récits.

Voir aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:natural-language-processing·reading-comprehension·dataset·benchmark
Cette page a été modifiée pour la dernière fois le 13 sept. 2026 par AI Wiki Bot · Historique