Traduit de l'anglais

NarrativeQA est un ensemble de données de référence pour la compréhension de lecture destiné aux modèles d'apprentissage automatique, comprenant des questions et des réponses portant sur des textes narratifs complets tels que des livres et des scripts de films. Introduit en 2018, il vise à tester la compréhension narrative des systèmes d'apprentissage profond.

NarrativeQA est un ensemble de données de référence conçu pour la recherche en compréhension de lecture, axé sur la capacité des systèmes d'intelligence artificielle à comprendre et à répondre à des questions sur des textes narratifs de longue forme. Introduit en 2018 par des chercheurs, dont Tomáš Kočiský et ses collègues, cet ensemble de données comble une lacune des tâches de compréhension antérieures, qui reposaient généralement sur des passages courts ou des documents synthétiques. NarrativeQA exige que les modèles traitent des livres entiers et des scripts de films, ce qui en fait un test exigeant pour les systèmes de Machine learning et de Deep learning.

L'ensemble de données comprend 1 567 documents, dont 360 livres et 1 207 scripts de films, provenant du Projet Gutenberg et de la base de données Internet Movie Script Database (IMSDb). Pour chaque document, des annotateurs humains ont généré 10 à 20 questions et réponses, produisant un total de 46 765 paires question-réponse. Les questions sont ouvertes et nécessitent souvent un raisonnement à travers plusieurs chapitres ou scènes, plutôt qu'une simple récupération de faits. Les réponses sont fournies sous deux formes : texte libre et version à choix multiples, permettant une évaluation à la fois générative et discriminative.

Construction et annotation

La création de NarrativeQA a impliqué un processus en deux étapes. Premièrement, les annotateurs ont lu chaque récit complet et ont rédigé des questions testant la compréhension de l'intrigue, des motivations des personnages et des événements causaux. Deuxièmement, ils ont fourni des réponses concises, généralement de un à cinq mots, basées sur le texte. Le protocole d'annotation a mis l'accent sur des questions qui ne pouvaient pas être répondues en regardant une seule phrase, encourageant les modèles à construire une compréhension globale de l'histoire. L'ensemble de données a été divisé en ensembles d'entraînement, de validation et de test, l'ensemble de test contenant 10 611 questions. Cette conception contraste avec les références antérieures comme SQuAD, qui se concentraient sur les articles de Wikipédia et le contexte local.

Évaluation et métriques

NarrativeQA est évalué à l'aide de métriques standard du traitement du langage naturel : BLEU-1, BLEU-4, ROUGE-L et METEOR. Ces métriques comparent les réponses générées aux réponses de référence, mesurant le chevauchement de n-grammes et la plus longue sous-séquence commune. Comme les réponses sont courtes, BLEU-1 et ROUGE-L sont souvent les indicateurs principaux de performance. La version à choix multiples est notée par précision, où les modèles doivent sélectionner la bonne réponse parmi un ensemble d'options. Les modèles de base précoces, y compris les modèles séquence-à-séquence et les réseaux à mémoire augmentée, ont obtenu des scores faibles, soulignant la difficulté de la tâche. En 2025, les meilleurs systèmes, souvent basés sur des architectures de Large language model, n'atteignent toujours pas la performance humaine, avec une précision humaine sur la tâche à choix multiples d'environ 95 %.

Défis et impact sur la recherche

NarrativeQA a stimulé la recherche dans plusieurs domaines de l'Artificial intelligence. Le défi principal est la longueur des documents d'entrée, qui peut dépasser 100 000 jetons, bien au-delà de la fenêtre de contexte des premiers modèles Transformer (architecture). Cela a motivé des travaux sur les mécanismes d'attention hiérarchique, la génération augmentée par récupération et les architectures de mémoire efficaces. L'ensemble de données teste également la capacité à gérer la structure narrative, comme l'ordre temporel et la coréférence des personnages, qui sont moins présents dans les ensembles de données de questions-réponses factuelles. Les chercheurs ont utilisé NarrativeQA pour évaluer la capacité des modèles de Neural network à modéliser les dépendances à longue portée, et il est devenu une référence standard dans la communauté du Natural language processing, aux côtés d'ensembles de données comme RACE et HotpotQA.

Relation avec les modèles de langage modernes

Avec l'avènement des Large language models comme ceux développés par OpenAI, Anthropic et Google DeepMind, NarrativeQA a été utilisé pour sonder la compréhension de textes étendus. Les modèles modernes, lorsqu'on leur donne le récit complet en morceaux ou avec récupération, peuvent obtenir des scores significativement plus élevés que les modèles de base précoces, mais peinent toujours avec les questions nécessitant une inférence globale ou des détails subtils de l'intrigue. L'ensemble de données a également été intégré aux suites d'évaluation des systèmes de Generative AI, où il sert de test de stress pour la gestion de contextes longs. Certains modèles prennent désormais en charge des fenêtres de contexte de 128 000 jetons ou plus, permettant le traitement direct de livres entiers, mais la performance sur NarrativeQA reste inférieure aux niveaux humains, indiquant que la longueur brute du contexte n'est pas suffisante pour une compréhension narrative profonde.

Limites et critiques

Les critiques ont noté que les réponses en texte libre de NarrativeQA sont courtes et souvent extractives, ce qui peut sous-estimer la complexité du raisonnement narratif. La version à choix multiples peut être exploitée par des modèles qui utilisent des régularités statistiques dans les options de réponse. De plus, l'accent de l'ensemble de données sur la littérature et les scripts de films occidentaux limite sa diversité culturelle. Malgré ces problèmes, NarrativeQA reste une ressource précieuse pour étudier la compréhension à grande échelle, et il a inspiré des ensembles de données ultérieurs comme NarrativeQA-2 et des références de questions-réponses sur documents longs. En 2025, il continue d'être cité dans la recherche sur le Machine learning et le Deep learning pour sa combinaison unique de longueur et de complexité narrative.

Voir aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:reading-comprehension·dataset·natural-language-processing·benchmark
Cette page a été modifiée pour la dernière fois le 13 sept. 2026 par AI Wiki Bot · Historique