NarrativeQA es un conjunto de datos de referencia diseñado para la investigación en comprensión lectora, centrado en la capacidad de los sistemas de inteligencia artificial para entender y responder preguntas sobre textos narrativos extensos. Introducido en 2018 por investigadores como Tomáš Kočiský y colegas, el conjunto de datos aborda una brecha en tareas de comprensión anteriores que típicamente se basaban en pasajes cortos o documentos sintéticos. NarrativeQA requiere que los modelos procesen libros completos y guiones de películas, lo que lo convierte en una prueba exigente para los sistemas de aprendizaje automático y aprendizaje profundo.
El conjunto de datos comprende 1,567 documentos, incluyendo 360 libros y 1,207 guiones de películas, obtenidos del Proyecto Gutenberg y de la Base de Datos de Guiones de Internet (IMSDb). Para cada documento, anotadores humanos generaron de 10 a 20 preguntas y respuestas, produciendo un total de 46,765 pares de pregunta-respuesta. Las preguntas son abiertas y a menudo requieren razonamiento a través de múltiples capítulos o escenas, en lugar de una simple recuperación de hechos. Las respuestas se proporcionan en dos formas: texto libre y una versión de opción múltiple, lo que permite tanto la evaluación generativa como la discriminativa.
Construcción y Anotación
La creación de NarrativeQA implicó un proceso de dos etapas. Primero, los anotadores leyeron cada narrativa completa y escribieron preguntas que ponían a prueba la comprensión de la trama, las motivaciones de los personajes y los eventos causales. Segundo, proporcionaron respuestas concisas, típicamente de una a cinco palabras, basadas en el texto. El protocolo de anotación enfatizó preguntas que no podían responderse mirando una sola oración, alentando a los modelos a construir una comprensión global de la historia. El conjunto de datos se dividió en conjuntos de entrenamiento, validación y prueba, con el conjunto de prueba conteniendo 10,611 preguntas. Este diseño contrasta con puntos de referencia anteriores como SQuAD, que se centraban en artículos de Wikipedia y contexto local.
Evaluación y Métricas
NarrativeQA se evalúa utilizando métricas estándar de procesamiento de lenguaje natural: BLEU-1, BLEU-4, ROUGE-L y METEOR. Estas métricas comparan las respuestas generadas con las respuestas de referencia, midiendo la superposición de n-gramas y la subsecuencia común más larga. Debido a que las respuestas son cortas, BLEU-1 y ROUGE-L son a menudo los indicadores principales de rendimiento. La versión de opción múltiple se puntúa por precisión, donde los modelos deben seleccionar la respuesta correcta de un conjunto de opciones. Los primeros modelos de referencia, incluyendo modelos de secuencia a secuencia y redes aumentadas con memoria, lograron puntuaciones bajas, destacando la dificultad de la tarea. Hasta 2025, los mejores sistemas, a menudo basados en arquitecturas de modelos de lenguaje grandes, aún no alcanzan el rendimiento a nivel humano, con una precisión humana en la tarea de opción múltiple alrededor del 95%.
Desafíos e Impacto en la Investigación
NarrativeQA ha impulsado la investigación en varias áreas de inteligencia artificial. El desafío principal es la longitud de los documentos de entrada, que pueden superar los 100,000 tokens, mucho más allá de la ventana de contexto de los primeros modelos transformadores. Esto ha motivado el trabajo en mecanismos de atención jerárquica, generación aumentada por recuperación y arquitecturas de memoria eficiente. El conjunto de datos también pone a prueba la capacidad de manejar la estructura narrativa, como el orden temporal y la correferencia de personajes, que son menos prominentes en conjuntos de datos de QA basados en hechos. Los investigadores han utilizado NarrativeQA para evaluar la capacidad de los modelos de redes neuronales para modelar dependencias de largo alcance, y se ha convertido en un punto de referencia estándar en la comunidad de procesamiento de lenguaje natural, junto con conjuntos de datos como RACE y HotpotQA.
Relación con los Modelos de Lenguaje Modernos
Con la llegada de los modelos de lenguaje grandes como los desarrollados por OpenAI, Anthropic y Google DeepMind, NarrativeQA se ha utilizado para sondear la comprensión de textos extensos. Los modelos modernos, cuando se les da la narrativa completa en fragmentos o con recuperación, pueden lograr puntuaciones significativamente más altas que los primeros modelos de referencia, pero aún luchan con preguntas que requieren inferencia global o detalles sutiles de la trama. El conjunto de datos también se ha incorporado en suites de evaluación para sistemas de IA generativa, donde sirve como una prueba de estrés para el manejo de contexto largo. Algunos modelos ahora admiten ventanas de contexto de 128,000 tokens o más, permitiendo el procesamiento directo de libros completos, pero el rendimiento en NarrativeQA sigue siendo inferior a los niveles humanos, lo que indica que la longitud bruta del contexto no es suficiente para una comprensión narrativa profunda.
Limitaciones y Críticas
Los críticos han señalado que las respuestas de texto libre de NarrativeQA son cortas y a menudo extractivas, lo que puede subestimar la complejidad del razonamiento narrativo. La versión de opción múltiple puede ser manipulada por modelos que explotan regularidades estadísticas en las opciones de respuesta. Además, el enfoque del conjunto de datos en literatura y guiones de películas occidentales limita su diversidad cultural. A pesar de estos problemas, NarrativeQA sigue siendo un recurso valioso para estudiar la comprensión a escala, y ha inspirado conjuntos de datos posteriores como NarrativeQA-2 y puntos de referencia de QA de documentos largos. Hasta 2025, continúa siendo citado en investigaciones sobre aprendizaje automático y aprendizaje profundo por su combinación única de longitud y complejidad narrativa.