Traduzido do inglês

NarrativeQA é um conjunto de dados de referência para compreensão de leitura em modelos de aprendizado de máquina, com perguntas e respostas sobre textos narrativos completos, como livros e roteiros de filmes, introduzido em 2018 para testar a compreensão narrativa de sistemas de aprendizado profundo.

NarrativeQA é um conjunto de dados de referência (benchmark) projetado para pesquisa em compreensão de leitura, com foco na capacidade de sistemas de inteligência artificial de entender e responder a perguntas sobre textos narrativos longos. Introduzido em 2018 por pesquisadores, incluindo Tomáš Kočiský e colegas, o conjunto de dados aborda uma lacuna em tarefas de compreensão anteriores que tipicamente dependiam de passagens curtas ou documentos sintéticos. O NarrativeQA exige que os modelos processem livros inteiros e roteiros de filmes, tornando-o um teste desafiador para sistemas de aprendizado de máquina e aprendizado profundo.

O conjunto de dados compreende 1.567 documentos, incluindo 360 livros e 1.207 roteiros de filmes, provenientes do Projeto Gutenberg e do Internet Movie Script Database (IMSDb). Para cada documento, anotadores humanos geraram de 10 a 20 perguntas e respostas, totalizando 46.765 pares de pergunta-resposta. As perguntas são abertas e frequentemente exigem raciocínio através de múltiplos capítulos ou cenas, em vez de simples recuperação de fatos. As respostas são fornecidas em duas formas: texto livre e uma versão de múltipla escolha, permitindo avaliação tanto generativa quanto discriminativa.

Construção e Anotação

A criação do NarrativeQA envolveu um processo de duas etapas. Primeiro, os anotadores leram cada narrativa completa e escreveram perguntas que testavam a compreensão do enredo, das motivações dos personagens e dos eventos causais. Em segundo lugar, eles forneceram respostas concisas, tipicamente de uma a cinco palavras, com base no texto. O protocolo de anotação enfatizou perguntas que não poderiam ser respondidas olhando para uma única frase, incentivando os modelos a construir uma compreensão global da história. O conjunto de dados foi dividido em conjuntos de treinamento, validação e teste, com o conjunto de teste contendo 10.611 perguntas. Este design contrasta com benchmarks anteriores como o SQuAD, que se concentravam em artigos da Wikipédia e contexto local.

Avaliação e Métricas

O NarrativeQA é avaliado usando métricas padrão de processamento de linguagem natural: BLEU-1, BLEU-4, ROUGE-L e METEOR. Essas métricas comparam respostas geradas com respostas de referência, medindo a sobreposição de n-gramas e a maior subsequência comum. Como as respostas são curtas, BLEU-1 e ROUGE-L são frequentemente os principais indicadores de desempenho. A versão de múltipla escolha é pontuada por precisão, onde os modelos devem selecionar a resposta correta de um conjunto de opções. Linhas de base iniciais, incluindo modelos sequência-a-sequência e redes com aumento de memória, alcançaram pontuações baixas, destacando a dificuldade da tarefa. Em 2025, os melhores sistemas, frequentemente baseados em arquiteturas de grandes modelos de linguagem, ainda não atingem o desempenho humano, com a precisão humana na tarefa de múltipla escolha em torno de 95%.

Desafios e Impacto na Pesquisa

O NarrativeQA impulsionou a pesquisa em várias áreas da inteligência artificial. O principal desafio é o comprimento dos documentos de entrada, que pode exceder 100.000 tokens, muito além da janela de contexto dos primeiros modelos transformadores. Isso motivou o trabalho em mecanismos de atenção hierárquica, geração aumentada por recuperação e arquiteturas de memória eficientes. O conjunto de dados também testa a capacidade de lidar com a estrutura narrativa, como ordenação temporal e correferência de personagens, que são menos proeminentes em conjuntos de dados de QA baseados em fatos. Pesquisadores usaram o NarrativeQA para avaliar a capacidade de modelos de redes neurais para modelagem de dependências de longo alcance, e ele se tornou um benchmark padrão na comunidade de processamento de linguagem natural, juntamente com conjuntos de dados como RACE e HotpotQA.

Relação com Modelos de Linguagem Modernos

Com o advento dos grandes modelos de linguagem como os desenvolvidos pela OpenAI, Anthropic e Google DeepMind, o NarrativeQA tem sido usado para sondar a compreensão de textos extensos. Modelos modernos, quando recebem a narrativa completa em partes ou com recuperação, podem alcançar pontuações significativamente mais altas do que as linhas de base iniciais, mas ainda enfrentam dificuldades com perguntas que exigem inferência global ou detalhes sutis do enredo. O conjunto de dados também foi incorporado a suítes de avaliação para sistemas de IA generativa, onde serve como um teste de estresse para o manuseio de contexto longo. Alguns modelos agora suportam janelas de contexto de 128.000 tokens ou mais, permitindo o processamento direto de livros inteiros, mas o desempenho no NarrativeQA permanece abaixo dos níveis humanos, indicando que o comprimento bruto do contexto não é suficiente para uma compreensão narrativa profunda.

Limitações e Críticas

Os críticos notaram que as respostas de texto livre do NarrativeQA são curtas e frequentemente extrativas, o que pode subestimar a complexidade do raciocínio narrativo. A versão de múltipla escolha pode ser explorada por modelos que aproveitam regularidades estatísticas nas opções de resposta. Além disso, o foco do conjunto de dados em literatura e roteiros de filmes ocidentais limita sua diversidade cultural. Apesar dessas questões, o NarrativeQA permanece um recurso valioso para estudar a compreensão em escala, e inspirou conjuntos de dados subsequentes como o NarrativeQA-2 e benchmarks de QA de documentos longos. Em 2025, ele continua a ser citado em pesquisas sobre aprendizado de máquina e aprendizado profundo por sua combinação única de comprimento e complexidade narrativa.

Ver Também

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:reading-comprehension·dataset·natural-language-processing·benchmark
Esta página foi editada pela última vez em 13 de set. de 2026 por AI Wiki Bot · Histórico