DuoRC é um conjunto de dados de compreensão de leitura em larga escala introduzido em 2018 por pesquisadores do Instituto Indiano de Tecnologia (IIT) Madras e da Universidade Carnegie Mellon. Ele contém 186.089 pares de pergunta-resposta gerados a partir de 7.680 resumos de enredos de filmes, provenientes da Wikipédia e do IMDb. Diferentemente de muitos conjuntos de dados anteriores que dependem de contextos de uma única frase ou de parágrafos curtos, o DuoRC foca em narrativas longas e multiparágrafos, exigindo que os modelos sintetizem informações em múltiplas frases e eventos.
O conjunto de dados foi construído usando um processo de duas etapas. Primeiro, trabalhadores do Amazon Mechanical Turk escreveram perguntas com base em resumos de enredos da Wikipédia, que são tipicamente neutros e sem spoilers. Em seguida, um grupo separado de trabalhadores respondeu a essas perguntas usando os resumos de enredos correspondentes do IMDb, que são mais detalhados e frequentemente contêm spoilers. Esse descompasso deliberado entre o contexto de geração de perguntas e o contexto de busca de respostas força os modelos a depender de uma compreensão mais profunda, em vez de simples correspondência lexical, pois a resposta pode não aparecer literalmente na fonte usada para a criação das perguntas.
Construção e Anotação
Cada filme no DuoRC tem dois resumos de enredo distintos: um da Wikipédia (comprimento médio em torno de 1.000 palavras) e um do IMDb (comprimento médio em torno de 2.000 palavras). O processo de anotação envolveu múltiplas etapas de controle de qualidade, incluindo a filtragem de perguntas que poderiam ser respondidas a partir de uma única frase e a garantia de que as respostas fossem trechos de texto presentes no resumo do IMDb. O conjunto de dados final contém 96.311 perguntas para a divisão de treinamento, 12.792 para validação e 76.986 para teste, com um total de 186.089 pares de pergunta-resposta.
As perguntas no DuoRC são principalmente dos tipos "o quê", "quem", "porquê" e "como", com uma proporção significativa exigindo raciocínio em múltiplas frases. Por exemplo, uma pergunta pode perguntar por que um personagem agiu de certa maneira, com a resposta exigindo informações de três ou quatro parágrafos diferentes. Isso distingue o DuoRC de conjuntos de dados como o SQuAD, onde a maioria das respostas está localizada em uma única frase ou em frases adjacentes.
Avaliação e Linhas de Base
O DuoRC usa métricas padrão de compreensão de leitura: Correspondência Exata (EM) e pontuação F1. Quando foi lançado pela primeira vez, os autores avaliaram vários modelos de linha de base, incluindo sistemas tradicionais baseados em características e modelos neurais iniciais. A linha de base com melhor desempenho na época alcançou uma pontuação EM de aproximadamente 14% e uma pontuação F1 de cerca de 24%, significativamente menor do que o desempenho humano, que foi estimado em 78% EM e 86% F1. Essa grande lacuna destacou a dificuldade do raciocínio em contexto longo e estimulou pesquisas adicionais na área.
Trabalhos subsequentes com modelos baseados em Transformer (architecture) , como modelos de linguagem de grande porte, melhoraram substancialmente o desempenho. No entanto, mesmo sistemas modernos enfrentam dificuldades com as perguntas mais complexas do DuoRC, particularmente aquelas que exigem inferência entre parágrafos e raciocínio temporal. O conjunto de dados permanece como um referencial para avaliar a compreensão de documentos longos na pesquisa de processamento de linguagem natural.
Relação com Outros Conjuntos de Dados
O DuoRC foi projetado para complementar conjuntos de dados existentes de compreensão de leitura. Diferentemente do SQuAD (que usa artigos curtos da Wikipédia) ou do RACE (que usa exames), o DuoRC fornece contextos mais longos e um descompasso único entre pergunta e resposta. Essa escolha de design o torna particularmente útil para estudar se os modelos podem generalizar além do simples reconhecimento de padrões. O conjunto de dados tem sido usado em pesquisas sobre raciocínio de múltiplos saltos, compreensão de leitura por máquina e sistemas de resposta a perguntas.
Os criadores também lançaram um subconjunto chamado DuoRC-Paraphrase, que contém perguntas que são versões parafraseadas das perguntas originais, permitindo que pesquisadores testem a robustez à variação linguística. Esse subconjunto tem sido usado para avaliar a sensibilidade dos modelos a mudanças superficiais na formulação das perguntas.
Impacto e Limitações
O DuoRC tem sido amplamente citado na comunidade de inteligência artificial como um referencial desafiador para a compreensão de contexto longo. Ele influenciou o design de conjuntos de dados subsequentes, como o NarrativeQA, que também usa enredos de livros e filmes. No entanto, o DuoRC tem limitações: os resumos de enredos de filmes são material protegido por direitos autorais, o que restringe a redistribuição, e o conjunto de dados é principalmente em inglês, limitando a pesquisa multilíngue.
Outra limitação é que as perguntas foram geradas por trabalhadores de crowdsourcing, o que pode introduzir vieses ou inconsistências. Algumas perguntas podem ter múltiplas respostas válidas, e o formato de resposta baseado em trechos não captura todos os tipos de raciocínio. Apesar dessas questões, o DuoRC permanece como um recurso valioso para avaliar e melhorar modelos que precisam processar texto narrativo longo.
Direções Futuras
Com o surgimento de modelos de linguagem de grande porte e IA generativa, o DuoRC tem sido usado para testar se esses modelos podem lidar com raciocínio de forma longa. Avaliações recentes mostram que modelos como GPT-4 e Claude podem alcançar pontuações muito mais altas, mas ainda ficam aquém do desempenho humano nas perguntas mais difíceis. Pesquisadores continuam usando o DuoRC para sondar fraquezas nos sistemas atuais, como alucinação e falha em rastrear relações entre personagens ao longo de passagens longas.
O conjunto de dados também serve como um ambiente de teste para desenvolver novos mecanismos de atenção e redes aumentadas por memória projetadas para sequências longas. À medida que os modelos de aprendizado profundo se tornam mais eficientes no processamento de contextos longos, o DuoRC provavelmente permanecerá como um referencial padrão para medir o progresso na compreensão de narrativas por máquinas.
Ver Também
- Compreensão de leitura por máquina
- Resposta a perguntas
- Processamento de linguagem natural
- Modelos de linguagem de grande porte