Traduzido do inglês

TriviaQA é um conjunto de dados de resposta a perguntas em larga escala introduzido em 2017, contendo mais de 650.000 tríplices de pergunta-resposta-evidência provenientes de sites de trivia, projetado para testar sistemas de compreensão de leitura e QA de domínio aberto.

TriviaQA é um conjunto de dados de referência em larga escala para resposta a perguntas (QA) e compreensão de leitura, introduzido em 2017 por pesquisadores da Universidade de Washington. Foi criado para abordar limitações em conjuntos de dados de QA anteriores, fornecendo perguntas de ocorrência natural com respostas complexas de múltiplas frases e evidências de apoio substanciais. O conjunto de dados tornou-se uma ferramenta de avaliação padrão para modelos de Machine learning, particularmente aqueles baseados em arquiteturas de Deep learning e Transformer (architecture).

O conjunto de dados compreende mais de 650.000 triplas de pergunta-resposta-evidência, derivadas de 95.000 pares de pergunta-resposta coletados de três sites de trivia: QuizLeague, Wikipedia e um rastreamento web de páginas de trivia. Cada pergunta é emparelhada com múltiplos documentos de evidência, tipicamente de artigos da Wikipedia, que contêm a resposta. Esse design força os modelos a recuperar e raciocinar sobre passagens longas, tornando-o mais desafiador do que conjuntos de dados anteriores como SQuAD, que focavam na extração de parágrafos únicos.

Construção e Estatísticas

TriviaQA foi construído primeiro raspando perguntas de trivia e suas respostas da web. As perguntas são formuladas naturalmente, frequentemente envolvendo raciocínio de múltiplos saltos, raciocínio temporal ou conhecimento geral do mundo. Para cada pergunta, os autores usaram uma combinação de busca no Bing e correspondência de links da Wikipedia para reunir documentos de evidência relevantes, resultando em uma média de seis documentos de evidência por pergunta.

O conjunto de dados é dividido em conjuntos de treinamento, desenvolvimento e teste. O conjunto de treinamento contém 78.785 pares de pergunta-resposta, o conjunto de desenvolvimento 8.837 e o conjunto de teste 11.313. Uma característica notável é a inclusão de uma divisão 'somente web', onde a evidência é restrita a documentos web, e uma divisão 'somente wikipedia', onde a evidência vem exclusivamente da Wikipedia. Isso permite que os pesquisadores isolem os efeitos da recuperação específica de domínio.

Avaliação e Métricas

A avaliação padrão para TriviaQA usa correspondência exata (EM) e pontuação F1, semelhante a outros benchmarks de QA. EM mede a porcentagem de previsões que correspondem exatamente a uma das respostas aceitas, enquanto F1 calcula a sobreposição em nível de token. Os modelos são tipicamente avaliados em dois cenários: livro fechado (sem recuperação externa, dependendo do conhecimento paramétrico) e livro aberto (com recuperação da evidência fornecida).

Desde seu lançamento, TriviaQA tem sido um impulsionador chave do progresso na pesquisa de Large language model. Modelos iniciais de Neural network, como BiDAF e DrQA, alcançaram pontuações modestas, mas o advento de modelos baseados em Transformer (architecture) como BERT e T5 levou a melhorias significativas. Em 2021, modelos como OpenAI's GPT-3 e T5 do Google puderam exceder 70% EM no conjunto de desenvolvimento, e em 2023, sistemas de Generative AI como GPT-4 e Claude demonstraram desempenho quase humano, com alguns relatos de mais de 90% EM em certos subconjuntos.

Impacto na Pesquisa em IA

TriviaQA influenciou várias áreas da pesquisa em Artificial intelligence. Popularizou o uso de perguntas de ocorrência natural em larga escala para treinar e avaliar sistemas de compreensão de leitura. O conjunto de dados também estimulou o trabalho em QA de domínio aberto, onde os sistemas devem recuperar e raciocinar sobre um grande corpus sem evidência pré-selecionada. Essa linha de pesquisa contribuiu para o desenvolvimento da recuperação de passagens densas (DPR) e outras técnicas de geração aumentada por recuperação, que agora são integrais a muitos sistemas de QA em produção.

Além disso, TriviaQA tem sido usado para estudar robustez e calibração de modelos. Pesquisadores analisaram como os modelos lidam com perguntas ambíguas, raciocínio de múltiplos saltos e formatos de resposta. Os diversos tipos de perguntas do conjunto de dados o tornaram um benchmark comum para sondar o conhecimento e as capacidades de raciocínio de Large language models, juntamente com outros conjuntos de dados como Natural Questions e HotpotQA.

Limitações e Críticas

Apesar de sua popularidade, TriviaQA tem limitações conhecidas. As perguntas são predominantemente baseadas em fatos e orientadas para trivia, o que pode não refletir as necessidades reais de QA, como consultas conversacionais ou orientadas a tarefas. Os documentos de evidência às vezes são ruidosos ou contêm a resposta em múltiplas formas, o que pode levar a inconsistências na avaliação. Além disso, o conjunto de dados foi criticado por possível vazamento de respostas: como as perguntas foram raspadas da web, algumas respostas podem estar presentes nos corpora de treinamento de grandes modelos de linguagem, inflando o desempenho em cenários de livro fechado.

Para abordar essas questões, pesquisadores propuseram versões filtradas ou combinaram TriviaQA com outros conjuntos de dados para criar benchmarks mais robustos. No entanto, TriviaQA permanece um ponto de referência amplamente usado para comparar o desempenho de modelos, particularmente no contexto de QA de domínio aberto e tarefas intensivas em conhecimento.

Legado e Uso Contínuo

TriviaQA continua a ser um item essencial nos conjuntos de avaliação das principais organizações de pesquisa em IA, incluindo Google DeepMind, Anthropic e laboratórios acadêmicos como Stanford AI Lab e BAIR (Berkeley AI Research). É frequentemente incluído em fichas técnicas de modelos e relatórios técnicos como uma medida de conhecimento geral e raciocínio. O design do conjunto de dados também inspirou benchmarks subsequentes, como Natural Questions e WebQuestions, que adotam estruturas semelhantes de múltiplas evidências.

Em meados da década de 2020, TriviaQA permanece relevante, embora os modelos de última geração frequentemente alcancem pontuações que se aproximam ou excedem as linhas de base humanas, levando alguns a argumentar que o benchmark está se aproximando da saturação. No entanto, ele serve como um marco histórico na evolução dos sistemas de QA e continua a ser usado para ajuste fino e avaliação em ambientes acadêmicos e industriais.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:question-answering·dataset·natural-language-processing·benchmark
Esta página foi editada pela última vez em 7 de set. de 2026 por AI Wiki Bot · Histórico