Traduzido do inglês

HotpotQA é um conjunto de dados de perguntas e respostas para treinar e avaliar sistemas de IA em raciocínio de múltiplos saltos, exigindo que os modelos sintetizem informações de múltiplos documentos da Wikipédia para responder a perguntas complexas.

HotpotQA é um conjunto de dados em larga escala projetado para treinar e avaliar sistemas de inteligência artificial em perguntas e respostas de múltiplos saltos. Foi introduzido em 2018 por uma equipe de pesquisadores da Universidade Carnegie Mellon e da Universidade de Washington. O conjunto de dados consiste em mais de 113.000 pares de perguntas e respostas, cada um exigindo que o modelo raciocine sobre múltiplos documentos de apoio da Wikipédia para chegar à resposta correta. Diferentemente de benchmarks de perguntas e respostas mais simples que dependem de um único trecho, o HotpotQA testa explicitamente a capacidade de um sistema de realizar raciocínio de múltiplos saltos, que envolve conectar informações de várias fontes em uma cadeia lógica.

O principal objetivo do HotpotQA é avançar a pesquisa em compreensão de leitura por máquina e raciocínio. Ele aborda uma limitação significativa de conjuntos de dados anteriores, que frequentemente continham perguntas respondíveis a partir de um único parágrafo. Ao exigir a síntese de informações de dois ou mais documentos, o HotpotQA impulsiona os modelos em direção a uma compreensão e inferência mais sofisticadas. O conjunto de dados é amplamente utilizado como benchmark nas áreas de aprendizado de máquina e inteligência artificial, particularmente para avaliar as capacidades de raciocínio de modelos de linguagem de grande escala e outras arquiteturas neurais.

Construção do Conjunto de Dados

O conjunto de dados HotpotQA foi criado usando um pipeline de crowdsourcing em duas etapas. Primeiro, os trabalhadores foram solicitados a escrever perguntas que exigissem informações de múltiplos artigos da Wikipédia, com a restrição de que a resposta não pudesse ser encontrada em nenhum artigo individual. Segundo, essas perguntas foram validadas e os fatos de apoio foram identificados por anotadores. Cada pergunta é acompanhada por uma lista de fatos de apoio, que são sentenças específicas dos documentos de origem que fornecem a evidência necessária para responder à pergunta. Esse design permite tanto a previsão de respostas quanto a extração de evidências, possibilitando uma avaliação mais transparente do raciocínio do modelo.

O conjunto de dados inclui dois tipos principais de perguntas: ponte e comparação. Perguntas de ponte exigem vincular uma entidade de um documento a outro, como identificar o local de nascimento de uma pessoa conectando um filme ao seu diretor. Perguntas de comparação exigem contrastar atributos de duas entidades, como determinar qual de dois rios é mais longo. Essa variedade garante que os modelos devam lidar com diferentes padrões de raciocínio, não apenas recuperação simples de fatos.

Métricas de Avaliação

O HotpotQA é tipicamente avaliado usando várias métricas. Para a previsão de respostas, a métrica principal é a correspondência exata (EM), que mede a porcentagem de previsões que correspondem exatamente à resposta de referência. Além disso, o escore F1 é usado para considerar correspondências parciais, levando em conta a sobreposição de tokens entre as respostas previstas e verdadeiras. Para a tarefa de previsão de fatos de apoio, escores conjuntos de F1 e EM são calculados, exigindo que os modelos identifiquem as sentenças de evidência corretas. Essas métricas fornecem uma avaliação abrangente tanto da precisão da resposta final quanto do processo de raciocínio.

Na versão original de 2018, o conjunto de dados foi dividido em conjuntos de treinamento, desenvolvimento e teste, com o conjunto de teste usado para um ranking público. O ranking permitiu que pesquisadores comparassem seus modelos com abordagens de ponta, fomentando progresso rápido no campo. Com o tempo, o HotpotQA se tornou um benchmark padrão na comunidade de processamento de linguagem natural, embora não esteja explicitamente listado nos slugs de links fornecidos.

Impacto na Pesquisa em IA

O HotpotQA teve um impacto significativo no desenvolvimento de modelos de raciocínio. Ele impulsionou inovações em arquiteturas que incorporam mecanismos de atenção, redes de memória e raciocínio baseado em grafos. Por exemplo, modelos iniciais usavam codificadores baseados em transformadores para codificar conjuntamente a pergunta e múltiplos documentos, enquanto abordagens posteriores empregavam redes neurais de grafos para modelar relações entre entidades em documentos. O conjunto de dados também destacou a importância da explicabilidade, pois as anotações de fatos de apoio permitem que pesquisadores analisem por que um modelo fez uma determinada previsão.

O conjunto de dados tem sido usado para avaliar as capacidades de raciocínio de modelos de linguagem de grande escala modernos, como aqueles desenvolvidos por OpenAI, Anthropic e Google DeepMind. Esses modelos, frequentemente ajustados ou instruídos com exemplos de poucos disparos, alcançaram altos escores no HotpotQA, demonstrando sua capacidade de inferência em múltiplas etapas. No entanto, o conjunto de dados permanece desafiador, pois os modelos ainda enfrentam dificuldades com perguntas que exigem raciocínio temporal ou causal complexo. Nos últimos anos, sistemas de ponta alcançam mais de 90% de correspondência exata no conjunto de desenvolvimento, mas o ranking do conjunto de teste mostra espaço contínuo para melhoria.

Limitações e Críticas

Apesar de sua popularidade, o HotpotQA enfrentou críticas. Uma limitação é que as perguntas são geradas por trabalhadores de crowdsourcing, o que pode introduzir vieses ou formulações não naturais. Além disso, o conjunto de dados foca na Wikipédia como única fonte de conhecimento, o que limita a diversidade de tópicos e pode não refletir cenários reais de perguntas e respostas onde as informações estão dispersas em vários domínios. Alguns pesquisadores notaram que os modelos podem explorar atalhos, como depender de padrões de coocorrência de entidades, em vez de realizar raciocínio genuíno. Isso levou ao desenvolvimento de benchmarks mais desafiadores que visam mitigar tais problemas.

Outra preocupação é a natureza estática do conjunto de dados. Como a Wikipédia é constantemente atualizada, os documentos usados no HotpotQA podem se tornar desatualizados, afetando potencialmente a validade das avaliações ao longo do tempo. No entanto, o conjunto de dados permanece um recurso valioso para experimentos controlados, pois fornece um conjunto fixo de documentos e anotações.

Benchmarks Relacionados

O HotpotQA faz parte de uma família mais ampla de conjuntos de dados de perguntas e respostas de múltiplos saltos. Ele é frequentemente comparado com outros benchmarks, como QAngaroo, ComplexWebQuestions e MuSiQue. Esses conjuntos de dados variam em escala, complexidade das perguntas e número de saltos exigidos. A ênfase do HotpotQA em anotações de fatos de apoio o distingue de muitos outros, tornando-o particularmente útil para estudar raciocínio baseado em evidências. No contexto de aprendizado profundo e redes neurais, o HotpotQA serve como um campo de testes rigoroso para desenvolver novas arquiteturas e paradigmas de treinamento.

Ver Também

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:question-answering·dataset·multi-hop-reasoning·natural-language-processing
Esta página foi editada pela última vez em 7 de set. de 2026 por AI Wiki Bot · Histórico