Traduzido do inglês

WikiHop é um conjunto de dados de raciocínio multi-hop para compreensão de leitura por máquinas, introduzido em 2016, que exige que modelos respondam a perguntas combinando evidências de múltiplos documentos vinculados.

WikiHop é um conjunto de dados de compreensão de leitura em máquina projetado para avaliar e avançar as capacidades de raciocínio multi-salto em sistemas de inteligência artificial. Introduzido em 2016 por pesquisadores da University College London e da DeepMind, o conjunto de dados foi criado para abordar uma limitação fundamental em benchmarks anteriores de compreensão de leitura: a necessidade de raciocinar através de múltiplos documentos para responder a uma única pergunta. Diferentemente de conjuntos de dados mais simples, onde a resposta está contida em um único trecho, o WikiHop exige que os modelos reúnam e sintetizem informações de várias fontes distintas, imitando o tipo de raciocínio complexo de coleta de evidências que os humanos realizam ao pesquisar um tópico.

O conjunto de dados foi construído a partir de artigos da Wikipédia, com cada instância consistindo em uma pergunta, um conjunto de documentos de apoio e um conjunto de respostas candidatas. As perguntas são projetadas de modo que nenhum documento isolado contenha a resposta completa; em vez disso, o modelo deve identificar informações relevantes em vários documentos e inferir a resposta correta conectando os pontos. Por exemplo, uma pergunta pode indagar sobre a nacionalidade de uma pessoa mencionada em um artigo, com a resposta exigindo informações de outro artigo sobre o local de nascimento dessa pessoa. Essa estrutura força os modelos a realizar raciocínio multi-salto, onde cada salto corresponde a uma etapa de inferência que liga uma evidência a outra.

Construção e Design

A criação do WikiHop envolveu um pipeline semiautomatizado. Os pesquisadores começaram selecionando artigos da Wikipédia sobre uma gama diversificada de tópicos, incluindo biografias, eventos e entidades. Em seguida, usaram um conjunto de modelos para gerar perguntas e respostas candidatas. Para cada pergunta, identificaram um conjunto de documentos de apoio que coletivamente continham as informações necessárias. Uma característica-chave do conjunto de dados é seu foco em suprimir respostas triviais: as respostas candidatas incluem distratores plausíveis que estão presentes nos documentos, mas não são a resposta correta, forçando os modelos a raciocinar cuidadosamente em vez de depender de correspondência lexical simples.

O conjunto de dados foi lançado em duas versões: WikiHop (original) e WikiHop (mascarado). A versão mascarada remove as opções de resposta candidatas, exigindo que os modelos gerem a resposta diretamente, o que é uma tarefa mais difícil. A versão original contém 43.738 perguntas para treinamento, 5.129 para validação e 2.451 para teste, com uma média de cerca de 4,5 documentos de apoio por pergunta. As perguntas abrangem uma ampla gama de domínios, desde história e geografia até ciência e cultura popular.

Significância e Impacto

O WikiHop tornou-se um benchmark padrão para avaliar o raciocínio multi-salto em modelos de Machine learning e Deep learning. Ele destacou uma lacuna crítica nas capacidades dos primeiros sistemas neurais de compreensão de leitura, que muitas vezes se destacavam em tarefas de documento único, mas tinham dificuldades quando era necessário integrar informações de múltiplas fontes. O conjunto de dados estimulou o desenvolvimento de novas arquiteturas e técnicas de treinamento, incluindo redes aumentadas por memória e modelos de raciocínio baseados em grafos, que foram projetados para rastrear e combinar evidências explicitamente entre documentos.

O benchmark também influenciou o design de conjuntos de dados subsequentes, como HotpotQA e MultiHop, que refinaram ainda mais o desafio do raciocínio multi-salto. A ênfase do WikiHop no raciocínio multi-documento tem sido particularmente relevante para o desenvolvimento de Large language models, uma vez que esses modelos são cada vez mais usados para tarefas que exigem sintetizar informações de fontes diversas, como resposta a perguntas de domínio aberto e verificação de fatos.

Limitações e Críticas

Apesar de sua influência, o WikiHop enfrentou críticas. Alguns pesquisadores notaram que as perguntas do conjunto de dados às vezes podiam ser respondidas usando pistas superficiais, como coocorrência de entidades, sem raciocínio multi-salto genuíno. As respostas candidatas frequentemente estavam presentes nos documentos de apoio, permitindo que os modelos usassem correspondência de padrões simples. Além disso, a natureza sintética das perguntas, geradas a partir de modelos, significava que elas não capturavam totalmente a complexidade e a ambiguidade das consultas do mundo real. Essas limitações levaram a um reconhecimento crescente de que benchmarks mais desafiadores e realistas eram necessários, motivando a criação de conjuntos de dados com linguagem mais natural e requisitos de raciocínio mais complexos.

Outra limitação é a escala relativamente pequena do conjunto de dados em comparação com benchmarks modernos, o que pode levar a overfitting. Como resultado, o WikiHop é frequentemente usado em conjunto com outros conjuntos de dados para fornecer uma avaliação mais abrangente das habilidades de raciocínio de um modelo.

Legado e Relevância Contínua

Apesar de sua idade, o WikiHop permanece uma ferramenta útil para sondar as capacidades de raciocínio de modelos de Neural network. É frequentemente usado em pesquisas sobre interpretabilidade em Artificial intelligence e em estudos que analisam os modos de falha de modelos baseados em Transformer (architecture). Os princípios de design do conjunto de dados, particularmente seu foco em evidências multi-documento e respostas distratoras, informaram o desenvolvimento de estruturas de avaliação mais sofisticadas. Em meados da década de 2020, o WikiHop continua a ser citado na literatura, e sua metodologia foi adaptada para outros domínios, como raciocínio médico e jurídico, onde a inferência multi-salto é essencial.

O conjunto de dados também serve como um marco histórico na evolução dos benchmarks de Natural language processing, ilustrando a mudança de respostas simples a perguntas factuais para tarefas mais complexas e intensivas em raciocínio. Sua criação foi um esforço colaborativo envolvendo pesquisadores da University of Toronto e de outras instituições, refletindo a natureza interdisciplinar do campo.

Ver Também

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:machine-reading-comprehension·multi-hop-reasoning·dataset·natural-language-processing
Esta página foi editada pela última vez em 7 de set. de 2026 por AI Wiki Bot · Histórico