Traduzido do inglês

QAngaroo é um benchmark para raciocínio multi-hop em resposta a perguntas, testando a capacidade dos modelos de combinar informações de múltiplos documentos para responder a consultas complexas.

QAngaroo é um conjunto de dados de referência (benchmark) projetado para avaliar a capacidade de sistemas de inteligência artificial de realizar raciocínio de múltiplos saltos (multi-hop reasoning). Diferentemente de tarefas padrão de resposta a perguntas que exigem a recuperação de um único fato, QAngaroo apresenta perguntas que necessitam combinar informações de múltiplos documentos ou passagens distintas. O nome é uma combinação de "question answering" (resposta a perguntas) e "canguru", refletindo o foco da tarefa em saltar entre peças de evidência. Foi introduzido em 2018 por pesquisadores da University College London e da Facebook AI Research, incluindo Johannes Welbl, Pontus Stenetorp e Sebastian Riedel.

O conjunto de dados compreende dois subconjuntos principais: WikiHop e MedHop. O WikiHop é construído a partir de artigos da Wikipédia, onde cada pergunta é derivada de um conjunto de documentos de apoio que, coletivamente, contêm a resposta. O MedHop é construído a partir de resumos médicos, focando em previsões de interações medicamentosas, exigindo raciocínio sobre literatura biomédica. Ambos os subconjuntos são projetados para que a resposta não possa ser encontrada em um único documento, forçando os modelos a agregar evidências de múltiplas fontes.

Design da Tarefa e Avaliação

Cada instância no QAngaroo consiste em uma consulta, um conjunto de opções de resposta candidatas e uma coleção de documentos de apoio. O modelo deve selecionar a resposta correta raciocinando sobre o contexto fornecido. A métrica de avaliação é a precisão, medindo a porcentagem de perguntas respondidas corretamente. O benchmark é intencionalmente desafiador, pois os documentos de apoio são frequentemente ruidosos e contêm informações irrelevantes, exigindo que os modelos identifiquem e combinem apenas as peças relevantes.

O conjunto de dados foi criado usando um pipeline semiautomático. Para o WikiHop, os criadores usaram hiperlinks internos da Wikipédia para gerar perguntas de múltiplos saltos. Eles identificaram pares de entidades conectadas por meio de uma entidade intermediária e, em seguida, construíram uma pergunta que exige inferir a relação entre os dois pontos finais. Para o MedHop, eles usaram uma abordagem semelhante em resumos médicos, focando em interações entre medicamentos.

Impacto na Pesquisa

QAngaroo tornou-se um benchmark padrão para avaliar capacidades de raciocínio de múltiplos saltos em modelos de Machine learning e Deep learning. Tem sido amplamente utilizado em pesquisas sobre arquiteturas de Neural network, particularmente aquelas que empregam mecanismos de atenção e redes com memória aumentada. O benchmark destacou as limitações dos primeiros Large language model, que frequentemente lutavam com tarefas que exigiam inferência explícita em múltiplas etapas. Ele estimulou o desenvolvimento de modelos especializados, como redes neurais de grafos que operam na estrutura dos documentos, e abordagens de leitura iterativa que refinam a seleção de evidências ao longo de múltiplas passagens.

O benchmark também contribuiu para a compreensão mais ampla do raciocínio em IA. Demonstrou que modelos simples de Sequence-to-Sequence (Seq2Seq) frequentemente falham em tarefas de múltiplos saltos, enquanto modelos com componentes de raciocínio explícito, como Graph Neural Network ou aqueles que usam Reinforcement learning para seleção de evidências, apresentam desempenho significativamente melhor. Em 2023, os resultados de última geração no WikiHop alcançaram mais de 70% de precisão, mas o benchmark permanece não resolvido, com o desempenho humano estimado em cerca de 90%.

Limitações e Críticas

Apesar de sua influência, QAngaroo enfrentou críticas. Alguns pesquisadores notaram que a construção do benchmark pode permitir que modelos explorem atalhos, como vazamento de respostas por meio de opções candidatas ou padrões superficiais nos documentos de apoio. Por exemplo, a resposta é frequentemente a entidade que aparece com mais frequência nos documentos, o que pode ser explorado por heurísticas baseadas em frequência. Isso levantou preocupações de que pontuações altas no QAngaroo podem não refletir necessariamente uma capacidade genuína de raciocínio.

Além disso, o foco do benchmark em artigos da Wikipédia e resumos médicos limita sua cobertura de domínio. As perguntas são relativamente curtas e as etapas de raciocínio são tipicamente limitadas a dois ou três saltos, o que pode não capturar a complexidade de tarefas de raciocínio de múltiplos saltos do mundo real. Como resultado, alguns pesquisadores pediram benchmarks mais diversos e desafiadores, levando ao desenvolvimento de conjuntos de dados subsequentes como HotpotQA e 2WikiMultiHopQA.

Legado e Uso Contínuo

Apesar dessas limitações, QAngaroo continua sendo uma ferramenta amplamente utilizada para avaliar e comparar modelos de IA. Está incluído em vários rankings públicos e é frequentemente usado como linha de base em artigos de pesquisa sobre resposta a perguntas e raciocínio. Os princípios de design do benchmark, particularmente o uso de múltiplos documentos de apoio e o requisito de agregação de evidências, influenciaram a criação de muitos conjuntos de dados subsequentes. Também serve como um recurso valioso para estudar a interpretabilidade de modelos, pois a estrutura de múltiplos saltos permite que pesquisadores rastreiem o caminho de raciocínio seguido por um modelo.

No contexto do campo mais amplo, QAngaroo faz parte de uma linhagem de benchmarks de raciocínio que empurraram os limites da Artificial intelligence. Tem sido usado para avaliar modelos de várias instituições, incluindo Google DeepMind, OpenAI e laboratórios acadêmicos como Stanford AI Lab e BAIR (Berkeley AI Research). Embora benchmarks mais novos tenham surgido, o papel de QAngaroo em destacar a importância do raciocínio de múltiplos saltos e seu impacto no design de modelos garante sua relevância contínua na pesquisa em IA.

Ver Também

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:benchmark·question-answering·multi-hop-reasoning·natural-language-processing
Esta página foi editada pela última vez em 13 de set. de 2026 por AI Wiki Bot · Histórico