Perguntas Naturais Abertas

Traduzido do inglês

Natural Questions Open é um conjunto de dados de referência para resposta a perguntas de domínio aberto, derivado de consultas de busca do Google com respostas anotadas por humanos.

Natural Questions Open é um conjunto de dados de referência para resposta a perguntas de domínio aberto (QA). Foi introduzido pelo Google em 2019 como parte do conjunto de dados Natural Questions (NQ), que consiste em consultas reais anonimizadas feitas ao mecanismo de busca do Google. A variante 'Open' remove o contexto de uma única página da Wikipédia e exige responder a perguntas diretamente a partir de um grande corpus, como a Wikipédia, tornando-o um conjunto de avaliação padrão para sistemas de QA com recuperação aumentada.

O conjunto de dados inclui mais de 300.000 perguntas naturais, cada uma emparelhada com uma resposta curta (um trecho de texto) e uma resposta longa (um parágrafo da Wikipédia). A versão Open, formalmente conhecida como Natural Questions - Open, simplifica a tarefa original ao descartar a supervisão em nível de página e avaliar a capacidade de um sistema de encontrar a resposta em uma coleção aberta de documentos. Essa configuração se tornou um ambiente de teste canônico para comparar modelos de QA de domínio aberto, incluindo aqueles baseados em arquiteturas transformer e grandes modelos de linguagem.

O desenvolvimento do Natural Questions Open está alinhado com o progresso mais amplo em inteligência artificial, particularmente em aprendizado de máquina e aprendizado profundo. O benchmark tem sido usado para medir o desempenho de sistemas construídos sobre redes neurais, como BERT e, posteriormente, modelos de IA generativa. Pesquisadores frequentemente combinam geração aumentada por recuperação com modelos que utilizam atenção de múltiplas cabeças e codificação posicional para raciocinar sobre textos recuperados.

Tarefa e Avaliação

No cenário de domínio aberto, um sistema deve retornar uma resposta, tipicamente um trecho curto, para cada pergunta. A avaliação usa as métricas de correspondência exata (EM) e pontuação F1, comparando a resposta prevista com a resposta anotada, com normalização para pontuação e artigos. O conjunto de dados total inclui divisões de desenvolvimento (dev) e teste, permitindo um desenvolvimento e comparação robustos de modelos.

Os sistemas tipicamente empregam uma abordagem em duas etapas: primeiro, um recuperador seleciona passagens relevantes da Wikipédia; segundo, um leitor (frequentemente um modelo codificador-decodificador ou sequência a sequência) extrai a resposta. A decodificação por busca em feixe e a amostragem top-k são estratégias comuns para gerar respostas.

Impacto do Benchmark

O Natural Questions Open se tornou um dos benchmarks mais amplamente adotados para QA de domínio aberto, ao lado do SQuAD e do TriviaQA. Contribuiu para o surgimento de arquiteturas com recuperação aumentada, como REALM (2020) e RAG (2020), que combinaram recuperação e geração baseadas em transformer. Em 2021, o sistema Andorra combinou uma arquitetura recuperador-leitor com um modelo de IA generativa ajustado. O conjunto de dados também foi usado pelo Google DeepMind e outros laboratórios de inteligência artificial para avançar as capacidades de resposta a perguntas.

A tarefa de QA de domínio aberto está intimamente relacionada à construção do Natural Questions original, que inclui uma anotação mais rica com respostas longas. A abertura torna isso um desafio para sistemas de grandes modelos de linguagem, que podem precisar fornecer uma resposta sem recuperação explícita.

Desenvolvimentos Recentes

A partir do início dos anos 2020, sistemas baseados em grandes modelos pré-treinados alcançaram resultados fortes no conjunto de teste, com pontuações EM superiores a 50%. Por exemplo, um modelo de 2021 do Google Research alcançou um EM de 54,6% no conjunto de teste, enquanto uma abordagem que combina recuperação com IA generativa alcançou um valor mais alto, de 56,4%, posteriormente. Em 2022, comunicados de laboratórios de IA notaram a aplicação de aprendizado por reforço com RLAIF para alinhar a geração de texto. No entanto, as afirmações exatas do ranking podem variar ao longo do tempo.

Aplicações no Mundo Real

Os insights da busca do Natural Questions Open influenciaram sistemas comerciais, por exemplo: a degradação da recuperação pela diluição de perguntas e a necessidade de recuperação densa são usadas pelo Google Cloud e pela Amazon Web Services para busca. Um conjunto semelhante é frequentemente usado para avaliar assistentes de voz e sistemas baseados em computador. Mesmo assim, o conjunto de dados permanece como uma sublinha constante da pesquisa em QA.

Ver Também

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:natural-language-processing·question-answering·benchmark·dataset
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico