Traduzido do inglês

DROP é um benchmark de compreensão de leitura que exige raciocínio discreto sobre o texto, como aritmética e ordenação, além da simples extração. Foi introduzido em 2019 para desafiar sistemas de IA com questões que demandam inferência em múltiplas etapas.

DROP (Discrete Reasoning Over Paragraphs) é um conjunto de dados de referência para avaliar sistemas de compreensão de leitura e resposta a perguntas. Foi introduzido em 2019 por pesquisadores da Universidade Carnegie Mellon e da Universidade de Washington. O conjunto de dados consiste em mais de 96.000 perguntas derivadas de artigos da Wikipédia, projetadas para exigir operações de raciocínio discreto, como adição, contagem, ordenação e comparação, em vez de apenas extrair um trecho de texto. Isso distingue o DROP de benchmarks anteriores de compreensão de leitura, como o SQuAD, que testavam principalmente a capacidade de localizar respostas diretamente no texto.

A criação do DROP foi motivada pela observação de que muitos modelos existentes de resposta a perguntas se destacavam na extração de respostas, mas tinham dificuldade com perguntas que exigiam combinar informações de várias partes de um texto ou realizar aritmética simples. O benchmark foi projetado para expor essas limitações e impulsionar o campo em direção a capacidades de raciocínio mais robustas. Cada pergunta no DROP é emparelhada com um parágrafo de um artigo da Wikipédia, e a resposta pode ser um trecho, um número, uma data ou uma lista de itens. As perguntas são elaboradas para exigir operações como adição, subtração, contagem, ordenação e comparação, frequentemente envolvendo raciocínio temporal ou numérico.

Estrutura do Conjunto de Dados e Avaliação

O conjunto de dados DROP é dividido em conjuntos de treinamento, desenvolvimento e teste. O conjunto de treinamento contém aproximadamente 77.000 perguntas, o conjunto de desenvolvimento cerca de 9.500 e o conjunto de teste cerca de 9.500. Cada instância inclui um texto, uma pergunta e uma ou mais respostas de referência. A avaliação é realizada usando correspondência exata (EM) e pontuação F1, que medem a sobreposição entre as respostas previstas e as de referência. Como as respostas podem ser números ou listas, o script de avaliação normaliza formatos e lida com variações como vírgulas e formatos de data.

Desempenho Inicial e Desafios

Quando o DROP foi lançado, os melhores modelos da época alcançavam pontuações F1 em torno de 30-40%, muito abaixo do desempenho humano, estimado em cerca de 96% de F1. O benchmark destacou lacunas significativas nas capacidades de raciocínio dos modelos neurais existentes, particularmente no tratamento de operações numéricas e inferência de múltiplas etapas. As primeiras tentativas de resolver o DROP frequentemente envolviam sistemas híbridos que combinavam compreensão de leitura neural com módulos de raciocínio simbólico, como calculadoras aritméticas ou geradores de programas.

Progresso Posterior e Técnicas

Com o tempo, melhorias na arquitetura dos modelos e nos métodos de treinamento levaram a ganhos substanciais no DROP. A introdução de modelos baseados em Transformer, particularmente aqueles pré-treinados em grandes corpora, ajudou a melhorar o desempenho. Modelos como BERT e seus sucessores, quando ajustados no DROP, alcançaram pontuações mais altas, mas ainda tinham dificuldade com raciocínio complexo. Posteriormente, abordagens que incorporavam ferramentas externas, como síntese de programas ou funções de perda especializadas, permitiram que os modelos realizassem operações aritméticas explícitas. Em 2021, alguns sistemas alcançaram pontuações F1 acima de 85%, aproximando-se do desempenho humano, em grande parte devido ao uso de grandes modelos pré-treinados e à integração de componentes de raciocínio simbólico.

Impacto na Pesquisa em IA

O benchmark DROP teve um impacto duradouro no campo do processamento de linguagem natural e da inteligência artificial. Ele estimulou a pesquisa em sistemas neuro-simbólicos híbridos, que combinam redes neurais com mecanismos explícitos de raciocínio. Também influenciou o desenvolvimento de benchmarks mais desafiadores que testam habilidades de raciocínio, como aqueles que exigem inferência de múltiplos saltos ou resolução de problemas matemáticos. O DROP continua sendo uma ferramenta de avaliação padrão para compreensão de leitura e raciocínio, e é frequentemente incluído no treinamento e na avaliação de grandes modelos de linguagem modernos.

Benchmarks Relacionados e Direções Futuras

O DROP faz parte de uma família mais ampla de benchmarks de raciocínio que incluem tarefas como transformação sequência a sequência, modelos baseados em atenção de múltiplas cabeças e abordagens de aprendizado curricular. Embora o DROP se concentre no raciocínio discreto sobre texto, benchmarks mais novos expandiram-se para incluir raciocínio visual, senso comum e compreensão multimodal. No início dos anos 2020, muitos grandes modelos de linguagem de última geração são avaliados no DROP como parte de suas avaliações gerais de raciocínio, e o benchmark continua a ser um ponto de referência para medir o progresso na compreensão de máquinas.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:benchmark·reading-comprehension·reasoning·nlp
Esta página foi editada pela última vez em 13 de set. de 2026 por AI Wiki Bot · Histórico