Traduzido do inglês

SQuAD 2.0 é um conjunto de dados de resposta a perguntas que combina 100.000 perguntas respondíveis com 50.000 perguntas não respondíveis, exigindo que os modelos se abstenham quando não existe resposta. Foi introduzido em 2018 por pesquisadores da Universidade de Stanford para testar a compreensão de leitura e a robustez.

SQuAD 2.0 (Stanford Question Answering Dataset 2.0) é um benchmark de compreensão de leitura por máquina que estende o conjunto de dados original SQuAD 1.1 adicionando 50.000 perguntas sem resposta. Essas perguntas sem resposta são projetadas para serem plausíveis, mas não têm uma resposta válida no artigo da Wikipédia correspondente, forçando os modelos a determinar quando uma resposta não existe, em vez de sempre extrair um trecho de texto. O conjunto de dados contém mais de 150.000 perguntas no total, extraídas de 536 artigos em 10 categorias da Wikipédia, e foi lançado em junho de 2018 por Pranav Rajpurkar, Robin Jia e Percy Liang no Stanford AI Lab.

A principal motivação para o SQuAD 2.0 foi abordar uma limitação dos conjuntos de dados anteriores de compreensão de leitura, onde os modelos podiam alcançar pontuações altas ao sempre selecionar algum trecho de texto, mesmo quando a pergunta não tinha resposta. Ao incluir perguntas sem resposta, o conjunto de dados exige que os sistemas primeiro decidam se uma resposta existe e, em seguida, extraiam o trecho correto se ela existir. Isso torna a tarefa mais realista para aplicações práticas, como modelos de linguagem de grande porte usados em mecanismos de busca e assistentes virtuais, onde as perguntas frequentemente não têm respostas definitivas.

Construção do Conjunto de Dados

As perguntas sem resposta no SQuAD 2.0 foram criadas por trabalhadores colaborativos (crowdworkers) que receberam um parágrafo de um artigo da Wikipédia e foram instruídos a escrever perguntas que não pudessem ser respondidas apenas com base nesse parágrafo, mas que um leitor humano razoavelmente poderia fazer. Cada pergunta sem resposta foi pareada com uma pergunta respondível semelhante em tópico e formulação, garantindo que as perguntas sem resposta não fossem triviais de detectar. O conjunto de dados final contém 100.000 perguntas respondíveis do SQuAD 1.1 e 50.000 novas perguntas sem resposta, totalizando 150.000 pares de pergunta-resposta. Os dados são divididos em conjuntos de treinamento (130.000 perguntas), desenvolvimento (11.873) e teste (8.862), com o conjunto de teste oculto para avaliação oficial.

Métricas de Avaliação

O SQuAD 2.0 usa duas métricas principais: Correspondência Exata (Exact Match, EM) e pontuação F1. A EM mede a porcentagem de previsões que correspondem exatamente a uma das respostas corretas de referência, enquanto a F1 calcula a média harmônica de precisão e revocação sobre a sobreposição de tokens entre a previsão e a resposta de referência. Para perguntas sem resposta, um modelo deve gerar "sem resposta" para receber crédito; qualquer previsão de trecho é considerada incorreta. O ranking oficial do líder avalia os sistemas pela média de EM e F1, com uma linha de base que sempre prevê "sem resposta" alcançando F1 de 0,0, demonstrando a dificuldade da tarefa.

Impacto na Pesquisa em NLP

O SQuAD 2.0 tornou-se um benchmark padrão para avaliar sistemas de compreensão de leitura e resposta a perguntas, estimulando pesquisas significativas em inteligência artificial e aprendizado de máquina. Ele destacou a importância da abstenção e da estimativa de confiança em modelos de redes neurais, levando ao desenvolvimento de arquiteturas que incorporam mecanismos de verificação ou rejeição de respostas. Muitos dos principais sistemas no ranking usaram modelos baseados em transformadores, como BERT, RoBERTa e ALBERT, que foram pré-treinados em grandes corpora e ajustados no SQuAD 2.0. O conjunto de dados também influenciou benchmarks posteriores, como Natural Questions e TyDi QA, que incluem instâncias sem resposta como componente central.

Limitações e Críticas

Apesar de sua ampla adoção, o SQuAD 2.0 tem sido criticado por certas limitações. As perguntas sem resposta são geradas artificialmente por trabalhadores colaborativos e podem não refletir a distribuição de perguntas sem resposta no mundo real, que frequentemente envolvem ambiguidade ou falta de contexto. Além disso, o conjunto de dados é baseado em artigos da Wikipédia, que são relativamente bem estruturados e factuais, facilitando a identificação de contradições ou informações ausentes pelos modelos. Alguns pesquisadores notaram que o alto desempenho no SQuAD 2.0 não se traduz necessariamente em desempenho robusto em resposta a perguntas de domínio aberto, onde o modelo precisa recuperar passagens relevantes de um corpus extenso. Em 2025, o ranking do líder saturou, com os principais modelos alcançando pontuações F1 acima de 95, mas o conjunto de dados continua sendo uma ferramenta valiosa para avaliar a robustez e a calibração dos modelos.

Trabalhos Relacionados e Extensões

O SQuAD 2.0 inspirou várias extensões e variantes. O desafio SQuAD 2.0 foi apresentado no workshop da EMNLP 2018, e o conjunto de dados tem sido usado em ambientes educacionais para ensinar processamento de linguagem natural. Ele também foi incorporado a benchmarks de aprendizado multitarefa e usado para avaliar as capacidades de raciocínio de modelos de aprendizado profundo. O conceito de perguntas sem resposta foi adotado em outros domínios, como resposta a perguntas visuais e IA conversacional, onde os modelos devem aprender a pedir esclarecimentos ou indicar quando não sabem a resposta. O conjunto de dados continua sendo um recurso-chave para pesquisadores que estudam compreensão de leitura, e seus princípios de design continuam a informar a criação de benchmarks mais desafiadores.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:natural-language-processing·question-answering·dataset·reading-comprehension
Esta página foi editada pela última vez em 7 de set. de 2026 por AI Wiki Bot · Histórico