Traduzido do inglês

SQuAD v2.0 é um conjunto de dados de compreensão de leitura que estende o SQuAD 1.1 com perguntas sem resposta, testando a capacidade dos modelos de se abster quando nenhuma resposta existe. Combina 100.000 perguntas respondíveis e 50.000 perguntas não respondíveis de artigos da Wikipedia, introducido em 2018 por pesquisadores da Universidade de Stanford.

SQuAD v2.0 (Stanford Question Answering Dataset versão 2.0) é um conjunto de dados de referência para compreensão de leitura por máquina e resposta a perguntas. Ele estende o conjunto de dados original SQuAD 1.1 adicionando um conjunto substancial de perguntas sem resposta, exigindo que os modelos não apenas extraiam os trechos de resposta corretos, mas também reconheçam quando uma pergunta não pode ser respondida a partir do contexto fornecido. Esse design aborda uma limitação importante de conjuntos de dados anteriores, onde os modelos podiam alcançar pontuações altas ao adivinhar trechos de resposta sem realmente compreender o texto.

O conjunto de dados foi introduzido em junho de 2018 por uma equipe da Universidade de Stanford, liderada por Pranav Rajpurkar, Robin Jia e Percy Liang. Ele compreende 100.000 perguntas respondíveis e 50.000 perguntas sem resposta, todas derivadas do mesmo conjunto de artigos da Wikipédia usado no SQuAD 1.1. As perguntas sem resposta são elaboradas por anotadores humanos que parafraseiam perguntas plausíveis que não são realmente apoiadas pelo texto do artigo, tornando-as difíceis de distinguir das respondíveis.

Motivação e Design

A principal motivação para o SQuAD v2.0 foi abordar o problema da "superconfiança" em sistemas de compreensão de leitura. No SQuAD 1.1, toda pergunta tinha um trecho de resposta garantido no contexto, então os modelos podiam ser treinados para sempre extrair algo, mesmo que incorreto. Isso levou a sistemas que tinham bom desempenho no benchmark, mas falhavam em aplicações do mundo real, onde as perguntas frequentemente não têm resposta. Ao introduzir perguntas sem resposta, o SQuAD v2.0 força os modelos a aprender uma habilidade mais robusta: determinar a respondibilidade antes de extrair um trecho.

O processo de construção envolveu trabalhadores da multidão que primeiro escreveram perguntas respondíveis com base em um parágrafo e, em seguida, escreveram perguntas adicionais que são plausíveis, mas sem resposta, frequentemente alterando entidades, números ou relações. Isso garante que as perguntas sem resposta sejam semanticamente semelhantes às respondíveis, tornando a tarefa genuinamente difícil.

Métricas de Avaliação

O SQuAD v2.0 usa duas métricas principais: Correspondência Exata (EM) e pontuação F1. No entanto, ao contrário do SQuAD 1.1, a pontuação trata as perguntas sem resposta de forma especial. Para perguntas sem resposta, um modelo recebe crédito total (EM=1, F1=1) se prever "sem resposta" (um trecho vazio). Se prever qualquer trecho não vazio, recebe zero em ambas as métricas. Para perguntas respondíveis, o EM e o F1 padrão em nível de trecho são calculados. A pontuação geral é a média em todas as perguntas, dando peso igual a instâncias respondíveis e sem resposta.

Esse esquema de pontuação incentiva os modelos a serem conservadores: eles devem equilibrar a precisão em responder perguntas respondíveis contra o risco de responder incorretamente perguntas sem resposta. Um modelo que sempre adivinha uma resposta pontuará perto de zero na metade sem resposta, enquanto um modelo que sempre se abstém pontuará zero na metade respondível.

Impacto na Pesquisa

O SQuAD v2.0 rapidamente se tornou um benchmark padrão na comunidade de PNL, ao lado de seu predecessor. Ele impulsionou o desenvolvimento de modelos mais sofisticados que incorporam a previsão de respondibilidade como um componente explícito. Muitas abordagens iniciais de aprendizado profundo, como aquelas baseadas em transformadores, foram avaliadas neste conjunto de dados, levando a melhorias rápidas.

O conjunto de dados também influenciou o design de benchmarks posteriores, como Natural Questions e TriviaQA, que naturalmente incluem perguntas sem resposta. Ele destacou a importância da calibração e da abstenção na resposta a perguntas, um tópico que permanece relevante em modelos de linguagem de grande escala modernos.

Leaderboard e Estado da Arte

No lançamento, os melhores modelos alcançaram pontuações EM em torno de 60-65%, significativamente menores do que as pontuações de 80%+ no SQuAD 1.1, refletindo a dificuldade adicional. Com o tempo, os modelos melhoraram substancialmente. Em 2019, sistemas usando BERT e suas variantes alcançaram pontuações EM acima de 80%. Em 2023, as principais entradas no leaderboard oficial alcançam pontuações EM acima de 90%, frequentemente usando métodos de conjunto e conhecimento externo.

Apesar dessas pontuações altas, os pesquisadores observam que o SQuAD v2.0 ainda tem limitações, como sua dependência da Wikipédia e o fato de que as perguntas sem resposta são construídas artificialmente. No entanto, ele permanece uma ferramenta valiosa para avaliar a robustez da compreensão de leitura.

Trabalhos Relacionados e Extensões

O SQuAD v2.0 inspirou vários conjuntos de dados e tarefas subsequentes. Por exemplo, squad-shift introduziu mudanças de distribuição para testar a generalização, enquanto outros trabalhos exploraram perturbações adversariais. O conceito de respondibilidade foi incorporado em muitos sistemas de resposta a perguntas, incluindo aqueles usados em produção por empresas como Google Cloud e Amazon Web Services.

O conjunto de dados está disponível gratuitamente para pesquisa e é hospedado no site oficial do SQuAD, juntamente com scripts de avaliação e um leaderboard público. Ele continua sendo um ponto de referência para comparar novas arquiteturas e técnicas de treinamento no campo da compreensão de máquina.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:natural-language-processing·question-answering·dataset·machine-learning
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico