SQuAD 2.0 (Stanford Question Answering Dataset, versão 2.0) é um benchmark amplamente utilizado para avaliar as capacidades de compreensão de leitura de sistemas de processamento de linguagem natural. Lançado em 2018 por pesquisadores da Universidade de Stanford, ele se basea no conjunto de dados original SQuAD 1.1 ao introducir um desafio crítico: perguntas sem resposta. No SQuAD 2.0, cada parágrafo é associado a perguntas, algumas das quais não têm resposta presente no texto, forzando os modelos não apenas a extraer spans corretos, mas também a reconhecer quando uma pregunta é irrespondible. Este diseño testa directamente a capacidade de um sistema para raciocinar sobre a presença ou ausência de informação, indo além do simples emparejamiento de padrões.
O conjunto de dados consiste em más de 100.000 pares de preguntas e respostas derivados de más de 500 artículos da Wikipedia. Específicamente, contém aproximadamente 50.000 preguntas respondibles (retidas do SQuAD 1.1) e 50.000 preguntas adicionales não respondibles que foram escritas de forma adversarial por crowdworkers. Estas preguntas não respondibles são elaboradas para ser plausibles e similares em estilo às respondibles, muitas vezes usando entidades ou fatos relacionados pero incorrectos, o que torna a tarefa significativamente más difícil. A métrica de avaliação para SQuAD 2.0 é a puntuación Exact Match (EM), que exige que a resposta prevista pelo modelo coincida exatamente com a verdade fundamental, e a puntuación F1, que mede a superposición de tokens entre a previsão e a resposta verdadeira. Para preguntas não respondibles, um modelo recebe crédito somente se prevé "sem resposta" (um span vazio).
Antecedentes e Motivação
O SQuAD 1.1 original, lançado em 2016, se tornou o padrão de facto para a resposta a preguntas extractivas, onde os modelos receben um parágrafo e uma pregunta e devem seleccionar um span contiguo de texto como resposta. No entanto, esta configuração tinha uma limitação significativa: toda pregunta tinha garantida uma resposta no contexto proporcionado. Isso permitía que os modelos explorassem a estrutura do conjunto de dados, muitas vezes confiando em pistas léxicas superficiais em lugar de uma compreensão genuina. Para abordar isso, os criadores do SQuAD 2.0, liderados por Pranav Rajpurkar e Percy Liang, introdujeron preguntas não respondibles. O objetivo era criar uma avaliação más realista que refletisse os escenarios do mundo real onde os usuários podem fazer preguntas que não têm resposta nos documentos disponíveis, e um sistema robusto deveria ser capaz de dizer "não sei" em lugar de alucinar uma resposta.
Construção do Conjunto de Dados
A construção do SQuAD 2.0 envolveu um processo em duas etapas. Primeiro, as preguntas respondibles foram tomadas directamente do SQuAD 1.1, que foram generadas por crowdworkers que recebían um parágrafo e se lhes pedía escrever preguntas que pudessem ser respondidas por um span no texto. Segundo, para cada parágrafo, crowdworkers adicionais foram encargados de escrever preguntas não respondibles. Se lhes instruyó para criar preguntas que fossem gramaticalmente corretas, relevantes ao tema do parágrafo e plausibles, pero para as quais nenhum span no parágrafo proporcionara uma resposta correta. Para garantir a qualidade, os trabalhadores recebían exemplos de preguntas não respondibles boas e malas. O conjunto de datos final foi então filtrado e validado, resultando em uma divisão equilibrada de preguntas respondibles e não respondibles por parágrafo. Os parágrafos em si provienen de artículos da Wikipedia que cobren uma diversidade de temas, incluindo história, ciência e cultura.
Impacto no Desenvolvimento de Modelos
SQuAD 2.0 teve um impacto profundo no campo do machine learning e do natural language processing. Rapidamente se tornou um benchmark padrão para avaliar modelos de compreensão de leitura, e sua introducción impulsionó una investigación significativa sobre o manejo de preguntas não respondibles. Os primeiros modelos, como os baseados em recurrent neural networks e mecanismos de atención, tiveron dificultades com o novo desafío, muitas vezes prevendo uma resposta mesmo quando não existía. O benchmark impulsó o desenvolvimento de arquitecturas más sofisticadas, incluindo aquelas que incorporan um classificador de "sem resposta" ou usan um umbral na puntuación de confianza do span de resposta. O lançamento de modelos baseados em Transformer, particularmente BERT (Bidirectional Encoder Representations from Transformers) a finales de 2018, levou a melhoras rápidas no SQuAD 2.0. O pré-treinamento de BERT em um corpus grande permitiu-lhe alcanzar um desempeño quase humano nas preguntas respondibles e um desempeño significativamente mejor nas não respondibles, estabelecendo um novo estado da arte.
Evaluación e Significado
SQuAD 2.0 é considerado um benchmark más desafiante e realista que seu predecessor. A inclusión de preguntas não respondibles testa a capacidade de um modelo para realizar raciocinio lógico e para distinguir entre informação relevante e irrelevante. Um modelo que simplesmente adivina uma resposta para cada pregunta obterá uma puntuación pobre, já que falhará em todas as instancias não respondibles. O benchmark tem sido usado para comparar uma amplia gama de modelos, desde sistemas tradicionais baseados em características até modernos large language models. A partir de 2024, os modelos com melhor desempeño no SQuAD 2.0 alcanzan puntuaciones EM superiores a 90%, superando o desempeño humano, que se estima em alrededor de 86,8% EM. No entanto, mesmo com estas puntuaciones altas, os pesquisadores notan que os modelos podem ainda ser frágiles e podem falhar em exemplos adversariales ou em dados fora da distribución. SQuAD 2.0 permanece como um recurso fundamental para avaliar a compreensão de leitura e continua sendo citado em artículos de pesquisa e usado em cursos académicos sobre artificial intelligence.
Limitaciones e Direcciones Futuras
A pesar de seu uso generalizado, SQuAD 2.0 tem limitaciones. O conjunto de datos é extractivo, o que significa que as respostas devem ser um span contiguo do texto, o que não reflete a natureza generativa de muitos sistemas modernos de resposta a preguntas. Também depende de artículos da Wikipedia, que têm um estilo e uma estrutura particulares, potencialmente limitando a generalización a outros domínios. Além disso, as preguntas não respondibles, embora cuidadosamente elaboradas, podem não capturar completamente a complexidade das consultas do mundo real, que podem ser ambíguas ou requerir a síntesis de informação de múltiples fuentes. Em resposta, benchmarks más novos como Natural Questions e RACE foram introducidos, pero SQuAD 2.0 permanece como um ponto de referência clave. Direcciones futuras de pesquisa incluyen o desenvolvimento de modelos que possam manejar preguntas abertas, proporcionar explicaciones para suas respostas e detectar robustamente quando carecen de informação suficiente, construendo sobre a base estabelecida por SQuAD 2.0.