SQuAD 1.1 (Stanford Question Answering Dataset) é um benchmark amplamente utilizado para avaliar sistemas de compreensão de leitura e resposta a perguntas em processamento de linguagem natural. O conjunto de dados consiste em mais de 100.000 pares de pergunta-resposta gerados por trabalhadores colaborativos com base em um conjunto de artigos da Wikipédia. Cada pergunta pode ser respondida extraindo um trecho contíguo de texto do artigo correspondente, tornando o SQuAD 1.1 uma tarefa de extração de trechos. Foi introduzido por pesquisadores do Stanford AI Lab em 2016 e, desde então, tornou-se um ponto de referência padrão para medir o progresso em leitura automática.
O objetivo principal do SQuAD 1.1 é testar se um modelo pode compreender uma passagem fornecida e localizar a resposta exata a uma pergunta dentro dela. Diferentemente de tarefas generativas de resposta a perguntas, o SQuAD 1.1 exige que o modelo produza uma substring do contexto fornecido. Esse design simplifica a avaliação e permite a pontuação automática com base em correspondência exata e pontuação F1. O conjunto de dados cobre uma gama diversificada de tópicos da Wikipédia, incluindo história, ciência e biografia, garantindo ampla cobertura de conhecimento factual.
Construção do Conjunto de Dados
A construção do SQuAD 1.1 envolveu duas etapas principais: seleção de artigos e geração de perguntas-respostas. Os criadores selecionaram 536 artigos da Wikipédia, cobrindo várias categorias, como geografia, esportes e entretenimento. Os trabalhadores colaborativos foram então solicitados a ler cada artigo e gerar perguntas que pudessem ser respondidas usando uma frase ou expressão específica do texto. Eles também forneceram o trecho de resposta exato, que foi posteriormente validado por outros trabalhadores. Esse processo resultou em 107.785 pares de pergunta-resposta, com uma média de cerca de 200 perguntas por artigo.
Cada pergunta no SQuAD 1.1 está associada a um único trecho de resposta, embora algumas perguntas possam ter múltiplas respostas válidas se o artigo contiver frases sinônimas. O conjunto de dados foi dividido em um conjunto de treinamento de 87.599 perguntas e um conjunto de desenvolvimento de 10.570 perguntas, com as perguntas restantes usadas para avaliação em teste oculto. O conjunto de desenvolvimento é comumente usado para ajuste de modelos, enquanto o conjunto de teste é reservado para submissões oficiais ao ranking.
Métricas de Avaliação
O SQuAD 1.1 é avaliado usando duas métricas principais: Correspondência Exata (EM) e pontuação F1. A EM mede a porcentagem de previsões que correspondem exatamente à resposta de referência, ignorando pontuação e artigos. A pontuação F1 calcula a média harmônica de precisão e revocação entre os tokens de resposta previstos e verdadeiros, fornecendo uma medida mais tolerante que considera correspondências parciais. Ambas as métricas são calculadas como média sobre todas as perguntas no conjunto de dados.
Por exemplo, se a resposta verdadeira é "Barack Obama" e um modelo prevê "Obama", a pontuação EM seria 0 para essa pergunta, mas a pontuação F1 seria 0,5 (já que dois dos quatro tokens correspondem). Essas métricas se tornaram padrão no campo, e muitos benchmarks subsequentes adotaram protocolos de avaliação semelhantes. Os modelos de linha de base iniciais usando redes neurais alcançaram pontuações F1 em torno de 70%, enquanto o desempenho humano é estimado em 91,2% de F1 e 82,3% de EM.
Impacto na Pesquisa
O SQuAD 1.1 desempenhou um papel crucial no avanço da pesquisa em processamento de linguagem natural, particularmente no desenvolvimento de modelos de aprendizado profundo para compreensão de leitura. Antes de seu lançamento, a maioria dos sistemas de resposta a perguntas dependia de características artesanais e técnicas tradicionais de aprendizado de máquina. O conjunto de dados forneceu um ambiente de teste padronizado e em grande escala que incentivou o desenvolvimento de arquiteturas mais sofisticadas de redes neurais, incluindo mecanismos de atenção e modelos baseados em transformers.
Muitos modelos influentes foram avaliados no SQuAD 1.1, como o modelo BiDAF (Bidirectional Attention Flow) e, posteriormente, modelos de linguagem pré-treinados estilo BERT. O sucesso desses modelos no SQuAD 1.1 demonstrou a eficácia do aprendizado por transferência e dos modelos de linguagem de grande escala na compreensão de contexto. O conjunto de dados também estimulou pesquisa em técnicas de aumento de dados e poda de modelos para melhorar desempenho e eficiência.
Limitações e Legado
Apesar de sua popularidade, o SQuAD 1.1 tem limitações conhecidas. O formato de extração de trechos restringe as respostas a texto contíguo, o que não reflete todos os cenários reais de resposta a perguntas, onde as respostas podem exigir síntese ou raciocínio entre múltiplas frases. Além disso, o conjunto de dados contém alguns vieses, como uma tendência das perguntas a focar em entidades nomeadas e datas, o que pode levar os modelos a depender de padrões superficiais em vez de compreensão profunda.
Para abordar essas questões, versões subsequentes como o SQuAD 2.0 introduziram perguntas sem resposta, e outros benchmarks como Natural Questions e TriviaQA expandiram o escopo. No entanto, o SQuAD 1.1 continua sendo um recurso fundamental no campo. É frequentemente usado como tarefa de pré-treinamento ou ajuste fino para modelos de linguagem de grande escala e continua servindo como linha de base para avaliar novas arquiteturas. Sua influência se estende além da academia, já que muitas equipes da indústria, incluindo as do Google DeepMind e da OpenAI, o usaram para validar seus sistemas.
Conclusão
O SQuAD 1.1 é um conjunto de dados marcante que moldou o desenvolvimento de sistemas modernos de compreensão de leitura. Ao fornecer um corpus grande e de alta qualidade e métricas de avaliação claras, possibilitou progresso rápido em inteligência artificial e continua sendo uma referência chave para pesquisadores e profissionais. Embora benchmarks mais novos tenham surgido, a simplicidade e robustez do SQuAD 1.1 garantem sua relevância contínua no campo.