SQuAD-Shifts é um conjunto de dados de referência projetado para avaliar a robustez de modelos de resposta a perguntas sob mudança de distribuição. Foi introduzido em 2019 por pesquisadores do Google (incluindo John Miller, Karl Krauth e Ludwig Schmidt) como um complemento ao Stanford Question Answering Dataset (SQuAD). O conjunto de dados consiste em novos pares de perguntas e respostas coletados de artigos da Wikipédia que não estavam presentes nos dados de treinamento originais do SQuAD, criando uma mudança natural na distribuição de tópicos e no estilo de escrita. O objetivo principal é medir o quão bem modelos treinados no SQuAD generalizam para dados não vistos, uma propriedade crítica para a implantação no mundo real de sistemas de inteligência artificial.
O benchmark inclui três subconjuntos distintos: SQuAD-Shifts-New, que contém perguntas sobre artigos da Wikipédia totalmente novos; SQuAD-Shifts-Wiki, que usa artigos que existiam durante a criação do SQuAD, mas não foram incluídos no conjunto de dados original; e SQuAD-Shifts-Reddit, que inclui perguntas de usuários do Reddit sobre artigos da Wikipédia. Cada subconjunto introduz um tipo diferente de mudança de distribuição, desde novidade de tópico até variação estilística. O conjunto de dados é construído no mesmo formato do SQuAD, com cada exemplo contendo um parágrafo de contexto, uma pergunta e um conjunto de trechos de resposta.
Motivação e Design
A mudança de distribuição é um desafio fundamental em aprendizado de máquina, onde modelos treinados em uma distribuição de dados frequentemente apresentam desempenho ruim quando aplicados a outra. O SQuAD-Shifts foi criado para fornecer uma avaliação controlada, porém realista, desse fenômeno. Diferentemente de perturbações sintéticas, as mudanças no SQuAD-Shifts surgem de variações naturais em conteúdo gerado por humanos. O design segue o princípio de que a robustez deve ser medida em dados plausivelmente encontrados na implantação, não apenas em exemplos adversariais elaborados.
O conjunto de dados aproveita a estrutura da Wikipédia, que é continuamente editada e expandida. Ao coletar novos artigos e perguntas após o lançamento original do SQuAD, os criadores garantiram que os dados de teste são temporalmente disjuntos dos dados de treinamento. Essa separação temporal é uma característica-chave, pois impede que os modelos memorizem artigos específicos e os força a depender de habilidades gerais de compreensão.
Protocolo de Avaliação
A avaliação padrão no SQuAD-Shifts usa as mesmas métricas do SQuAD: Exact Match (EM) e pontuação F1. O EM mede a porcentagem de previsões que correspondem exatamente a uma das respostas de referência, enquanto o F1 calcula a média harmônica de precisão e revocação na sobreposição em nível de token. Os modelos são tipicamente treinados no conjunto de treinamento original do SQuAD e então avaliados nos três subconjuntos do SQuAD-Shifts sem qualquer adaptação. A queda de desempenho em comparação com o conjunto de desenvolvimento do SQuAD dentro da distribuição quantifica a sensibilidade do modelo à mudança de distribuição.
No artigo original, os autores avaliaram vários modelos de linha de base, incluindo BiDAF e BERT. Eles descobriram que todos os modelos exibiam degradação significativa de desempenho nos subconjuntos deslocados, com quedas maiores no SQuAD-Shifts-Reddit, que contém formulações de perguntas mais informais e variadas. Isso destacou que mesmo modelos poderosos de aprendizado profundo como arquiteturas baseadas em transformadores não eram robustos a mudanças naturais de distribuição, motivando mais pesquisas em adaptação de domínio e treinamento robusto.
Relação com Outros Benchmarks
O SQuAD-Shifts faz parte de uma família mais ampla de benchmarks de mudança de distribuição em processamento de linguagem natural. Ele complementa conjuntos de dados como GLUE-X e RobustQA, que também testam generalização sob várias perturbações. No entanto, o SQuAD-Shifts é único em seu uso de mudanças que ocorrem naturalmente, em vez de modificações artificiais. Isso o torna um proxy mais realista para condições do mundo real, onde as distribuições de dados evoluem ao longo do tempo devido a mudanças no comportamento do usuário, criação de conteúdo e uso da linguagem.
O benchmark tem sido influente no desenvolvimento da avaliação de modelos de linguagem de grande porte. Muitos estudos subsequentes usaram o SQuAD-Shifts para avaliar a robustez de modelos como a série GPT da OpenAI e os modelos do Google DeepMind. Também foi usado para comparar diferentes estratégias de treinamento, como aumento de dados e adaptação de domínio, mostrando que essas técnicas podem mitigar, mas não eliminar, a lacuna de desempenho.
Limitações e Críticas
Uma limitação do SQuAD-Shifts é que ele cobre apenas compreensão de leitura, uma tarefa estreita dentro da compreensão de linguagem natural. As mudanças também são limitadas a conteúdo baseado na Wikipédia, que pode não refletir mudanças em outros domínios, como notícias, mídias sociais ou documentos técnicos. Além disso, o conjunto de dados é relativamente pequeno em comparação com corpora de treinamento modernos, o que pode levar a alta variância nos resultados de avaliação. Alguns pesquisadores notaram que a queda de desempenho no SQuAD-Shifts pode ser parcialmente devida a diferenças na dificuldade das perguntas, em vez de pura mudança de distribuição, embora os criadores tenham controlado isso combinando tipos de perguntas.
Apesar dessas limitações, o SQuAD-Shifts continua sendo um benchmark amplamente usado para pesquisa em robustez. Ele foi incorporado a vários leaderboards e suítes de avaliação, incluindo o Robustness Gym. O conjunto de dados está disponível publicamente e pode ser baixado do repositório oficial, permitindo que pesquisadores reproduzam resultados e estendam a análise.
Impacto e Legado
A introdução do SQuAD-Shifts contribuiu para uma crescente conscientização do problema de mudança de distribuição em inteligência artificial. Ele forneceu evidência empírica de que modelos alcançando resultados de ponta em benchmarks padrão poderiam falhar dramaticamente em dados ligeiramente diferentes. Isso influenciou o design de benchmarks subsequentes, como a suíte WILDS, que inclui múltiplos domínios e tarefas com mudanças naturais. Também estimulou pesquisa em técnicas como aprendizado de representação invariante a domínio e adaptação em tempo de teste.
No contexto de IA generativa, o SQuAD-Shifts tem sido usado para avaliar a robustez de modelos como o Claude da Anthropic e os serviços de IA do Google Cloud. O foco do benchmark em mudanças naturais o torna particularmente relevante para aplicações onde os dados estão em constante evolução, como mecanismos de busca e assistentes virtuais. Em 2024, o SQuAD-Shifts continua sendo citado em artigos sobre robustez de modelos e é considerado uma ferramenta padrão para avaliar generalização em resposta a perguntas.