Traduzido do inglês

SQuAD v1.1 é um conjunto de dados de compreensão de leitura com mais de 100.000 pares de pergunta-resposta derivados de artigos da Wikipédia, usado para avaliar sistemas de resposta a perguntas extrativas. Foi introduzido pela Universidade de Stanford em 2016.

SQuAD v1.1 (Stanford Question Answering Dataset) é um conjunto de dados de referência amplamente utilizado para compreensão lectora extrativa e resposta a perguntas. Consiste em mais de 100.000 pares de perguntas e respostas gerados por trabalhadores colaborativos com base em um conjunto de 536 artículos da Wikipedia. A tarefa exige que um modelo identifique a resposta correta como um segmento contiguo de texto dentro de uma passagem dada, tornando-o uma avaliação fundamental para sistemas de compreensão de linguagem natural.

O conjunto de dados foi introducido por pesquisadores do Stanford AI Lab em 2016, com a versão inicial lançada em junho de 2016 e a atualização v1.1 publicada em dezembro de 2016. Fue projetado para incentivar o desenvolvimento de modelos que possam ler e compreender texto a um nível mais próximo do desempeño humano. As perguntas são desenhadas para ser respondidas somente a partir do parágrafo fornecido, sem requerir conhecimento externo, e cada pregunta tem uma única resposta correta como segmento.

Estrutura e Criação

SQuAD v1.1 foi construído seleccionando 536 artículos da Wikipedia em inglês que cobrem uma amplia gama de temas, incluindo ciência, história e biografia. Trabalhadores colaborativos no Amazon Mechanical Turk foram solicitados a ler cada parágrafo e generar preguntas e respuestas correspondentes. Cada resposta devía ser um segmento textual literal da passagem, garantizando que o conjunto de dados pudesse ser usado para tarefas de QA extrativa. O conjunto final contém 107.785 pares de preguntas e respuestas, divididos em um conjunto de treinamento de 87.599 pares, um conjunto de desenvolvimento de 10.570 pares e um conjunto de teste oculto usado para avaliação oficial.

O conjunto de dados incluye uma amplia variedad de tipos de preguntas, como quem, quê, quando, onde, por qué e como. Esta diversidade desafía os modelos a realizar diferentes tipos de raciocinio, incluindo reconhecimento de entidades, raciocinio temporal e inferência causal. Os segmentos de resposta variam desde tokens únicos até passagens de múltiples frases, embora a maioria sejam frases curtas.

Métricas de Evaluación

Os modelos são avaliados em duas métricas principais: Exact Match (EM) e F1 score. EM mide a porcentagem de predicciones que coinciden exatamente com a resposta de referência, ignorando puntuación e artículos. F1 score calcula a média harmónica de precisión e recall entre os tokens preditos e de referência, proporcionando uma medida más leniente que recompensa coincidencias parciales. Estas métricas se tornaram padrão no campo da compreensão lectora e são usadas em muitos conjuntos de datos posteriores.

O desempeño humano em SQuAD v1.1 é estimado em 82,3 EM e 91,2 F1, proporcionando um ponto de referencia para comparação de modelos. Os primeiros modelos tuvieron dificultades para superar 50% F1, mas o progresso rápido em deep learning e arquitecturas de redes neuronales levou a melhorias significativas em poucos anos.

Impacto e Legado

SQuAD v1.1 desempeñó um papel fundamental no avanço da pesquisa em machine learning e inteligencia artificial. Proporcionó um benchmark estandarizado e de gran escala que permitió aos pesquisadores comparar objetivamente o desempeño dos modelos. O conjunto de datos impulsó o desenvolvimento de muitas arquitecturas influyentes, incluindo os modelos baseados em Transformer que posteriormente se tornaron a base dos modernos grandes modelos de linguagem.

Notablemente, o lançamento de SQuAD v1.1 coincidiu com o surgimiento de mecanismos de atención e atención multi-cabeza no processamento de linguagem natural. Modelos como BiDAF (Bidirectional Attention Flow) e posteriormente BERT alcanzaron resultados de vanguardia neste benchmark, demonstrando o poder dos paradigmas de pre-treinamento e fine-tuning. O éxito destes modelos em SQuAD v1.1 ajudou a validar a eficacia dos frameworks encoder-decoder e sequence-to-sequence.

O conjunto de datos também influyó na criação de benchmarks posteriores, incluindo SQuAD v2.0, que agregó preguntas não respondibles para testar a robustez dos modelos. Muitos outros conjuntos de datos de compreensão lectora, como RACE e TriviaQA, foram desenhados com princípios similares, mas SQuAD v1.1 permanece como um dos benchmarks más citados e ampliamente usados no campo.

Limitaciones e Críticas

A pesar de su éxito, SQuAD v1.1 tiene varias limitaciones. A natureza extrativa da tarefa significa que os modelos só precisam identificar um segmento de texto, em lugar de generar respostas novas. Esto pode levar a modelos que são bons em localizar informação, pero menos capaces de sintetizar ou raciocinar sobre ela. O conjunto de datos também depende de artículos da Wikipedia, o que pode introducir sesgos na cobertura de temas e no estilo de escrita.

Además, as preguntas generadas por colaboradores às vezes contienen ambiguidades ou requieren raciocinio de sentido común que não está explicitamente declarado na passagem. A medida que os modelos melhoraron, a brecha entre o desempeño humano e o da máquina se estrechó, levando a preocupações sobre a capacidade do conjunto de datos para diferenciar entre sistemas de alto desempeño. Estas questões motivaron a criação de benchmarks más desafiantes e a exploración de enfoques de IA generativa que van más allá da resposta extrativa.

Vea También

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:natural-language-processing·dataset·question-answering·benchmark
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico