Traducido del inglés

SQuAD v2.0 es un conjunto de datos de comprensión lectora que extiende SQuAD 1.1 con preguntas sin respuesta, evaluando la capacidad de los modelos para abstenerse cuando no existe una respuesta. Combina 100,000 preguntas respondibles y 50,000 preguntas sin respuesta de artículos de Wikipedia, introducido en 2018 por investigadores de la Universidad de Stanford.

SQuAD v2.0 (Stanford Question Answering Dataset versión 2.0) es un conjunto de datos de referencia para la comprensión lectora automática y el respuesta a preguntas. Extiende el conjunto de datos original SQuAD 1.1 añadiendo un conjunto sustancial de preguntas sin respuesta, lo que requiere que los modelos no solo extraigan los intervalos de respuesta correctos, sino también reconozcan cuándo una pregunta no puede responderse a partir del contexto dado. Este diseño aborda una limitación clave de los conjuntos de datos anteriores, donde los modelos podían lograr puntuaciones altas adivinando intervalos de respuesta sin comprender realmente el texto.

El conjunto de datos fue introducido en junio de 2018 por un equipo de Universidad de Stanford, liderado por Pranav Rajpurkar, Robin Jia y Percy Liang. Comprende 100,000 preguntas respondibles y 50,000 preguntas sin respuesta, todas derivadas del mismo conjunto de artículos de Wikipedia utilizado en SQuAD 1.1. Las preguntas sin respuesta son elaboradas por anotadores humanos que parafrasean preguntas plausibles que no están realmente respaldadas por el texto del artículo, lo que las hace difíciles de distinguir de las respondibles.

Motivación y Diseño

La motivación principal para SQuAD v2.0 fue abordar el problema de la "sobreconfianza" en los sistemas de comprensión lectora. En SQuAD 1.1, cada pregunta tenía un intervalo de respuesta garantizado en el contexto, por lo que los modelos podían entrenarse para extraer siempre algo, incluso si era incorrecto. Esto llevó a sistemas que funcionaban bien en el punto de referencia pero fallaban en aplicaciones del mundo real donde las preguntas a menudo no tienen respuesta. Al introducir preguntas sin respuesta, SQuAD v2.0 obliga a los modelos a aprender una habilidad más robusta: determinar la capacidad de respuesta antes de extraer un intervalo.

El proceso de construcción involucró a trabajadores colaborativos que primero escribieron preguntas respondibles basadas en un párrafo, y luego escribieron preguntas adicionales que son plausibles pero sin respuesta, a menudo alterando entidades, números o relaciones. Esto asegura que las preguntas sin respuesta sean semánticamente similares a las respondibles, haciendo la tarea genuinamente difícil.

Métricas de Evaluación

SQuAD v2.0 utiliza dos métricas principales: Coincidencia Exacta (EM) y puntuación F1. Sin embargo, a diferencia de SQuAD 1.1, la puntuación trata las preguntas sin respuesta de manera especial. Para preguntas sin respuesta, un modelo recibe crédito completo (EM=1, F1=1) si predice "sin respuesta" (un intervalo vacío). Si predice cualquier intervalo no vacío, obtiene cero en ambas métricas. Para preguntas respondibles, se calculan el EM y F1 estándar a nivel de intervalo. La puntuación general es el promedio de todas las preguntas, dando igual peso a las instancias respondibles y sin respuesta.

Este esquema de puntuación incentiva a los modelos a ser conservadores: deben equilibrar la precisión al responder preguntas respondibles contra el riesgo de responder incorrectamente a las sin respuesta. Un modelo que siempre adivina una respuesta obtendrá una puntuación cercana a cero en la mitad sin respuesta, mientras que un modelo que siempre se abstiene obtendrá cero en la mitad respondible.

Impacto en la Investigación

SQuAD v2.0 rápidamente se convirtió en un punto de referencia estándar en la comunidad de PNL, junto con su predecesor. Impulsó el desarrollo de modelos más sofisticados que incorporan la predicción de capacidad de respuesta como un componente explícito. Muchos enfoques tempranos de aprendizaje profundo, como los basados en transformadores, fueron evaluados en este conjunto de datos, llevando a mejoras rápidas.

El conjunto de datos también influyó en el diseño de puntos de referencia posteriores como Natural Questions y TriviaQA, que incluyen naturalmente preguntas sin respuesta. Destacó la importancia de la calibración y la abstención en el respuesta a preguntas, un tema que sigue siendo relevante en los modelos de lenguaje grandes modernos.

Tabla de Clasificación y Estado del Arte

Al momento de su lanzamiento, los mejores modelos lograron puntuaciones EM alrededor del 60-65%, significativamente más bajas que las puntuaciones superiores al 80% en SQuAD 1.1, reflejando la dificultad añadida. Con el tiempo, los modelos mejoraron sustancialmente. Para 2019, los sistemas que utilizaban BERT y sus variantes alcanzaron puntuaciones EM superiores al 80%. A partir de 2023, las entradas principales en la tabla de clasificación oficial logran puntuaciones EM superiores al 90%, a menudo utilizando métodos de conjunto y conocimiento externo.

A pesar de estas puntuaciones altas, los investigadores señalan que SQuAD v2.0 todavía tiene limitaciones, como su dependencia de Wikipedia y el hecho de que las preguntas sin respuesta son construidas artificialmente. No obstante, sigue siendo una herramienta valiosa para evaluar la robustez de la comprensión lectora.

Trabajo Relacionado y Extensiones

SQuAD v2.0 ha inspirado varios conjuntos de datos y tareas posteriores. Por ejemplo, squad-shift introdujo cambios de distribución para probar la generalización, mientras que otros trabajos han explorado perturbaciones adversarias. El concepto de capacidad de respuesta se ha incorporado en muchos sistemas de respuesta a preguntas, incluidos los utilizados en producción por empresas como Google Cloud y Amazon Web Services.

El conjunto de datos está disponible gratuitamente para investigación y se aloja en el sitio web oficial de SQuAD, junto con scripts de evaluación y una tabla de clasificación pública. Continúa siendo un punto de referencia para comparar nuevas arquitecturas y técnicas de entrenamiento en el campo de la comprensión automática.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:natural-language-processing·question-answering·dataset·machine-learning
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial