Traducido del inglés

SQuAD 2.0 es un conjunto de datos de respuesta a preguntas que combina 100,000 preguntas respondibles con 50,000 preguntas no respondibles, lo que requiere que los modelos se abstengan cuando no existe una respuesta. Fue introducido en 2018 por investigadores de la Universidad de Stanford para probar la comprensión lectora y la robustez.

SQuAD 2.0 (Stanford Question Answering Dataset 2.0) es un punto de referencia de comprensión lectora automática que amplía el conjunto de datos original SQuAD 1.1 añadiendo 50.000 preguntas sin respuesta. Estas preguntas sin respuesta están diseñadas para ser plausibles pero no tienen una respuesta válida en el artículo de Wikipedia correspondiente, lo que obliga a los modelos a determinar cuándo no existe una respuesta en lugar de extraer siempre un fragmento. El conjunto de datos contiene más de 150.000 preguntas en total, extraídas de 536 artículos de 10 categorías de Wikipedia, y fue publicado en junio de 2018 por Pranav Rajpurkar, Robin Jia y Percy Liang en el Stanford AI Lab.

La motivación principal de SQuAD 2.0 fue abordar una limitación de los conjuntos de datos de comprensión lectora anteriores, donde los modelos podían obtener puntuaciones altas seleccionando siempre algún fragmento de texto, incluso cuando la pregunta no tenía respuesta. Al incluir preguntas sin respuesta, el conjunto de datos exige que los sistemas primero decidan si existe una respuesta y luego extraigan el fragmento correcto si la hay. Esto hace que la tarea sea más realista para aplicaciones prácticas como los grandes modelos de lenguaje utilizados en motores de búsqueda y asistentes virtuales, donde las preguntas a menudo carecen de respuestas definitivas.

Construcción del conjunto de datos

Las preguntas sin respuesta en SQuAD 2.0 fueron creadas por trabajadores colaborativos a quienes se les mostró un párrafo de un artículo de Wikipedia y se les pidió que escribieran preguntas que no pudieran responderse solo con ese párrafo, pero que un lector humano pudiera razonablemente plantear. Cada pregunta sin respuesta se emparejó con una pregunta respondible similar en tema y redacción, asegurando que las preguntas sin respuesta no fueran triviales de detectar. El conjunto de datos final contiene 100.000 preguntas respondibles de SQuAD 1.1 y 50.000 nuevas preguntas sin respuesta, con un total de 150.000 pares de pregunta-respuesta. Los datos se dividen en conjuntos de entrenamiento (130.000 preguntas), desarrollo (11.873) y prueba (8.862), con el conjunto de prueba oculto para la evaluación oficial.

Métricas de evaluación

SQuAD 2.0 utiliza dos métricas principales: Coincidencia Exacta (EM) y puntuación F1. EM mide el porcentaje de predicciones que coinciden exactamente con una de las respuestas de referencia, mientras que F1 calcula la media armónica de precisión y recuperación sobre la superposición de tokens entre la predicción y la respuesta de referencia. Para preguntas sin respuesta, un modelo debe generar "sin respuesta" para recibir crédito; cualquier predicción de fragmento se considera incorrecta. La tabla de clasificación oficial clasifica los sistemas por el promedio de EM y F1, con una línea base que siempre predice "sin respuesta" logrando un F1 de 0.0, lo que demuestra la dificultad de la tarea.

Impacto en la investigación en PLN

SQuAD 2.0 se convirtió en un punto de referencia estándar para evaluar sistemas de comprensión lectora y respuesta a preguntas, impulsando una investigación significativa en inteligencia artificial y aprendizaje automático. Destacó la importancia de la abstención y la estimación de confianza en los modelos de redes neuronales, lo que llevó al desarrollo de arquitecturas que incorporan mecanismos de verificación o rechazo de respuestas. Muchos de los sistemas mejor clasificados en la tabla de clasificación han utilizado modelos basados en transformadores como BERT, RoBERTa y ALBERT, que fueron preentrenados en grandes corpus y ajustados en SQuAD 2.0. El conjunto de datos también influyó en puntos de referencia posteriores como Natural Questions y TyDi QA, que incluyen instancias sin respuesta como componente central.

Limitaciones y críticas

A pesar de su adopción generalizada, SQuAD 2.0 ha sido criticado por ciertas limitaciones. Las preguntas sin respuesta son generadas artificialmente por trabajadores colaborativos y pueden no reflejar la distribución de consultas sin respuesta del mundo real, que a menudo implican ambigüedad o falta de contexto. Además, el conjunto de datos se basa en artículos de Wikipedia, que están relativamente bien estructurados y son factuales, lo que facilita que los modelos identifiquen contradicciones o información faltante. Algunos investigadores han señalado que un alto rendimiento en SQuAD 2.0 no se traduce necesariamente en un rendimiento robusto en la respuesta a preguntas de dominio abierto, donde el modelo debe recuperar pasajes relevantes de un corpus grande. A partir de 2025, la tabla de clasificación se ha saturado, con los mejores modelos logrando puntuaciones F1 superiores a 95, pero el conjunto de datos sigue siendo una herramienta valiosa para evaluar la robustez y calibración de los modelos.

Trabajo relacionado y extensiones

SQuAD 2.0 ha inspirado varias extensiones y variantes. El desafío SQuAD 2.0 se presentó en el taller EMNLP 2018, y el conjunto de datos se ha utilizado en entornos educativos para enseñar procesamiento del lenguaje natural. También se ha incorporado en puntos de referencia de aprendizaje multitarea y se ha utilizado para evaluar las capacidades de razonamiento de los modelos de aprendizaje profundo. El concepto de preguntas sin respuesta se ha adoptado en otros dominios, como la respuesta a preguntas visuales y la IA conversacional, donde los modelos deben aprender a pedir aclaraciones o indicar cuándo no saben la respuesta. El conjunto de datos sigue siendo un recurso clave para los investigadores que estudian la comprensión lectora, y sus principios de diseño continúan informando la creación de puntos de referencia más desafiantes.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:natural-language-processing·question-answering·dataset·reading-comprehension
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial