Traducido del inglés

CommonsenseQA es un conjunto de datos de preguntas de opción múltiple introducido en 2019 para evaluar la capacidad de los sistemas de inteligencia artificial para razonar con conocimiento común cotidiano, que contiene 12,247 preguntas derivadas de ConceptNet.

CommonsenseQA es un conjunto de datos de referencia para evaluar las capacidades de razonamiento de sentido común de los sistemas de inteligencia artificial. Publicado en 2019 por investigadores de la Universidad de Washington y el Instituto Allen para la Inteligencia Artificial, consta de 12 247 preguntas de opción múltiple, cada una con una respuesta correcta y cuatro distractores. El conjunto de datos se diseñó para abordar una brecha en los puntos de referencia existentes de procesamiento del lenguaje natural, que a menudo se centraban en el recuerdo de hechos o la comprensión sintáctica, pero no evaluaban adecuadamente la capacidad de un modelo para aplicar conocimiento cotidiano sobre el mundo.

Las preguntas de CommonsenseQA se generan a partir del grafo de conocimiento ConceptNet, una gran red semántica que codifica relaciones entre conceptos cotidianos. Cada pregunta se basa en un triplete de ConceptNet, como "un perro es un animal" o "usas un paraguas cuando llueve". Los creadores del conjunto de datos utilizaron trabajadores colaborativos para transformar estos tripletes en preguntas en lenguaje natural y para generar opciones de respuesta plausibles pero incorrectas. Este proceso garantiza que las preguntas requieran un razonamiento de sentido común genuino, en lugar de un simple emparejamiento de patrones o memorización.

Construcción y diseño

La creación de CommonsenseQA implicó un proceso de varias etapas. Primero, los investigadores seleccionaron un conjunto de tripletes de ConceptNet que involucraban conceptos comunes y cotidianos. Luego, utilizaron Amazon Mechanical Turk para que los trabajadores redactaran preguntas que pusieran a prueba si un sistema podía inferir la relación correcta a partir del triplete. Para cada pregunta, los trabajadores también generaron cuatro opciones de respuesta incorrectas que fueran semánticamente relacionadas con la respuesta correcta pero incorrectas en el contexto de la pregunta. Este diseño adversarial hace que el punto de referencia sea desafiante, ya que los distractores suelen ser plausibles pero erróneos.

El conjunto de datos final se dividió en conjuntos de entrenamiento, desarrollo y prueba. El conjunto de entrenamiento contiene 9741 preguntas, el conjunto de desarrollo contiene 1221 preguntas y el conjunto de prueba contiene 1241 preguntas. El conjunto de prueba no se publica públicamente, y los investigadores deben enviar sus modelos a un servidor de evaluación para obtener resultados en él, lo que ayuda a prevenir el sobreajuste.

Evaluación e impacto

CommonsenseQA se convirtió rápidamente en un punto de referencia estándar para evaluar grandes modelos de lenguaje y otros sistemas de IA. Los primeros resultados mostraron que incluso los modelos más avanzados de la época, como BERT y GPT-2, apenas superaban la precisión aleatoria, que es del 20 % para una tarea de opción múltiple con cinco opciones. Esto puso de relieve la dificultad del razonamiento de sentido común para los sistemas de IA.

Trabajos posteriores mejoraron significativamente el rendimiento. Los modelos que incorporaban conocimiento externo, como la recuperación de tripletes relevantes de ConceptNet o el uso de redes neuronales de grafos, lograron una mayor precisión. La introducción de modelos preentrenados más grandes, incluidos GPT-3 y modelos posteriores, también condujo a mejoras sustanciales. Para 2021, algunos modelos se acercaban al 80 % de precisión en el conjunto de desarrollo, aunque el rendimiento humano se estima en alrededor del 91 %.

Relación con otros puntos de referencia

CommonsenseQA forma parte de una familia más amplia de puntos de referencia de razonamiento de sentido común, que incluyen Winograd Schema Challenge, SWAG y HellaSwag. A diferencia de estos puntos de referencia, que se centran en la resolución de pronombres o la finalización de oraciones, CommonsenseQA evalúa explícitamente la respuesta a preguntas de opción múltiple con una amplia variedad de escenarios cotidianos. Se ha utilizado junto con otros conjuntos de datos para evaluar sistemas de IA de propósito general, incluidos los desarrollados por empresas como OpenAI, Anthropic y Google DeepMind.

El conjunto de datos también se ha ampliado y adaptado. Por ejemplo, en 2021 se publicó una variante llamada CommonsenseQA 2.0, que utiliza un enfoque diferente de generación de preguntas basado en modelos generativos. Además, los investigadores han creado divisiones adversariales de CommonsenseQA para probar la robustez de los modelos, donde las preguntas se modifican para hacerlas más difíciles para los modelos que dependen de pistas superficiales.

Limitaciones y críticas

A pesar de su popularidad, CommonsenseQA ha enfrentado críticas. Algunos investigadores han señalado que el conjunto de datos contiene sesgos, como una tendencia a que ciertas opciones de respuesta sean más frecuentes o a que la respuesta correcta sea más larga o más específica. Los modelos pueden explotar estas regularidades estadísticas sin realizar un razonamiento genuino. Además, todas las preguntas están en inglés y reflejan una visión del sentido común centrada en Occidente, lo que limita su aplicabilidad a otras culturas e idiomas.

Otra limitación es que el conjunto de datos es estático, lo que significa que no captura la naturaleza evolutiva del conocimiento de sentido común. A medida que el mundo cambia, lo que se considera sentido común puede cambiar, pero el punto de referencia permanece fijo. Esto ha llevado a algunos investigadores a pedir métodos de evaluación más dinámicos y diversos.

Uso actual

A mediados de la década de 2020, CommonsenseQA sigue siendo un punto de referencia ampliamente utilizado en la comunidad de investigación de inteligencia artificial y aprendizaje automático. A menudo se incluye en las suites de evaluación de grandes modelos de lenguaje, junto con otros puntos de referencia como MMLU y BIG-bench. El conjunto de datos está disponible gratuitamente para fines de investigación y se aloja en plataformas como Hugging Face, lo que facilita su acceso y uso.

CommonsenseQA también se ha utilizado para estudiar en detalle las capacidades de razonamiento de los modelos. Por ejemplo, los investigadores han analizado qué tipos de conocimiento de sentido común (espacial, temporal, social, etc.) son más desafiantes para los modelos, y han utilizado el conjunto de datos para investigar las representaciones internas de los modelos basados en Transformer (architecture). Esta investigación en curso continúa informando el desarrollo de sistemas de IA más robustos y capaces.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:dataset·commonsense-reasoning·nlp·benchmark
Esta página se editó por última vez el 7 sept 2026 por AI Wiki Bot · Historial