SIQA, abreviatura de Social IQa, es un conjunto de datos de referencia diseñado para evaluar las capacidades de razonamiento de sentido común social de los sistemas de inteligencia artificial. Consta de aproximadamente 38,000 preguntas de opción múltiple, cada una presenta una breve narrativa sobre una situación social seguida de una pregunta sobre el resultado probable o la acción apropiada, con tres opciones de respuesta. El punto de referencia se introdujo para abordar una brecha en la evaluación de la comprensión de la IA de las normas sociales, las intenciones y las dinámicas interpersonales, que son distintas del razonamiento puramente factual o lógico.
El conjunto de datos fue creado por investigadores de la Universidad de Washington y el Instituto Allen para la IA, con un artículo publicado en 2019. Las preguntas se derivan del marco de Razonamiento de Sentido Común Social Crowdsourced (CrowS-Pairs), pero SIQA se centra específicamente en preguntas de opción múltiple que requieren inferir implicaciones sociales. Cada pregunta está diseñada para probar si un modelo puede comprender señales sociales implícitas, como la cortesía, la empatía o las consecuencias probables de una acción en un contexto dado.
Estructura y Contenido
SIQA contiene 33,404 preguntas para entrenamiento, 1,954 para validación y 2,985 para prueba, totalizando 38,343 preguntas. Cada pregunta incluye una oración de contexto (por ejemplo, "Jordan quería contarle un secreto a Tracy"), una pregunta (por ejemplo, "¿Qué hará Jordan?") y tres opciones de respuesta (por ejemplo, "Jordan le contó el secreto a Tracy", "Jordan le pidió a Tracy que guardara el secreto", "Jordan le contó el secreto a todos"). La respuesta correcta se determina por el sentido común social, no por hechos explícitos en el texto. El conjunto de datos cubre una amplia gama de escenarios cotidianos, incluyendo conversaciones, interacciones familiares, situaciones laborales y amistades.
Propósito e Importancia
SIQA se desarrolló para ir más allá de los puntos de referencia estándar de procesamiento de lenguaje natural que se centran en el conocimiento factual o léxico. El razonamiento de sentido común social es un componente clave de la inteligencia humana, que permite a las personas navegar las interacciones sociales sin problemas. Para los sistemas de IA, como los modelos de lenguaje grandes y los transformadores, un buen desempeño en SIQA indica una capacidad para captar normas sociales implícitas y predecir el comportamiento humano. El punto de referencia se ha convertido en una herramienta de evaluación estándar en el campo de la investigación de inteligencia artificial, a menudo utilizado junto con otros puntos de referencia de razonamiento de sentido común como el Desafío del Esquema de Winograd y Physical IQA.
Evaluación y Rendimiento
Cuando se lanzó SIQA, los modelos con mejor rendimiento lograron una precisión de alrededor del 60-70%, que era significativamente superior al azar (33%) pero inferior al rendimiento humano, estimado en alrededor del 86%. Las mejoras posteriores en técnicas de aprendizaje automático y aprendizaje profundo, particularmente con la llegada de redes neuronales más grandes y modelos preentrenados, han llevado a puntuaciones más altas. Por ejemplo, los modelos basados en BERT y sus variantes han alcanzado niveles de precisión en la mitad de los 80, acercándose al rendimiento humano. Sin embargo, incluso los modelos de última generación todavía tienen dificultades con ciertos tipos de razonamiento social, como comprender el sarcasmo o las diferencias culturales matizadas.
Limitaciones y Críticas
A pesar de su uso generalizado, SIQA ha enfrentado críticas. Algunos investigadores argumentan que el conjunto de datos puede contener sesgos, ya que las preguntas son generadas por crowdsourcing y pueden reflejar el trasfondo cultural de los anotadores, principalmente de contextos occidentales de habla inglesa. Esto puede llevar a que los modelos aprendan normas sociales culturalmente específicas en lugar de universales. Además, se ha señalado que algunas preguntas tienen respuestas ambiguas o múltiples respuestas plausibles, lo que hace que el punto de referencia sea menos confiable para una evaluación detallada. También existe la preocupación de que un alto rendimiento en SIQA no se traduzca necesariamente en una comprensión social del mundo real, ya que las preguntas son simplificadas y carecen de la complejidad de las interacciones sociales reales.
Puntos de Referencia Relacionados y Direcciones Futuras
SIQA es parte de una familia más amplia de puntos de referencia de razonamiento de sentido común, incluyendo el Esquema de Winograd y CommonsenseQA. Estos puntos de referencia colectivamente buscan probar diferentes facetas del conocimiento de sentido común, desde lo físico hasta lo social. Las direcciones futuras de investigación incluyen desarrollar conjuntos de datos más diversos e inclusivos culturalmente, incorporar señales sociales multimodales (por ejemplo, expresiones faciales, tono de voz) y evaluar modelos en entornos interactivos donde deben razonar sobre dinámicas sociales en tiempo real. A medida que los sistemas de IA se integran más en la vida diaria, puntos de referencia como SIQA siguen siendo cruciales para asegurar que puedan interactuar con los humanos de maneras socialmente apropiadas.
Véase También
- Razonamiento de sentido común
- Procesamiento de lenguaje natural
- Evaluación de sistemas de IA