ScienceQA es un conjunto de datos de referencia a gran escala diseñado para evaluar las capacidades de los sistemas de inteligencia artificial para responder preguntas de ciencias. Fue presentado en 2022 por un equipo de investigadores de la Universidad de California, Los Ángeles, y otras instituciones. El conjunto de datos comprende más de 21,000 preguntas de opción múltiple que abarcan materias como física, química, biología y ciencias de la Tierra, y cada pregunta está acompañada de una imagen o diagrama e información contextual. ScienceQA se destaca por su naturaleza multimodal, que requiere que los modelos integren la comprensión textual y visual para llegar a respuestas correctas.
El punto de referencia fue creado para abordar las limitaciones de los conjuntos de datos de preguntas y respuestas anteriores, que a menudo se centraban en tareas solo de texto o solo de imagen. ScienceQA proporciona un entorno más realista y desafiante, ya que las preguntas de ciencias frecuentemente implican interpretar diagramas, gráficos y configuraciones experimentales. Las preguntas provienen de los planes de estudio de ciencias de primaria y secundaria, lo que las hace accesibles a una amplia gama de modelos de IA, aunque siguen requiriendo habilidades de razonamiento genuinas. Cada pregunta está anotada con opciones de opción múltiple, la respuesta correcta y una explicación legible por humanos, lo que permite tanto la evaluación como el análisis del razonamiento del modelo.
Estructura del conjunto de datos y anotaciones
ScienceQA contiene 21,208 preguntas, divididas en conjuntos de entrenamiento, validación y prueba. El conjunto de entrenamiento incluye 12,726 preguntas, el conjunto de validación tiene 4,241 preguntas y el conjunto de prueba contiene 4,241 preguntas. Cada pregunta está asociada con una materia, un tema, un nivel de grado y una categoría (por ejemplo, "ciencias naturales" o "ciencias sociales"). Las anotaciones también incluyen un contexto textual que proporciona información de fondo, y un diagrama o imagen cuando es relevante. Se proporciona la respuesta correcta, junto con una explicación concisa escrita por anotadores humanos, que sirve como referencia para evaluar la calidad de las explicaciones generadas por el modelo.
El conjunto de datos cubre una amplia gama de temas de ciencias, incluyendo física (por ejemplo, fuerzas, energía), química (por ejemplo, reacciones químicas, estados de la materia), biología (por ejemplo, células vegetales y animales, ecosistemas) y ciencias de la Tierra (por ejemplo, clima, procesos geológicos). Las preguntas están diseñadas para evaluar no solo el recuerdo factual, sino también habilidades de razonamiento, como aplicar conceptos a situaciones nuevas, interpretar datos de gráficos y hacer inferencias a partir de representaciones visuales.
Evaluación y modelos de referencia
ScienceQA fue presentado junto con un conjunto de experimentos de referencia utilizando varios modelos de aprendizaje automático. Los autores evaluaron varios enfoques, incluidos modelos tradicionales de visión y lenguaje y arquitecturas más recientes basadas en transformadores. Uno de los hallazgos clave fue que muchos modelos existentes se desempeñaron mal en ScienceQA, con tasas de precisión a menudo por debajo del 50% en el conjunto de prueba, lo que destaca la dificultad del punto de referencia. El modelo de referencia con mejor rendimiento en ese momento utilizaba un transformador multimodal que combinaba características de imagen con incrustaciones textuales, logrando una precisión de alrededor del 89% en el conjunto de prueba, pero esto aún estaba por debajo del rendimiento humano, que se estimó en más del 90%.
Desde entonces, el punto de referencia se ha convertido en una herramienta de evaluación estándar para la investigación en razonamiento multimodal y preguntas y respuestas. Se ha utilizado para evaluar las capacidades de los grandes modelos de lenguaje y los modelos de visión y lenguaje, incluidos los desarrollados por organizaciones como OpenAI y Google DeepMind. Por ejemplo, modelos como GPT-4 y Gemini han sido probados en ScienceQA, con algunos logrando tasas de precisión superiores al 90%, lo que demuestra un progreso significativo en el razonamiento de la IA.
Papel en la investigación de IA
ScienceQA ha desempeñado un papel crucial en el avance de la investigación en varias áreas de la inteligencia artificial. Se ha utilizado para estudiar la efectividad del prompting de cadena de pensamiento, donde se anima a los modelos a generar pasos de razonamiento intermedios antes de proporcionar una respuesta. La investigación ha demostrado que tales técnicas de prompting pueden mejorar el rendimiento en ScienceQA, particularmente para grandes modelos de lenguaje. El conjunto de datos también se ha empleado para investigar la integración de información visual y textual, lo que ha llevado al desarrollo de nuevas arquitecturas que alinean mejor las representaciones de imágenes y lenguaje.
Además, ScienceQA se ha utilizado para explorar el concepto de explicabilidad en la IA. Dado que cada pregunta incluye una explicación escrita por humanos, los investigadores pueden comparar las explicaciones generadas por el modelo con estas referencias para evaluar qué tan bien los modelos justifican sus respuestas. Esto tiene implicaciones para construir sistemas de IA confiables, ya que la capacidad de proporcionar explicaciones coherentes es crucial para aplicaciones en educación e investigación científica.
Limitaciones y direcciones futuras
A pesar de sus fortalezas, ScienceQA tiene ciertas limitaciones. Las preguntas se basan en planes de estudio de nivel escolar, que pueden no capturar la complejidad del razonamiento científico avanzado. Además, el formato de opción múltiple a veces puede permitir que los modelos adivinen correctamente sin una comprensión profunda, aunque las explicaciones ayudan a mitigar este problema. El conjunto de datos también es estático, lo que significa que no refleja descubrimientos científicos recientes ni cambios en los planes de estudio.
El trabajo futuro puede implicar expandir ScienceQA para incluir preguntas más abiertas, cubrir temas de nivel superior e incorporar elementos dinámicos como simulaciones interactivas. Los investigadores también están explorando formas de usar ScienceQA como un punto de referencia para el aprendizaje continuo, donde los modelos deben adaptarse a nuevos tipos de preguntas con el tiempo. A medida que los sistemas de IA continúan mejorando, puntos de referencia como ScienceQA seguirán siendo esenciales para medir el progreso e identificar áreas que requieren más investigación.