ScienceQA est un ensemble de données de référence à grande échelle conçu pour évaluer les capacités des systèmes d'intelligence artificielle à répondre à des questions scientifiques. Il a été introduit en 2022 par une équipe de chercheurs de l'Université de Californie à Los Angeles et d'autres institutions. L'ensemble de données comprend plus de 21 000 questions à choix multiples couvrant des sujets tels que la physique, la chimie, la biologie et les sciences de la Terre, chaque question étant accompagnée d'une image ou d'un diagramme et d'informations contextuelles. ScienceQA se distingue par sa nature multimodale, exigeant des modèles qu'ils intègrent la compréhension textuelle et visuelle pour parvenir à des réponses correctes.
La référence a été créée pour remédier aux limitations des ensembles de données de questions-réponses antérieurs, qui se concentraient souvent sur des tâches uniquement textuelles ou uniquement visuelles. ScienceQA offre un cadre plus réaliste et plus difficile, car les questions scientifiques impliquent fréquemment l'interprétation de diagrammes, de graphiques et de montages expérimentaux. Les questions proviennent des programmes de sciences des écoles primaires et secondaires, ce qui les rend accessibles à un large éventail de modèles d'IA tout en exigeant de véritables compétences de raisonnement. Chaque question est annotée avec des options à choix multiples, la réponse correcte et une explication lisible par l'humain, permettant à la fois l'évaluation et l'analyse du raisonnement des modèles.
Structure de l'ensemble de données et annotations
ScienceQA contient 21 208 questions, réparties en ensembles d'entraînement, de validation et de test. L'ensemble d'entraînement comprend 12 726 questions, l'ensemble de validation compte 4 241 questions et l'ensemble de test contient 4 241 questions. Chaque question est associée à une matière, un sujet, un niveau scolaire et une catégorie (par exemple, « sciences naturelles » ou « sciences sociales »). Les annotations incluent également un contexte textuel fournissant des informations de fond, ainsi qu'un diagramme ou une image lorsque cela est pertinent. La réponse correcte est fournie, accompagnée d'une explication concise rédigée par des annotateurs humains, qui sert de référence pour évaluer la qualité des explications générées par les modèles.
L'ensemble de données couvre un large éventail de sujets scientifiques, notamment la physique (par exemple, les forces, l'énergie), la chimie (par exemple, les réactions chimiques, les états de la matière), la biologie (par exemple, les cellules végétales et animales, les écosystèmes) et les sciences de la Terre (par exemple, la météo, les processus géologiques). Les questions sont conçues pour tester non seulement le rappel factuel, mais aussi les compétences de raisonnement, telles que l'application de concepts à de nouvelles situations, l'interprétation de données à partir de graphiques et l'inférence à partir de représentations visuelles.
Évaluation et modèles de référence
ScienceQA a été introduit parallèlement à une série d'expériences de référence utilisant divers modèles d'apprentissage automatique. Les auteurs ont évalué plusieurs approches, notamment des modèles traditionnels de vision-langage et des architectures plus récentes basées sur les transformeurs. L'un des principaux résultats a été que de nombreux modèles existants obtenaient de mauvaises performances sur ScienceQA, avec des taux de précision souvent inférieurs à 50 % sur l'ensemble de test, soulignant la difficulté de la référence. Le meilleur modèle de référence de l'époque utilisait un transformeur multimodal combinant des caractéristiques d'image avec des embeddings textuels, atteignant une précision d'environ 89 % sur l'ensemble de test, mais cela restait inférieur à la performance humaine, estimée à plus de 90 %.
Depuis, la référence est devenue un outil d'évaluation standard pour la recherche sur le raisonnement multimodal et les questions-réponses. Elle a été utilisée pour évaluer les capacités des grands modèles de langage et des modèles de vision-langage, y compris ceux développés par des organisations telles que OpenAI et Google DeepMind. Par exemple, des modèles comme GPT-4 et Gemini ont été testés sur ScienceQA, certains atteignant des taux de précision supérieurs à 90 %, démontrant des progrès significatifs dans le raisonnement en IA.
Rôle dans la recherche en IA
ScienceQA a joué un rôle crucial dans l'avancement de la recherche dans plusieurs domaines de l'intelligence artificielle. Il a été utilisé pour étudier l'efficacité du prompting par chaîne de pensée, où les modèles sont encouragés à générer des étapes de raisonnement intermédiaires avant de fournir une réponse. La recherche a montré que de telles techniques de prompting peuvent améliorer les performances sur ScienceQA, en particulier pour les grands modèles de langage. L'ensemble de données a également été employé pour étudier l'intégration des informations visuelles et textuelles, conduisant au développement de nouvelles architectures qui alignent mieux les représentations d'images et de langage.
De plus, ScienceQA a été utilisé pour explorer le concept d'explicabilité en IA. Étant donné que chaque question inclut une explication rédigée par un humain, les chercheurs peuvent comparer les explications générées par les modèles à ces références pour évaluer dans quelle mesure les modèles justifient leurs réponses. Cela a des implications pour la construction de systèmes d'IA dignes de confiance, car la capacité à fournir des explications cohérentes est cruciale pour les applications dans l'éducation et la recherche scientifique.
Limitations et orientations futures
Malgré ses points forts, ScienceQA présente certaines limitations. Les questions sont basées sur des programmes scolaires, ce qui peut ne pas capturer la complexité du raisonnement scientifique avancé. De plus, le format à choix multiples peut parfois permettre aux modèles de deviner correctement sans compréhension approfondie, bien que les explications aident à atténuer ce problème. L'ensemble de données est également statique, ce qui signifie qu'il ne reflète pas les découvertes scientifiques récentes ni les changements dans les programmes.
Les travaux futurs pourraient impliquer l'expansion de ScienceQA pour inclure des questions plus ouvertes, couvrir des sujets de niveau supérieur et intégrer des éléments dynamiques tels que des simulations interactives. Les chercheurs explorent également des moyens d'utiliser ScienceQA comme référence pour l'apprentissage continu, où les modèles doivent s'adapter à de nouveaux types de questions au fil du temps. À mesure que les systèmes d'IA continuent de s'améliorer, des références comme ScienceQA resteront essentielles pour mesurer les progrès et identifier les domaines nécessitant des recherches supplémentaires.