Traduit de l'anglais

SciQ est un ensemble de données de 13 679 questions d'examen scientifique à choix multiples avec des explications de réponses, utilisé pour évaluer et améliorer les capacités de raisonnement des systèmes d'intelligence artificielle, en particulier les grands modèles de langage.

SciQ est un ensemble de données de 13 679 questions scientifiques à choix multiples, conçu pour l'entraînement et l'évaluation des systèmes d'intelligence artificielle. Chaque question est accompagnée d'une réponse correcte et d'une explication justificative, ce qui en fait une ressource précieuse pour la recherche en compréhension de lecture automatique et en raisonnement scientifique. L'ensemble de données a été créé par des chercheurs de l'Allen Institute for Artificial Intelligence et publié en 2017, et il est depuis devenu une référence standard dans le domaine de la recherche en IA.

Les questions de SciQ sont tirées des programmes de sciences du collège et du lycée, couvrant des sujets tels que la physique, la chimie, la biologie et les sciences de la Terre. L'ensemble de données a été construit en extrayant des questions de ressources éducatives en ligne, puis en les filtrant et en les nettoyant pour garantir leur qualité. Les explications fournies pour chaque réponse sont généralement d'une ou deux phrases, offrant une justification concise de la raison pour laquelle l'option choisie est correcte. Cette caractéristique distingue SciQ de nombreux autres ensembles de données de questions-réponses, qui ne fournissent souvent que la réponse correcte sans justification.

Construction et composition

L'ensemble de données SciQ a été construit à l'aide d'une combinaison de processus automatisés et manuels. Le pool initial de questions a été collecté à partir de référentiels d'examens scientifiques publics et de sites Web éducatifs. Les chercheurs ont ensuite appliqué une série de filtres pour éliminer les questions mal formées ou ambiguës, aboutissant à un ensemble final de 13 679 éléments. Chaque question comporte quatre choix de réponse, avec exactement une option correcte. L'ensemble de données est divisé en ensembles d'entraînement (11 679 questions), de validation (1 000 questions) et de test (1 000 questions), permettant une évaluation cohérente entre différents modèles.

Un aspect notable de SciQ est qu'il inclut une explication pour chaque question, même celles de l'ensemble d'entraînement. Ce choix de conception permet d'utiliser l'ensemble de données pour des tâches allant au-delà de la simple prédiction de réponse, telles que la génération d'explications et l'apprentissage multitâche. Les explications sont généralement courtes et factuelles, fournissant le principe scientifique clé nécessaire pour résoudre la question.

Utilisation dans la recherche en IA

SciQ a été largement adopté comme référence pour évaluer les capacités de raisonnement des modèles de apprentissage automatique, en particulier dans le contexte du apprentissage profond et des réseaux de neurones. Les premiers modèles testés sur SciQ comprenaient des réseaux à mémoire augmentée et des architectures basées sur l'attention, qui ont atteint une précision modeste par rapport à la performance humaine. L'ensemble de données a également été utilisé pour entraîner et évaluer des grands modèles de langage, qui ont montré des améliorations significatives de performance à mesure que les modèles ont grandi en taille et en sophistication.

L'un des principaux défis posés par SciQ est qu'il exige des modèles non seulement de récupérer des connaissances factuelles, mais aussi d'appliquer un raisonnement logique pour sélectionner la bonne réponse parmi les distracteurs. Les explications fournissent un signal utile pour entraîner les modèles à générer des justifications, ce qui peut améliorer l'interprétabilité et la confiance dans les systèmes d'IA. Les chercheurs ont également utilisé SciQ pour étudier l'effet de la taille des données d'entraînement, de l'architecture du modèle et des stratégies de réglage fin sur la performance en questions-réponses.

Limites et critiques

Malgré sa popularité, SciQ présente plusieurs limites. Les questions sont relativement simples et se concentrent sur le rappel factuel plutôt que sur un raisonnement complexe en plusieurs étapes. En conséquence, les modèles de pointe ont atteint une précision quasi parfaite sur l'ensemble de test, ce qui a conduit certains chercheurs à affirmer que la référence est devenue saturée. De plus, l'ensemble de données est limité à la langue anglaise et à une gamme restreinte de sujets scientifiques, ce qui peut ne pas se généraliser à d'autres domaines ou langues.

Une autre critique est que les explications, bien qu'utiles, ne sont pas toujours suffisantes pour qu'un modèle apprenne un raisonnement robuste. Certaines questions peuvent être répondues correctement par correspondance de motifs sur le langage de la question et des choix de réponse, sans une compréhension approfondie de la science sous-jacente. Cela a incité le développement de références plus difficiles, telles que celles nécessitant un raisonnement multi-sauts ou l'intégration de connaissances externes.

Ensembles de données et références connexes

SciQ fait partie d'une famille plus large d'ensembles de données de questions-réponses dans la communauté de l'IA. Il est souvent comparé à d'autres ensembles de données axés sur les sciences, comme ARC (AI2 Reasoning Challenge), qui contient des questions plus difficiles nécessitant un raisonnement plus complexe. Alors qu'ARC est conçu pour être plus exigeant, SciQ est apprécié pour sa plus grande taille et la présence d'explications. D'autres références connexes incluent OpenBookQA, qui teste les connaissances de sens commun sur les sciences, et QASC, qui se concentre sur la combinaison de faits provenant de plusieurs phrases.

La disponibilité de SciQ a contribué au développement de systèmes de IA générative capables de répondre à des questions et de fournir des explications. Il a également été utilisé dans des applications de technologie éducative, telles que des systèmes de tutorat automatisés qui aident les étudiants à apprendre les sciences en fournissant des solutions étape par étape.

Impact et héritage

Depuis sa publication, SciQ a été cité dans des centaines d'articles de recherche et est devenu un outil standard pour évaluer les modèles d'IA dans la communauté du traitement du langage naturel. Son format simple et son protocole d'évaluation clair le rendent accessible aux chercheurs disposant de ressources informatiques limitées. L'ensemble de données a également été intégré dans plusieurs références plus vastes, telles que SuperGLUE et MMLU, qui agrègent plusieurs tâches pour fournir une évaluation plus complète des capacités des modèles.

Le succès de SciQ a inspiré la création d'ensembles de données similaires dans d'autres domaines, tels que la médecine et le droit, où les explications sont tout aussi importantes. Il a également mis en évidence la valeur de l'inclusion de justifications lisibles par l'humain dans les données d'entraînement, une pratique adoptée dans de nombreux systèmes d'IA modernes. En 2025, SciQ reste une ressource utile à des fins éducatives et pour l'évaluation initiale de nouveaux modèles, même si des références plus difficiles continuent d'émerger.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:dataset·question-answering·science·benchmark
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique