Traduit de l'anglais

CommonsenseQA est un ensemble de données de questions à choix multiples introduit en 2019 pour évaluer la capacité des systèmes d'IA à raisonner avec des connaissances de bon sens quotidiennes, contenant 12 247 questions dérivées de ConceptNet.

CommonsenseQA est un ensemble de données de référence pour évaluer les capacités de raisonnement de sens commun des systèmes d'intelligence artificielle. Publié en 2019 par des chercheurs de l'Université de Washington et de l'Allen Institute for Artificial Intelligence, il se compose de 12 247 questions à choix multiples, chacune avec une réponse correcte et quatre options de distraction. L'ensemble de données a été conçu pour combler une lacune dans les références existantes en traitement du langage naturel, qui se concentraient souvent sur le rappel factuel ou la compréhension syntaxique, mais ne testaient pas adéquatement la capacité d'un modèle à appliquer des connaissances quotidiennes sur le monde.

Les questions de CommonsenseQA sont générées à partir du graphe de connaissances ConceptNet, un grand réseau sémantique qui encode les relations entre les concepts quotidiens. Chaque question est basée sur un triplet de ConceptNet, comme « un chien est un animal » ou « on utilise un parapluie quand il pleut ». Les créateurs de l'ensemble de données ont utilisé des travailleurs crowdsourcés pour transformer ces triplets en questions en langage naturel et pour générer des choix de réponses plausibles mais incorrects. Ce processus garantit que les questions nécessitent un véritable raisonnement de sens commun plutôt qu'un simple appariement de motifs ou une mémorisation.

Construction et conception

La création de CommonsenseQA a impliqué un pipeline en plusieurs étapes. D'abord, les chercheurs ont sélectionné un ensemble de triplets de ConceptNet impliquant des concepts courants et quotidiens. Ils ont ensuite utilisé Amazon Mechanical Turk pour demander à des travailleurs d'écrire des questions qui testeraient si un système pouvait déduire la relation correcte à partir du triplet. Pour chaque question, les travailleurs ont également généré quatre réponses de distraction sémantiquement liées à la réponse correcte mais incorrectes dans le contexte de la question. Cette conception antagoniste rend la référence difficile, car les distracteurs sont souvent plausibles mais faux.

L'ensemble de données final a été divisé en ensembles d'entraînement, de développement et de test. L'ensemble d'entraînement contient 9 741 questions, l'ensemble de développement contient 1 221 questions et l'ensemble de test contient 1 241 questions. L'ensemble de test n'est pas publiquement publié, et les chercheurs doivent soumettre leurs modèles à un serveur d'évaluation pour obtenir des résultats, ce qui aide à prévenir le surapprentissage.

Évaluation et impact

CommonsenseQA est rapidement devenu une référence standard pour évaluer les grands modèles de langage et d'autres systèmes d'IA. Les premiers résultats ont montré que même les modèles de pointe de l'époque, tels que BERT et GPT-2, performaient à peine mieux que le hasard, soit une précision de 20 % pour une tâche à choix multiples avec cinq options. Cela a souligné la difficulté du raisonnement de sens commun pour les systèmes d'IA.

Des travaux ultérieurs ont considérablement amélioré les performances. Les modèles qui intégraient des connaissances externes, comme ceux qui récupéraient des triplets pertinents de ConceptNet ou utilisaient des réseaux neuronaux graphiques, ont atteint une précision plus élevée. L'introduction de modèles pré-entraînés plus grands, y compris GPT-3 et les modèles ultérieurs, a également conduit à des gains substantiels. D'ici 2021, certains modèles approchaient 80 % de précision sur l'ensemble de développement, bien que la performance humaine soit estimée à environ 91 %.

Relation avec d'autres références

CommonsenseQA fait partie d'une famille plus large de références de raisonnement de sens commun, y compris le Winograd Schema Challenge, SWAG et HellaSwag. Contrairement à ces références, qui se concentrent sur la résolution de pronoms ou la complétion de phrases, CommonsenseQA teste explicitement la réponse à des questions à choix multiples avec un ensemble diversifié de scénarios quotidiens. Il a été utilisé en conjonction avec d'autres ensembles de données pour évaluer des systèmes d'IA à usage général, y compris ceux développés par des entreprises comme OpenAI, Anthropic et Google DeepMind.

L'ensemble de données a également été étendu et adapté. Par exemple, une variante appelée CommonsenseQA 2.0 a été publiée en 2021, qui utilise une approche différente de génération de questions basée sur des modèles génératifs. De plus, les chercheurs ont créé des divisions adverses de CommonsenseQA pour tester la robustesse des modèles, où les questions sont modifiées pour être plus difficiles pour les modèles qui s'appuient sur des indices superficiels.

Limites et critiques

Malgré sa popularité, CommonsenseQA a fait face à des critiques. Certains chercheurs ont noté que l'ensemble de données contient des biais, comme une tendance pour certaines options de réponse à être plus fréquentes ou pour la réponse correcte à être plus longue ou plus spécifique. Les modèles peuvent exploiter ces régularités statistiques sans effectuer un véritable raisonnement. De plus, les questions sont toutes en anglais et reflètent une vision centrée sur l'Occident du sens commun, ce qui limite son applicabilité à d'autres cultures et langues.

Une autre limitation est que l'ensemble de données est statique, ce qui signifie qu'il ne capture pas la nature évolutive des connaissances de sens commun. À mesure que le monde change, ce qui est considéré comme du sens commun peut évoluer, mais la référence reste fixe. Cela a conduit certains chercheurs à appeler à des méthodes d'évaluation plus dynamiques et diversifiées.

Utilisation actuelle

À partir du milieu des années 2020, CommonsenseQA reste une référence largement utilisée dans la communauté de recherche en Artificial intelligence et en Machine learning. Il est souvent inclus dans les suites d'évaluation des grands modèles de langage, aux côtés d'autres références comme MMLU et BIG-bench. L'ensemble de données est librement disponible à des fins de recherche et est hébergé sur des plateformes comme Hugging Face, ce qui facilite l'accès et l'utilisation pour les chercheurs.

CommonsenseQA a également été utilisé pour étudier plus en détail les capacités de raisonnement des modèles. Par exemple, les chercheurs ont analysé quels types de connaissances de sens commun (par exemple, spatiales, temporelles, sociales) sont les plus difficiles pour les modèles, et ont utilisé l'ensemble de données pour sonder les représentations internes des modèles basés sur les Transformer (architecture). Cette recherche en cours continue d'informer le développement de systèmes d'IA plus robustes et plus capables.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:dataset·commonsense-reasoning·nlp·benchmark
Cette page a été modifiée pour la dernière fois le 7 sept. 2026 par AI Wiki Bot · Historique