Désolé, je n'ai pas encore appris à traduire ce contenu. Si vous avez d'autres demandes, je serai ravi de vous aider.

Traduit de l'anglais

SIQA (Social IQa) est un ensemble de données de référence pour évaluer le raisonnement social de bon sens dans l'IA, contenant 38 000 questions à choix multiples sur des situations sociales quotidiennes.

SIQA, acronyme de Social IQa, est un jeu de données de référence conçu pour évaluer les capacités de raisonnement social de bon sens des systèmes d'intelligence artificielle. Il comprend environ 38 000 questions à choix multiples, chacune présentant un court récit sur une situation sociale suivi d'une question sur le résultat probable ou l'action appropriée, avec trois choix de réponses. Ce jeu de référence a été introduit pour combler une lacune dans l'évaluation de la compréhension par l'IA des normes sociales, des intentions et des dynamiques interpersonnelles, qui sont distinctes du raisonnement purement factuel ou logique.

Le jeu de données a été créé par des chercheurs de l'Université de Washington et de l'Allen Institute for AI, avec un article publié en 2019. Les questions sont dérivées du cadre Crowdsourced Social Commonsense Reasoning (CrowS-Pairs), mais SIQA se concentre spécifiquement sur des questions à choix multiples qui exigent d'inférer des implications sociales. Chaque question est conçue pour tester si un modèle peut comprendre des indices sociaux implicites, tels que la politesse, l'empathie ou les conséquences probables d'une action dans un contexte donné.

Structure et contenu

SIQA contient 33 404 questions pour l'entraînement, 1 954 pour la validation et 2 985 pour les tests, totalisant 38 343 questions. Chaque question comprend une phrase de contexte (par exemple, « Jordan voulait dire un secret à Tracy »), une question (par exemple, « Que fera Jordan ? ») et trois options de réponse (par exemple, « Jordan a dit le secret à Tracy », « Jordan a demandé à Tracy de garder le secret », « Jordan a dit le secret à tout le monde »). La réponse correcte est déterminée par le bon sens social, et non par des faits explicites dans le texte. Le jeu de données couvre une large gamme de scénarios quotidiens, y compris les conversations, les interactions familiales, les situations professionnelles et les amitiés.

Objectif et importance

SIQA a été développé pour aller au-delà des jeux de référence standard en traitement du langage naturel qui se concentrent sur les connaissances factuelles ou lexicales. Le raisonnement social de bon sens est un composant clé de l'intelligence humaine, permettant aux personnes de naviguer facilement dans les interactions sociales. Pour les systèmes d'IA, tels que les grands modèles de langage et les transformeurs, obtenir de bons résultats sur SIQA indique une capacité à saisir les normes sociales implicites et à prédire le comportement humain. Ce jeu de référence est devenu un outil d'évaluation standard dans le domaine de la recherche en intelligence artificielle, souvent utilisé aux côtés d'autres jeux de référence de raisonnement de bon sens comme le Winograd Schema Challenge et Physical IQA.

Évaluation et performance

Lorsque SIQA a été publié, les meilleurs modèles atteignaient une précision d'environ 60 à 70 %, ce qui était nettement supérieur au hasard (33 %) mais inférieur à la performance humaine, estimée à environ 86 %. Les améliorations ultérieures des techniques de apprentissage automatique et de apprentissage profond, en particulier avec l'avènement de réseaux de neurones plus grands et de modèles pré-entraînés, ont conduit à des scores plus élevés. Par exemple, les modèles basés sur BERT et ses variantes ont atteint des niveaux de précision dans le milieu des années 80, se rapprochant de la performance humaine. Cependant, même les modèles de pointe rencontrent encore des difficultés avec certains types de raisonnement social, comme la compréhension du sarcasme ou des différences culturelles nuancées.

Limites et critiques

Malgré son utilisation répandue, SIQA a fait l'objet de critiques. Certains chercheurs soutiennent que le jeu de données peut contenir des biais, car les questions sont issues du crowdsourcing et peuvent refléter le contexte culturel des annotateurs, principalement issus de contextes occidentaux anglophones. Cela peut conduire les modèles à apprendre des normes sociales spécifiques à une culture plutôt que des normes universelles. De plus, certaines questions ont été notées comme ambiguës ou avec plusieurs réponses plausibles, rendant le jeu de référence moins fiable pour une évaluation fine. Il existe également une préoccupation selon laquelle une performance élevée sur SIQA ne se traduit pas nécessairement par une compréhension sociale réelle, car les questions sont simplifiées et manquent de la complexité des interactions sociales réelles.

Jeux de référence connexes et orientations futures

SIQA fait partie d'une famille plus large de jeux de référence de raisonnement de bon sens, y compris Winograd Schema et CommonsenseQA. Ces jeux de référence visent collectivement à tester différentes facettes des connaissances de bon sens, du physique au social. Les orientations futures de la recherche incluent le développement de jeux de données plus diversifiés et culturellement inclusifs, l'intégration d'indices sociaux multimodaux (par exemple, les expressions faciales, le ton de la voix) et l'évaluation des modèles dans des contextes interactifs où ils doivent raisonner sur les dynamiques sociales en temps réel. Alors que les systèmes d'IA deviennent plus intégrés dans la vie quotidienne, des jeux de référence comme SIQA restent cruciaux pour garantir qu'ils peuvent interagir avec les humains de manière socialement appropriée.

Voir aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:benchmark·commonsense-reasoning·social-ai·dataset
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique