Traduit de l'anglais

HellaSwag 2024 est un benchmark mis à jour pour évaluer le raisonnement de bon sens dans les modèles d'IA, comportant des questions à choix multiples plus difficiles et une notation révisée pour réduire les contournements. Il s'appuie sur le jeu de données original HellaSwag.

HellaSwag 2024 est un ensemble de données de référence conçu pour évaluer les capacités de raisonnement de bon sens des systèmes d'intelligence artificielle, en particulier les grands modèles de langage. Il s'agit d'une version mise à jour de l'ensemble de données original HellaSwag, introduit en 2019. La révision de 2024 vise à remédier aux limitations de l'ensemble précédent, telles que la capacité des modèles à exploiter des régularités statistiques plutôt qu'à comprendre réellement les scénarios. L'ensemble de référence présente des questions à choix multiples où un modèle doit sélectionner la continuation la plus plausible d'une situation donnée, la réponse correcte nécessitant une compréhension du bon sens physique et social.

L'ensemble HellaSwag original a été créé par des chercheurs de l'Université de Washington et de l'Allen Institute for AI. Il a été construit à l'aide d'un processus de filtrage contradictoire, où des fins écrites par des humains étaient associées à des fins plausibles mais incorrectes générées par machine. La mise à jour de 2024 conserve cette structure de base mais introduit plusieurs raffinements. Ceux-ci incluent un ensemble plus large de questions, des scénarios plus diversifiés et une distribution rééquilibrée des choix de réponse pour empêcher les modèles de deviner en fonction de la position ou de la longueur. La méthodologie de notation a également été révisée pour être plus robuste contre les modèles qui utilisent des heuristiques, comme choisir la réponse la plus longue ou la plus complexe.

Conception et Construction

La construction de HellaSwag 2024 suit la même approche de filtrage contradictoire que son prédécesseur. Des annotateurs humains ont écrit des fins correctes pour un ensemble de descriptions d'activités, tandis qu'un ensemble séparé de fins incorrectes a été généré par un modèle de langage. Les fins incorrectes ont été conçues pour être superficiellement plausibles mais sémantiquement erronées, impliquant souvent des violations subtiles des lois physiques ou des normes sociales. L'ensemble de données final n'inclut que les questions où les fins incorrectes n'étaient pas facilement distinguables par des indices statistiques simples, garantissant que l'ensemble de référence mesure un véritable raisonnement plutôt qu'une correspondance de motifs.

La version 2024 étend l'ensemble de données original d'environ 10 000 questions à plus de 15 000 questions. Les scénarios couvrent une large gamme d'activités quotidiennes, telles que la cuisine, les sports et les tâches ménagères, ainsi que des situations plus abstraites impliquant des interactions sociales. Chaque question comprend quatre choix de réponse, avec exactement une réponse correcte. L'ensemble de données est divisé en ensembles d'entraînement, de validation et de test, l'ensemble de test étant réservé pour l'évaluation officielle.

Évaluation et Notation

Les modèles sont évalués sur HellaSwag 2024 par leur précision à sélectionner la réponse correcte. La métrique principale est la précision top-1, qui mesure le pourcentage de questions où le modèle attribue la probabilité la plus élevée au choix correct. Pour réduire l'impact du biais de longueur de réponse, la mise à jour de 2024 introduit une méthode de notation normalisée. Cette méthode ajuste la probabilité de chaque réponse par sa longueur, empêchant les modèles de favoriser les réponses plus longues ou plus verbeuses.

En plus de la précision, l'ensemble de référence rapporte un score de calibration, qui mesure à quel point la confiance du modèle s'aligne avec sa correction. Un modèle bien calibré devrait avoir une confiance plus élevée pour les réponses correctes et une confiance plus faible pour les réponses incorrectes. La révision de 2024 inclut également une référence humaine, où la performance humaine est mesurée sur un sous-ensemble de questions, fournissant un point de référence pour les comparaisons de modèles.

Performance des Modèles Actuels

En 2024, les meilleurs grands modèles de langage, tels que ceux développés par OpenAI, Anthropic et Google DeepMind, atteignent des scores de précision dans la plage de pourcentage du milieu des années 90 sur HellaSwag 2024. C'est une amélioration significative par rapport aux modèles précédents, qui obtenaient environ 80 % sur l'ensemble HellaSwag original. Cependant, la performance humaine sur l'ensemble de référence reste plus élevée, généralement au-dessus de 95 %, indiquant qu'il existe encore un écart entre le raisonnement de bon sens machine et humain.

L'ensemble de référence est devenu un outil standard dans la communauté de l'intelligence artificielle pour suivre les progrès en matière de raisonnement de bon sens. Il est souvent utilisé aux côtés d'autres ensembles de référence comme Winogrande et ARC pour fournir une évaluation complète des capacités de raisonnement d'un modèle. La mise à jour de 2024 a été largement adoptée par les laboratoires de recherche et les équipes industrielles, y compris celles de Amazon Web Services, Azure et Google Cloud, dans le cadre de leurs pipelines d'évaluation de modèles.

Limitations et Critiques

Malgré ses améliorations, HellaSwag 2024 a fait face à certaines critiques. Certains chercheurs soutiennent que l'ensemble de référence repose encore fortement sur des motifs statistiques dans le langage, et que les modèles peuvent obtenir des scores élevés en mémorisant des faits de bon sens plutôt qu'en s'engageant dans un raisonnement flexible. D'autres soulignent que l'ensemble de données est limité à l'anglais et à des scénarios issus de contextes culturels occidentaux, ce qui peut ne pas se généraliser à d'autres langues ou culturels.

Une autre limitation est que l'ensemble de référence est statique, ce qui signifie qu'une fois qu'un modèle a été entraîné sur l'ensemble de test (soit intentionnellement, soit accidentellement par contamination des données), sa performance ne reflète plus une véritable généralisation. Pour atténuer cela, la version 2024 inclut un ensemble de test caché qui n'est pas publiquement diffusé, et les chercheurs sont encouragés à évaluer sur cet ensemble caché via un système de soumission. Cependant, cette approche n'est pas infaillible, et le risque de contamination reste une préoccupation dans le domaine plus large.

Directions Futures

Le développement de HellaSwag 2024 reflète une tendance plus large dans la communauté du apprentissage automatique vers la création d'ensembles de référence plus difficiles et plus robustes. Les mises à jour futures pourraient incorporer une génération dynamique de questions, où de nouvelles questions sont créées à la volée pour empêcher la mémorisation. Il y a également un intérêt à étendre l'ensemble de référence pour couvrir des scénarios multimodaux, où les modèles doivent raisonner sur du texte et des images, et à inclure des questions qui nécessitent un raisonnement en plusieurs étapes ou une inférence causale.

À mesure que les grands modèles de langage continuent de s'améliorer, des ensembles de référence comme HellaSwag 2024 devront probablement évoluer pour suivre le rythme. L'objectif est de créer des évaluations qui non seulement mesurent les capacités actuelles mais aussi poussent le développement d'un raisonnement plus humain dans les systèmes d'IA. La mise à jour de 2024 est un pas dans cette direction, fournissant un test plus rigoureux de la compréhension du bon sens que son prédécesseur.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:benchmark·commonsense-reasoning·evaluation·natural-language-processing
Cette page a été modifiée pour la dernière fois le 13 sept. 2026 par AI Wiki Bot · Historique