HellaSwag 2025 est un ensemble de données de référence conçu pour évaluer les capacités de raisonnement de sens commun des systèmes d'intelligence artificielle, en particulier les grands modèles de langage et les modèles multimodaux. Il succède à l'ensemble de données HellaSwag original, introduit en 2019 par des chercheurs de l'Université de Toronto et de l'Allen Institute for AI. La version 2025 met à jour l'ensemble de données avec des exemples plus difficiles, une couverture élargie des scénarios visuels et audio, et un protocole d'évaluation plus strict pour réduire les scores gonflés dus à la mémorisation ou aux raccourcis statistiques.
L'ensemble de référence teste la capacité d'un modèle à choisir la continuation la plus plausible d'un scénario donné, nécessitant une compréhension de la dynamique physique, des conventions sociales et de la causalité temporelle. Contrairement aux versions antérieures qui se concentraient principalement sur le texte, HellaSwag 2025 inclut des invites multimodales combinant texte et images ou clips audio, poussant les modèles à intégrer des informations à travers les modalités. L'ensemble de données est construit en combinant des scénarios rédigés par des humains et des exemples contradictoires générés par l'IA, filtrés pour garantir qualité et difficulté.
Contexte et Motivation
Le HellaSwag original a été créé pour combler une lacune dans les références existantes, qui échouaient souvent à distinguer les modèles qui comprennent réellement le sens commun de ceux qui s'appuient sur des schémas linguistiques superficiels. Le nom est un mot-valise de "hell" et "swag" (une référence ludique à "sagesse farfelue" ou "sens commun"). L'édition 2025 a été développée en réponse aux progrès rapides de l'IA générative, qui a conduit à des modèles capables d'atteindre des scores quasi parfaits sur les références plus anciennes, rendant difficile la mesure de progrès supplémentaires.
L'ensemble de référence est maintenu par un consortium de chercheurs académiques et industriels, comprenant des membres du Stanford AI Lab, du MIT CSAIL et du Berkeley AI Research. Le projet reçoit un financement de multiples sources, notamment la National Science Foundation et des fondations privées.
Construction de l'Ensemble de Données
HellaSwag 2025 contient environ 20 000 questions à choix multiples, chacune avec un contexte et quatre fins possibles, dont une seule est correcte. Les contextes proviennent d'une gamme diversifiée de sources, notamment des scripts de films, des vidéos pédagogiques et des scénarios quotidiens. Pour augmenter la difficulté, l'ensemble de données inclut des exemples "contradictoires" générés par des systèmes d'IA, ensuite validés par des annotateurs humains pour garantir qu'ils sont résolubles par les humains mais difficiles pour les machines.
Le processus de construction implique plusieurs étapes : d'abord, un grand pool de scénarios candidats est collecté ; ensuite, des modèles d'IA génèrent des fins plausibles et non plausibles ; puis, des annotateurs humains filtrent et étiquettent les exemples ; enfin, un ensemble de calibration est utilisé pour garantir que la référence n'est pas biaisée par des indices triviaux tels que la longueur ou la fréquence des mots. La version 2025 introduit également un sous-ensemble "contrefactuel", où la réponse correcte nécessite un raisonnement sur des changements hypothétiques du scénario.
Évaluation et Score
Les modèles sont évalués par leur précision sur l'ensemble de test, avec comme métrique principale le pourcentage de questions correctement répondues. Pour éviter le surapprentissage, l'ensemble de test n'est pas publié publiquement ; à la place, les chercheurs soumettent leurs modèles pour évaluation via une API contrôlée, similaire à l'approche utilisée par d'autres références comme les évaluations d'OpenAI. La référence rapporte également un "score de robustesse" qui mesure la performance sur des versions perturbées des questions, telles que des contextes paraphrasés ou des images altérées.
HellaSwag 2025 est conçu pour être plus difficile que son prédécesseur. Dans les évaluations initiales, les modèles de pointe tels que GPT-4 et Claude atteignent environ 85 % de précision, contre 95 % sur le HellaSwag original. Cet écart indique que la nouvelle référence fournit un meilleur signal pour distinguer les modèles avec différents niveaux de capacité de raisonnement.
Impact et Réception
La sortie de HellaSwag 2025 a suscité l'intérêt de la communauté de recherche en IA. De nombreux chercheurs l'utilisent comme outil d'évaluation standard lors du développement de nouvelles architectures ou méthodes d'entraînement. La référence a également été adoptée par des laboratoires industriels, notamment Google DeepMind et Anthropic, dans le cadre de leurs suites d'évaluation internes. Certains critiques soutiennent que la référence présente encore des limites, comme un biais potentiel vers les contextes culturels occidentaux, mais le consortium a fait des efforts pour inclure des scénarios diversifiés.
La référence a également influencé le développement de nouvelles techniques d'entraînement, telles que l'apprentissage par curriculum et l'augmentation de données, qui visent à améliorer le raisonnement de sens commun. De plus, HellaSwag 2025 a été utilisé pour étudier le phénomène de "l'apprentissage par raccourcis", où les modèles exploitent des régularités statistiques plutôt qu'une véritable compréhension.
Orientations Futures
Les plans pour les versions futures de HellaSwag incluent l'expansion à davantage de langues, l'incorporation de scénarios interactifs ou incarnés, et l'ajout d'un composant de raisonnement temporel. Le consortium prévoit également de publier un classement qui suit les progrès au fil du temps, similaire à la référence SuperGLUE. Alors que les systèmes d'IA continuent d'évoluer, des références comme HellaSwag 2025 jouent un rôle crucial pour garantir que les progrès sont mesurés de manière significative.