HellaSwag 2023 est un ensemble de données de référence conçu pour évaluer les capacités de raisonnement de bon sens des systèmes d'intelligence artificielle, en particulier les grands modèles de langage. Il s'agit d'une version mise à jour de l'ensemble de données HellaSwag original, introduit en 2019 par des chercheurs de l'Université de Washington et de l'Allen Institute for AI. La révision de 2023 se concentre sur le fait de rendre les questions plus difficiles afin de réduire l'impact des biais statistiques et de mieux mesurer le raisonnement authentique plutôt que la correspondance de motifs.
Le benchmark se compose de questions à choix multiples où un modèle reçoit un contexte décrivant une situation quotidienne et doit sélectionner la continuation la plus plausible parmi quatre options. Le HellaSwag original comprenait 70 000 questions, dont 10 000 réservées à la validation et aux tests. La mise à jour de 2023 conserve une structure similaire mais introduit de nouveaux exemples spécifiquement conçus pour être plus difficiles pour les modèles qui s'appuient sur des indices superficiels, tels que la fréquence des mots ou la longueur des phrases.
Objectif et Conception
L'objectif principal de HellaSwag 2023 est de tester si les modèles d'IA peuvent comprendre suffisamment le monde physique et social pour prédire ce qui se passe ensuite dans un scénario donné. Par exemple, une question pourrait décrire une personne versant de l'eau dans un verre, puis demander ce qui se passe ensuite, avec des options allant du verre qui déborde à la personne qui boit l'eau. La réponse correcte exige que le modèle raisonne sur la gravité, le volume et le comportement humain typique.
L'ensemble de données a été créé en combinant des exemples rédigés par des humains et générés par des machines. La version originale utilisait une technique appelée filtrage adversarial, où un modèle de langage générait des continuations candidates, puis des annotateurs humains sélectionnaient celles qui étaient les plus plausibles mais aussi les plus susceptibles de tromper d'autres modèles. La mise à jour de 2023 affine ce processus pour créer des questions encore plus difficiles, impliquant souvent des contextes plus longs et des situations plus nuancées.
Évaluation et Score
Les modèles sont évalués sur leur précision à sélectionner la bonne réponse. Le benchmark rapporte la précision en pourcentage, des scores plus élevés indiquant un meilleur raisonnement de bon sens. Dans le HellaSwag original, les modèles de pointe atteignaient environ 85 à 90 % de précision, mais la version 2023 est nettement plus difficile, de nombreux modèles obtenant des scores inférieurs à 80 %. Début 2024, les meilleurs grands modèles de langage, tels que ceux d'OpenAI et de Google DeepMind, atteignent environ 90 % de précision, tandis que les modèles plus petits tombent souvent en dessous de 70 %.
Le benchmark est largement utilisé dans la communauté de recherche en intelligence artificielle comme test standard pour le raisonnement de bon sens. Il est souvent inclus dans les classements qui comparent les performances de différents modèles, aux côtés d'autres benchmarks comme SuperGLUE et MMLU. Les chercheurs utilisent HellaSwag 2023 pour identifier les faiblesses des modèles et pour guider le développement de nouvelles techniques d'entraînement.
Relation avec d'Autres Benchmarks
HellaSwag 2023 fait partie d'une famille plus large de benchmarks qui évaluent différents aspects des capacités de l'IA. Alors qu'il se concentre sur le raisonnement de bon sens, d'autres benchmarks comme GLUE et SuperGLUE testent la compréhension du langage, et MMLU teste les connaissances dans de nombreux domaines. La mise à jour de 2023 est particulièrement notable car elle a été conçue pour être plus robuste face aux modèles qui mémorisent simplement les données d'entraînement ou exploitent des régularités statistiques.
Le benchmark est également lié au concept de sécurité de l'intelligence artificielle, car le raisonnement de bon sens est considéré comme un composant critique pour construire des systèmes d'IA fiables et dignes de confiance. Un modèle qui échoue au raisonnement de bon sens pourrait commettre des erreurs dangereuses dans des applications réelles, comme la conduite autonome ou le diagnostic médical. Par conséquent, HellaSwag 2023 est souvent utilisé dans la recherche sur l'alignement et la robustesse de l'IA.
Limites et Critiques
Malgré son utilisation répandue, HellaSwag 2023 présente certaines limites. Les critiques soutiennent que le benchmark peut encore être sensible à certains biais, comme la tendance des modèles à préférer des réponses plus longues ou plus complexes. De plus, les questions sont toutes en anglais et se concentrent sur des contextes culturels occidentaux, ce qui peut limiter son applicabilité à d'autres langues et cultures.
Une autre critique est que le benchmark mesure une forme étroite de raisonnement de bon sens, se concentrant sur des scénarios physiques et sociaux mais pas sur d'autres types de raisonnement, comme le raisonnement logique ou mathématique. Certains chercheurs ont proposé des benchmarks complémentaires pour combler ces lacunes, mais HellaSwag 2023 reste un point de référence standard.
Orientations Futures
Le développement de HellaSwag 2023 reflète une tendance plus large dans le domaine du apprentissage automatique vers la création d'ensembles de données d'évaluation plus difficiles et plus réalistes. À mesure que les modèles s'améliorent, les benchmarks doivent évoluer pour suivre le rythme. Les futures versions de HellaSwag pourraient intégrer des scénarios plus diversifiés, des questions multilingues ou des éléments interactifs qui exigent des modèles de raisonner sur des horizons temporels plus longs.
Les chercheurs explorent également des moyens de rendre le benchmark plus dynamique, où les questions sont générées à la volée en fonction des faiblesses d'un modèle. Cette approche, connue sous le nom de test adaptatif, pourrait fournir une mesure plus précise des capacités d'un modèle. La mise à jour de 2023 est un pas dans cette direction, mais il reste encore de la place pour l'innovation.
En résumé, HellaSwag 2023 est un outil clé pour évaluer le raisonnement de bon sens dans les systèmes d'IA. Sa conception mise à jour le rend plus difficile et plus pertinent par rapport à l'état de l'art actuel, et il continue d'influencer la recherche dans le apprentissage profond et les grands modèles de langage.