Humanity's Last Exam est un ensemble de données de référence conçu pour évaluer les capacités des systèmes d'intelligence artificielle avancés. Il se compose d'un ensemble soigneusement sélectionné de questions extrêmement difficiles, rédigées par des experts de nombreuses disciplines, destinées à sonder les limites des modèles de langage actuels et des technologies associées. Ce référentiel a été créé pour fournir une mesure rigoureuse et tournée vers l'avenir des progrès de l'IA, en particulier à mesure que les modèles approchent ou dépassent les performances humaines sur les suites d'évaluation existantes.
Le projet a été conçu comme un effort collaboratif impliquant des chercheurs et des praticiens d'organisations leaders en IA, notamment OpenAI et d'autres institutions de premier plan. Il a été rendu public au début de l'année 2025, avec pour objectif d'établir une nouvelle norme pour évaluer les connaissances et le raisonnement de niveau expert dans les systèmes d'IA. Le nom du référentiel reflète son ambition de représenter un test final et complet des capacités intellectuelles de l'IA, du moins pour la génération actuelle de modèles.
Conception et structure
Le référentiel comprend des milliers de questions à choix multiples et à réponse courte, chacune élaborée par des experts en la matière. Les questions couvrent un large éventail de domaines, notamment les mathématiques, la physique, la chimie, la biologie, l'informatique, l'histoire, le droit et les sciences humaines. Un principe de conception clé est que les questions doivent être difficiles même pour des systèmes d'IA très performants, mais aussi vérifiables et sans ambiguïté dans leurs réponses correctes. Pour garantir la qualité, chaque question soumise fait l'objet d'un processus de révision rigoureux, et les questions pouvant être résolues par les modèles existants sont généralement rejetées.
L'ensemble de données est divisé en un ensemble de test public et un ensemble privé, non divulgué. L'ensemble privé est utilisé pour les évaluations officielles afin d'éviter le surapprentissage et la contamination des données. L'ensemble public permet aux chercheurs et aux développeurs d'évaluer leurs propres systèmes, tandis que l'ensemble privé fournit une mesure plus fiable de la capacité de généralisation. Les créateurs du référentiel ont également mis en place des protocoles stricts pour empêcher les modèles d'être entraînés sur les données de test, notamment en surveillant la mémorisation et en exigeant que toutes les questions soient nouvelles et non disponibles publiquement avant leur publication.
Participants et contributeurs clés
L'initiative a été menée par une équipe de chercheurs, dont Jacob Steinhardt et David Kaplan, connus pour leurs travaux sur la sécurité et l'évaluation de l'IA. Ils ont été rejoints par des contributeurs d'Anthropic, de Google DeepMind et d'autres grands laboratoires d'IA, ainsi que par des universitaires d'institutions telles que MIT CSAIL, Stanford AI Lab et BAIR (Berkeley AI Research). L'effort a également bénéficié de l'expertise de chercheurs indépendants et de spécialistes de domaines du monde entier, qui ont soumis des questions dans leurs domaines respectifs.
La nature collaborative du projet a été un choix délibéré, visant à garantir la diversité des types de questions et la couverture des sujets. Les organisateurs ont sollicité des contributions par le biais d'appels publics à questions, attirant des soumissions de milliers d'experts. Chaque soumission a été examinée par plusieurs évaluateurs indépendants pour vérifier son exactitude, sa difficulté et sa pertinence. Ce processus a abouti à un ensemble de données final à la fois vaste dans sa portée et élevé dans sa qualité.
Performances des systèmes d'IA actuels
Les premiers résultats du référentiel ont révélé que même les systèmes d'IA les plus avancés, y compris ceux basés sur des architectures de Large language model, obtenaient des scores bien inférieurs aux niveaux experts humains. Les modèles les plus performants, tels que ceux développés par OpenAI et Google DeepMind, ont atteint des taux de précision allant de chiffres à un seul chiffre à de faibles pourcentages à deux chiffres sur l'ensemble de test. Cela contrastait fortement avec leurs performances sur des référentiels antérieurs, où ils dépassaient souvent 90 % de précision.
Les faibles scores ont été attribués à la conception du référentiel, qui cible spécifiquement le raisonnement, la résolution de problèmes en plusieurs étapes et les connaissances approfondies du domaine. De nombreuses questions nécessitent de combiner des informations provenant de multiples sources ou d'appliquer des concepts abstraits de manière nouvelle, des tâches qui restent difficiles pour les approches actuelles de Machine learning. Les résultats ont mis en évidence des écarts significatifs entre les capacités de l'IA et les performances humaines expertes, en particulier dans les domaines nécessitant un jugement nuancé ou une synthèse créative.
Implications et réception
La publication de Humanity's Last Exam a généré des discussions considérables au sein de la communauté de recherche en IA et au-delà. Les partisans ont fait valoir que le référentiel fournit un outil précieux pour suivre les progrès vers l'intelligence artificielle générale, en fixant un niveau élevé qui n'est pas facilement contournable. Les critiques ont toutefois noté que les référentiels, aussi bien conçus soient-ils, peuvent devenir obsolètes à mesure que les modèles s'améliorent, et que les performances à de tels tests ne se traduisent pas nécessairement par des compétences dans le monde réel.
Malgré ces débats, le référentiel a été largement adopté comme point de référence pour évaluer les modèles de pointe. Plusieurs entreprises d'IA ont rapporté leurs scores sur l'ensemble de test public, et le référentiel a été cité dans de nombreux articles de recherche. Il a également stimulé le développement de suites d'évaluation similaires, encore plus difficiles, alors que le domaine continue de repousser les limites de ce que l'IA peut accomplir. Au début de l'année 2025, aucun modèle ne s'est approché de la réussite du référentiel, laissant son nom comme un témoignage du défi permanent de créer des machines véritablement intelligentes.
Orientations futures
Les créateurs de Humanity's Last Exam ont indiqué leur intention de mettre à jour périodiquement le référentiel, en ajoutant de nouvelles questions et en retirant celles qui deviennent trop faciles. Cette approche itérative vise à maintenir sa pertinence à mesure que les capacités de l'IA évoluent. Des recherches sont également en cours sur la génération automatisée de questions, ce qui pourrait aider à étendre le référentiel à des tailles encore plus grandes. L'objectif ultime reste de fournir une mesure durable et rigoureuse des progrès de l'IA vers une compréhension de niveau expert, un objectif qui continue de façonner le développement de la Generative AI et des domaines connexes.