Humanity's Last Exam ist ein Benchmark-Datensatz, der dazu entwickelt wurde, die Fähigkeiten fortgeschrittener künstlicher Intelligenzsysteme zu bewerten. Er besteht aus einer kuratierten Sammlung äußerst anspruchsvoller Fragen, die von Experten aus zahlreichen Disziplinen verfasst wurden und darauf abzielen, die Grenzen aktueller großer Sprachmodelle und verwandter Technologien auszuloten. Der Benchmark wurde geschaffen, um ein rigoroses, zukunftsorientiertes Maß für den Fortschritt der KI zu bieten, insbesondere da Modelle bei bestehenden Bewertungssuiten menschliche Leistungen erreichen oder übertreffen.
Das Projekt wurde als gemeinschaftliche Anstrengung von Forschern und Praktikern führender KI-Organisationen konzipiert, darunter OpenAI und andere prominente Institutionen. Es wurde Anfang 2025 öffentlich veröffentlicht, mit dem Ziel, einen neuen Standard für die Bewertung von Expertenwissen und Denkfähigkeiten in KI-Systemen zu etablieren. Der Name des Benchmarks spiegelt seinen Anspruch wider, einen finalen, umfassenden Test der intellektuellen Fähigkeiten von KI darzustellen, zumindest für die aktuelle Generation von Modellen.
Design und Struktur
Der Benchmark umfasst Tausende von Multiple-Choice- und Kurzantwortfragen, die jeweils von Fachexperten erstellt wurden. Die Fragen decken ein breites Spektrum an Bereichen ab, darunter Mathematik, Physik, Chemie, Biologie, Informatik, Geschichte, Recht und Geisteswissenschaften. Ein zentrales Designprinzip ist, dass die Fragen selbst für hochgradig fähige KI-Systeme schwierig sein sollten, aber dennoch verifizierbar und in ihren korrekten Antworten eindeutig. Um die Qualität zu gewährleisten, durchläuft jede eingereichte Frage einen strengen Überprüfungsprozess, und Fragen, die von bestehenden Modellen gelöst werden können, werden in der Regel abgelehnt.
Der Datensatz ist in einen öffentlichen Testsatz und einen privaten, zurückgehaltenen Satz unterteilt. Der private Satz wird für offizielle Bewertungen verwendet, um Überanpassung und Datenkontamination zu verhindern. Der öffentliche Satz ermöglicht es Forschern und Entwicklern, ihre eigenen Systeme zu bewerten, während der private Satz ein zuverlässigeres Maß für generalisierbare Fähigkeiten bietet. Die Ersteller des Benchmarks implementierten auch strenge Protokolle, um zu verhindern, dass Modelle auf den Testdaten trainiert werden, einschließlich der Überwachung auf Auswendiglernen und der Anforderung, dass alle Fragen neuartig und vor der Veröffentlichung nicht öffentlich verfügbar sein müssen.
Hauptbeteiligte und Mitwirkende
Die Initiative wurde von einem Forscherteam geleitet, darunter Jacob Steinhardt und David Kaplan, die für ihre Arbeit an KI-Sicherheit und -Bewertung bekannt sind. Ihnen schlossen sich Mitwirkende von Anthropic, Google DeepMind und anderen großen KI-Labors sowie Akademiker von Institutionen wie MIT CSAIL, Stanford AI Lab und Berkeley AI Research an. Die Bemühungen profitierten auch von der Expertise unabhängiger Forscher und Domänenspezialisten aus der ganzen Welt, die Fragen in ihren jeweiligen Bereichen einreichten.
Der kollaborative Charakter des Projekts war eine bewusste Entscheidung, die darauf abzielte, Vielfalt in Fragetypen und Themenabdeckung zu gewährleisten. Die Organisatoren holten Beiträge durch öffentliche Aufrufe für Fragen ein und zogen Tausende von Experten an. Jede Einreichung wurde von mehreren unabhängigen Gutachtern überprüft, um ihre Genauigkeit, Schwierigkeit und Eignung zu verifizieren. Dieser Prozess führte zu einem finalen Datensatz, der sowohl breit im Umfang als auch hoch in der Qualität ist.
Leistung aktueller KI-Systeme
Erste Ergebnisse des Benchmarks zeigten, dass selbst die fortschrittlichsten KI-Systeme, einschließlich solcher, die auf Large-Language-Model-Architekturen basieren, deutlich unter dem Niveau menschlicher Experten abschnitten. Die besten Modelle, wie die von OpenAI und Google DeepMind entwickelten, erreichten Genauigkeitsraten im einstelligen bis niedrigen zweistelligen Bereich auf dem Testsatz. Dies stand in starkem Kontrast zu ihrer Leistung bei früheren Benchmarks, wo sie oft über 90% Genauigkeit erzielten.
Die niedrigen Punktzahlen wurden auf das Design des Benchmarks zurückgeführt, das gezielt auf Denkfähigkeiten, mehrstufige Problemlösung und tiefes Domänenwissen abzielt. Viele Fragen erfordern die Kombination von Informationen aus mehreren Quellen oder die Anwendung abstrakter Konzepte auf neuartige Weise, Aufgaben, die für aktuelle Machine-Learning-Ansätze weiterhin herausfordernd sind. Die Ergebnisse hoben signifikante Lücken zwischen KI-Fähigkeiten und menschlicher Expertenleistung hervor, insbesondere in Bereichen, die nuanciertes Urteilsvermögen oder kreative Synthese erfordern.
Implikationen und Rezeption
Die Veröffentlichung von Humanity's Last Exam erzeugte beträchtliche Diskussionen innerhalb der KI-Forschungsgemeinschaft und darüber hinaus. Befürworter argumentierten, dass der Benchmark ein wertvolles Werkzeug zur Verfolgung des Fortschritts in Richtung künstlicher allgemeiner Intelligenz bietet, indem er eine hohe Messlatte setzt, die nicht leicht zu umgehen ist. Kritiker merkten jedoch an, dass Benchmarks, egal wie gut gestaltet, veralten können, wenn Modelle sich verbessern, und dass die Leistung bei solchen Tests nicht unbedingt auf reale Kompetenz übertragbar ist.
Trotz dieser Debatten wurde der Benchmark weithin als Referenzpunkt für die Bewertung von Frontier-Modellen übernommen. Mehrere KI-Unternehmen haben ihre Punktzahlen auf dem öffentlichen Testsatz berichtet, und der Benchmark wurde in zahlreichen Forschungsarbeiten zitiert. Er hat auch die Entwicklung ähnlicher, sogar noch anspruchsvollerer Bewertungssuiten angeregt, da das Feld weiterhin die Grenzen dessen erweitert, was KI erreichen kann. Stand Anfang 2025 hat kein Modell den Benchmark auch nur annähernd bestanden, was seinen Namen als Zeugnis für die anhaltende Herausforderung, wirklich intelligente Maschinen zu schaffen, hinterlässt.
Zukünftige Richtungen
Die Ersteller von Humanity's Last Exam haben Pläne angekündigt, den Benchmark regelmäßig zu aktualisieren, neue Fragen hinzuzufügen und solche auszusondern, die zu einfach werden. Dieser iterative Ansatz soll seine Relevanz aufrechterhalten, während sich KI-Fähigkeiten weiterentwickeln. Es gibt auch laufende Forschung zur automatisierten Fragengenerierung, die dazu beitragen könnte, den Benchmark auf noch größere Größen zu skalieren. Das ultimative Ziel bleibt, ein dauerhaftes, rigoroses Maß für den Fortschritt der KI in Richtung Expertenverständnis zu bieten, ein Ziel, das weiterhin die Entwicklung von generativer KI und verwandten Bereichen prägt.