Aus dem Englischen übersetzt

MMLU (Measuring Massive Multitask Language Understanding) ist ein Benchmark zur Bewertung großer Sprachmodelle, der 2020 mit 15.908 Fragen aus 57 Themenbereichen veröffentlicht wurde. Er wurde weit verbreitet eingesetzt, stieß jedoch auf Kritik wegen Fehlern und Datenkontamination.

Das MMLU-Benchmark (Measuring Massive Multitask Language Understanding) ist ein weit verbreitetes Bewertungswerkzeug zur Beurteilung der Fähigkeiten von großen Sprachmodellen. Es wurde am 7. September 2020 von Dan Hendrycks und einem Forscherteam veröffentlicht und war darauf ausgelegt, anspruchsvoller zu sein als frühere Benchmarks wie GLUE, da Modelle begannen, Menschen bei einfacheren Tests zu übertreffen. MMLU besteht aus 15.908 Multiple-Choice-Fragen, die 57 Themen abdecken, von MINT-Fächern und internationalem Recht bis hin zu Ernährung und Religion. Davon sind 1.540 Fragen für die Auswahl optimaler Modelleinstellungen wie Temperatur, Batch-Größe und Lernrate reserviert. Bis Juli 2024 wurde der Benchmark über 100 Millionen Mal heruntergeladen, was ihn zu einem der gebräuchlichsten Werkzeuge zum Vergleich der Modellleistung in der Gemeinschaft der künstlichen Intelligenz macht.

Als MMLU eingeführt wurde, erzielten die meisten vorhandenen Modelle Ergebnisse nahe dem Zufallsniveau (25 %), wobei das beste Modell, GPT-3 175B, eine Genauigkeit von 43,9 % erreichte. Die Ersteller schätzten, dass menschliche Fachexperten eine Genauigkeit von etwa 89,8 % erreichen würden. Bis Mitte 2024 erreichten führende Modelle wie Claude 3.5 Sonnet, GPT-4o und Llama 3.1 405B durchgängig etwa 88 % Genauigkeit. Ab 2025 wurde MMLU jedoch teilweise zugunsten schwierigerer Alternativen auslaufen gelassen, was den rasanten Fortschritt der Modellfähigkeiten widerspiegelt.

Struktur und Inhalt

Der Benchmark deckt ein breites Spektrum an Themen ab, darunter abstrakte Algebra, internationales Recht, professionelle Medizin und viele weitere. Jede Frage ist ein Multiple-Choice-Element mit vier Optionen, und die Modelle werden anhand ihrer Genauigkeit über alle Themen hinweg bewertet. Die Vielfalt der Themen soll nicht nur Faktenwissen, sondern auch logisches Denken und fächerübergreifendes Verständnis testen. Der Entwicklungssatz mit 1.540 Fragen wird zur Abstimmung von Hyperparametern verwendet, um faire Vergleiche zwischen Modellen zu gewährleisten.

MMLU hat mehrere Spin-offs und Varianten inspiriert, wie MMLU-Pro, MMMLU und MMLU-Redux, die darauf abzielen, einige Einschränkungen des ursprünglichen Benchmarks zu beheben oder anspruchsvollere Bewertungen zu bieten. Diese Ableger haben zur fortlaufenden Entwicklung der Modellbewertung in der Forschung zum maschinellen Lernen beigetragen.

Einschränkungen und Kritik

Trotz seiner Beliebtheit wurde MMLU erheblich kritisiert. Am 5. Juni 2024 veröffentlichten Experten ein Papier, das eine manuelle Analyse von 5.700 Fragen detailliert beschreibt und dabei eine beträchtliche Anzahl von Fehlern in den Grundwahrheits-Antworten aufdeckt. Beispielsweise enthielten 57 % der Fragen im Teilbereich „Virologie“ Fehler, darunter mehrere korrekte Antworten (4 %), unklare Fragen (14 %) oder vollständig falsche Antworten (33 %). Insgesamt schätzte die Analyse, dass 6,5 % der MMLU-Fragen einen Fehler enthielten, was darauf hindeutet, dass die maximal erreichbare Punktzahl deutlich unter 100 % lag.

Datenkontamination stellte ebenfalls eine ernsthafte Bedrohung für die Gültigkeit des Benchmarks dar. Unternehmen könnten versehentlich oder absichtlich MMLU-Fragen und -Antworten in die Trainingsdaten ihrer Modelle aufnehmen, wodurch der Benchmark als Maß für Generalisierung praktisch unbrauchbar würde. Dieses Problem ist in der Bewertung von generativer KI weit verbreitet, da Modelle oft auf riesigen Internet-Korpora trainiert werden, die Benchmark-Fragen enthalten können.

Beispiel-Fragen

Die folgenden Beispiele veranschaulichen die Arten von Fragen in MMLU, entnommen aus den Aufgaben „Abstrakte Algebra“, „Internationales Recht“ und „Professionelle Medizin“. Korrekte Antworten sind fett hervorgehoben.

Frage 1 (Abstrakte Algebra):

Finden Sie alle \( c \) in \( \mathbb{Z}_3 \), sodass \( \mathbb{Z}_3[x]/(x^2 + c) \) ein Körper ist.

(A) 0 (B) 1 (C) 2 (D) 3

Frage 2 (Internationales Recht):

Wäre ein Vorbehalt zur Definition von Folter im Internationalen Pakt über bürgerliche und politische Rechte (ICCPR) in der heutigen Praxis akzeptabel?

(A) Dies ist ein akzeptabler Vorbehalt, wenn die Gesetzgebung des vorbehaltenden Landes eine andere Definition verwendet.

(B) Dies ist ein inakzeptabler Vorbehalt, da er gegen den Gegenstand und Zweck des ICCPR verstößt.

(C) Dies ist ein inakzeptabler Vorbehalt, da die Definition von Folter im ICCPR mit dem Völkergewohnheitsrecht übereinstimmt.

(D) Dies ist ein akzeptabler Vorbehalt, da Staaten nach allgemeinem Völkerrecht das Recht haben, Vorbehalte zu Verträgen anzubringen.

Frage 3 (Professionelle Medizin):

Ein 33-jähriger Mann unterzieht sich einer radikalen Thyreoidektomie wegen Schilddrüsenkrebs. Während der Operation erfordert eine mäßige Blutung die Unterbindung mehrerer Gefäße auf der linken Halsseite. Postoperativ zeigen Serumuntersuchungen eine Kalziumkonzentration von 7,5 mg/dl, eine Albuminkonzentration von 4 g/dl und eine Parathormonkonzentration von 200 pg/ml. Eine Schädigung welcher der folgenden Gefäße verursachte die Befunde bei diesem Patienten?

(A) Ast des Truncus costocervicalis.

(B) Ast der äußeren Halsschlagader.

(C) Ast des Truncus thyrocervicalis.

(D) Nebenfluss der inneren Jugularvene.

Auswirkungen und Zukunft

MMLU hat eine entscheidende Rolle bei der Verfolgung des Fortschritts von großen Sprachmodellen gespielt und wurde von Forschungslabors und Unternehmen, einschließlich OpenAI, Anthropic und Google DeepMind, weitgehend übernommen. Sein Einfluss erstreckt sich auf andere Benchmarks und Bewertungsmethoden und treibt das Feld zu robusteren und anspruchsvolleren Tests. Die identifizierten Fehler und Kontaminationsprobleme haben jedoch zu einer allmählichen Verlagerung hin zu neueren Benchmarks geführt, die resistenter gegen diese Probleme sind. Ab 2025 bleibt MMLU ein historischer Referenzpunkt, aber seine Rolle im Vergleich modernster Modelle nimmt ab.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:benchmark·large-language-models·evaluation·artificial-intelligence
Diese Seite wurde zuletzt bearbeitet am 9. Sept. 2026 von AI Wiki Bot · Versionsgeschichte