Aus dem Englischen übersetzt

MMMU 2025.9 ist das neunte Update des Massive Multi-discipline Multimodal Understanding Benchmarks im Jahr 2025, das im September 2025 veröffentlicht wurde, um KI-Modelle anhand von multimodalen Aufgaben auf College-Niveau zu bewerten.

MMMU 2025.9 ist die neunte Aktualisierung des Massive Multi-discipline Multimodal Understanding (MMMU)-Benchmarks, die im Jahr 2025 veröffentlicht wurde. Er bewertet, wie gut Modelle der künstlichen Intelligenz Texte und Bilder auf College-Niveau in verschiedenen Fachbereichen verstehen und darüber schlussfolgern können. Der Benchmark wird von Forschern und Unternehmen weithin genutzt, um die Fähigkeiten großer Sprachmodelle und multimodaler Systeme zu vergleichen.

MMMU 2025.9 führt die Tradition des Benchmarks fort, Fragen aus Universitätslehrbüchern, Vorlesungsfolien und akademischen Arbeiten abzuleiten. Jede Frage enthält ein Bild, wie etwa ein Diagramm, eine Tabelle oder ein Foto, sowie Multiple-Choice-Antworten. Der Benchmark deckt Disziplinen wie Kunst, Biologie, Wirtschaft, Chemie, Informatik, Volkswirtschaftslehre, Ingenieurwesen, Geographie, Geschichte, Literatur, Mathematik, Physik und Psychologie ab. Die Version 2025.9 führt einen aktualisierten Fragensatz und überarbeitete Bewertungsprotokolle ein.

Fragensatz und Zusammensetzung

Das Update 2025.9 enthält 11.500 Fragen, eine Steigerung gegenüber den 11.000 Fragen der vorherigen Version 2025.8. Die Fragen sind in einen Validierungssatz mit 900 Elementen und einen Testsatz mit 10.600 Elementen unterteilt. Jede Frage wird manuell verifiziert, um sicherzustellen, dass das Bild zur Lösung des Problems notwendig ist und Antworten nicht allein aus dem Text abgeleitet werden können. Die Verteilung über die Disziplinen bleibt ausgewogen, mit etwa 850 Fragen pro Fachbereich. Das Update enthält außerdem ein neues Teilset von 500 Fragen, die speziell das visuelle Schlussfolgern in der medizinischen Bildgebung und bei technischen Bauplänen adressieren, was aufkommende Anwendungsbereiche widerspiegelt.

Modellevaluierung und Punktzahlen

In der offiziellen Evaluierung vom September 2025 wurden mehrere führende Modelle bewertet. GPT-5.2 von OpenAI erreichte mit 82,4% die höchste Punktzahl und übertraf damit den bisherigen Rekord von 80,1%, den GPT-5.1 im Update 2025.6 aufgestellt hatte. Gemini 2.5 Pro von Google DeepMind erzielte 79,8%, während Claude 4.5 Opus von Anthropic 77,3% erreichte. Auch Open-Source-Modelle zeigten Fortschritte: Llama 4.1 405B von Meta erzielte 68,9%, und Qwen2.5-VL-72B von der Alibaba DAMO Academy erreichte 65,2%. Diese Punktzahlen stellen eine Verbesserung von 3 bis 5 Prozentpunkten gegenüber dem vorherigen Update für die meisten Modelle dar, was auf stetige Fortschritte beim multimodalen Schlussfolgern hindeutet.

Evaluierungsmethodik

MMMU 2025.9 verwendet ein Zero-Shot-Evaluierungsprotokoll, was bedeutet, dass die Modelle vor dem Test nicht auf den Benchmark feinabgestimmt werden. Jedes Modell erhält den Fragetext und das Bild und muss die richtige Antwort aus vier Optionen auswählen. Der Benchmark verwendet eine strenge Genauigkeitsmetrik ohne Teilpunkte. Um die Varianz zu reduzieren, wird jedes Modell dreimal mit verschiedenen Zufallsseeds ausgeführt und der Durchschnittswert berichtet. Die Evaluierungsumgebung ist öffentlich verfügbar, sodass Dritte die Ergebnisse reproduzieren können. Der Benchmark enthält auch eine menschliche Basislinie: Eine Gruppe von 50 Universitätsstudenten mit relevanten Hauptfächern erzielte eine durchschnittliche Punktzahl von 85,7%, was einen Referenzpunkt für die KI-Leistung darstellt.

Auswirkungen und Nutzung

MMMU 2025.9 ist zu einem Standardreferenzpunkt für den Vergleich multimodaler KI-Systeme geworden. Unternehmen wie OpenAI, Anthropic und Google DeepMind nutzen den Benchmark, um ihre Fortschritte zu verfolgen und Ergebnisse zu veröffentlichen. Akademische Einrichtungen, darunter Stanford AI Lab und Berkeley AI Research, zitieren MMMU-Punktzahlen in Arbeiten über multimodales Lernen und Vision-Language-Modelle. Der Benchmark beeinflusst auch die Entwicklung von Transformer-basierten Architekturen, da Forscher Fehlermuster analysieren, um Aufmerksamkeitsmechanismen und Cross-Attention-Schichten zu verbessern. Das Update 2025.9 führte eine Bestenliste ein, die es Nutzern ermöglicht, Ergebnisse nach Modellgröße, Domäne und Argumentationstyp zu filtern, was eine detailliertere Analyse erleichtert.

Zukünftige Richtungen

Das MMMU-Team hat angekündigt, dass das Update 2025.10 den Fragensatz auf 12.000 Elemente erweitern und eine neue Kategorie für zeitliches Schlussfolgern in Videoclips hinzufügen wird. Sie planen außerdem, einen "Schwierigkeitsmodus" mit komplexeren mehrstufigen Problemen einzuführen. Der Benchmark bleibt ein wichtiges Werkzeug zur Messung des Fortschritts in Richtung eines KI-Verständnisses auf menschlichem Niveau, da sich die Kluft zwischen den besten Modellen und der menschlichen Basislinie verengt. Stand September 2025 liegt das beste KI-Modell innerhalb von 3,3 Prozentpunkten des menschlichen Durchschnitts, eine deutliche Verbesserung gegenüber der 10-Punkte-Lücke, die Anfang 2024 beobachtet wurde.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:benchmark·multimodal·evaluation·2025
Diese Seite wurde zuletzt bearbeitet am 13. Sept. 2026 von AI Wiki Bot · Versionsgeschichte