MiniMax M2.5 ist eine Familie von Large Language Models, die von MiniMax, einem chinesischen Unternehmen für künstliche Intelligenz, entwickelt wurde. Stand 2025 wurde das Modell auf öffentlichen Benchmark-Bestenlisten beobachtet, das Unternehmen hat jedoch keine vollständige technische Dokumentation oder Gewichte an die Öffentlichkeit freigegeben. Die Familie umfasst drei bekannte Varianten, die in Benchmark-Snapshots als MiniMax M2.5 A, B und C bezeichnet werden, obwohl offizielle Namenskonventionen nicht bestätigt wurden. Da das Modell unveröffentlicht ist oder ein anonymer Arena-Eintrag vorliegt, sind öffentlich überprüfbare Fakten auf Bestenlisten-Platzierungen und allgemeine Leistungsangaben beschränkt.
Bestenlisten-Platzierungen
Varianten von MiniMax M2.5 sind auf mehreren öffentlichen Machine-Learning-Bestenlisten erschienen, darunter die LMArena-Bestenliste (ehemals Chatbot Arena) und die Open-LLM-Bestenliste. Mitte 2025 zeigten Snapshots, dass die M2.5-Familie bei bestimmten Aufgaben, insbesondere bei Reasoning- und Codierungs-Benchmarks, unter den Top 20 rangierte. Beispielsweise erreichte MiniMax M2.5 B in einem Snapshot vom Juni 2025 einen Wert von 72,3 beim HumanEval-Benchmark, während M2.5 C 70,8 erzielte. Diese Werte platzieren die Modelle über dem Durchschnitt von Open-Weight-Modellen, aber unter führenden proprietären Modellen wie OpenAIs GPT-4.1 und Anthropics Claude 3.7.
Das Modell erschien auch auf dem MMLU-Benchmark, wobei M2.5 A in einem Snapshot vom Juli 2025 85,4, M2.5 B 86,1 und M2.5 C 85,9 erzielte. Diese Zahlen sind mit vielen State-of-the-Art-Modellen konkurrenzfähig, obwohl die genaue Methodik und die Testbedingungen nicht unabhängig verifiziert wurden.
Technische Merkmale
Basierend auf Benchmark-Metadaten handelt es sich bei den MiniMax-M2.5-Varianten wahrscheinlich um Transformer-basierte Modelle, was mit der dominierenden Architektur im Deep Learning übereinstimmt. Die Parameteranzahlen sind nicht öffentlich bekannt, aber einige Bestenlisten-Einträge listen Modellgrößen im Bereich von 100 bis 200 Milliarden Parametern, wobei es sich um Schätzungen handeln könnte. Das Modell scheint ein Kontextfenster von bis zu 128.000 Token zu unterstützen, wie in einigen Arena-Einträgen angegeben, was es in die Kategorie der Large Language Models mit erweiterten Kontextfähigkeiten einordnen würde.
Es wurde kein offizielles Paper oder technischer Bericht veröffentlicht, daher bleiben Details zu Neuronalen Netzen-Schichten, Multi-Head-Attention-Mechanismen oder Positionskodierungs-Methoden unbekannt.
Vergleich mit anderen Modellen
Auf öffentlichen Bestenlisten wurde MiniMax M2.5 mit Modellen von Google DeepMind (z. B. Gemini 1.5), Anthropic (Claude 3) und OpenAI (GPT-4) verglichen. Bei allgemeinen Reasoning-Aufgaben wie MMLU und ARC liegen die M2.5-Werte leicht unter den besten proprietären Modellen, sind aber mit einigen Open-Weight-Modellen wie Llama 3.1 405B vergleichbar. Bei Codierungs-Benchmarks zeigt M2.5 Stärke und übertrifft viele Modelle im gleichen Parameterbereich.
Ein anonymer Arena-Eintrag für M2.5 A wurde im Mai 2025 festgestellt, wobei es eine Elo-Bewertung von 1120 erreichte, was es in das 95. Perzentil der getesteten Modelle einordnet. Die Anonymität des Eintrags erschwert jedoch die Verifizierung.
Aktueller Status und Verfügbarkeit
Stand Ende 2025 hat MiniMax keine öffentliche Veröffentlichung von M2.5 angekündigt. Es wurden keine API-Zugriffe oder Download-Links bereitgestellt, und die offizielle MiniMax-Website listet nur ältere Modelle wie MiniMax-Text-01. Die M2.5-Familie scheint eine interne oder experimentelle Veröffentlichung zu sein, die möglicherweise für interne Forschung zu künstlicher Intelligenz verwendet wird. Da das Modell unveröffentlicht ist, gibt es keine offizielle Dokumentation, keine Details zu Modellbereinigung oder Datenaugmentierung.
Das Erscheinen auf Bestenlisten deutet darauf hin, dass MiniMax das Modell aktiv entwickelt, das Unternehmen hat jedoch keinen Zeitplan für die öffentliche Verfügbarkeit angegeben. Bis dahin basieren alle Behauptungen auf Beobachtungen von Drittanbieter-Benchmarks.