Grok 4.20 0309 ist eine Bezeichnung für eine Familie von Large Language Models, die Anfang 2025 auf öffentlichen LLM- und Medien-Bestenlisten erschien. Der Name ist keinem bekannten Entwickler zugeordnet, und das Modell wurde nicht offiziell veröffentlicht oder dokumentiert. Nach dem neuesten verfügbaren Stand handelt es sich weiterhin um einen anonymen Arena-Eintrag, dessen Ursprung und technische Spezifikationen unverifiziert sind.
Die Bezeichnung „4.20 0309" deutet auf eine Versionskennung und ein Datum (9. März) hin, aber es wurde keine offizielle Veröffentlichung angekündigt. Die Modellfamilie ist nur durch Benchmark-Schnappschüsse bekannt, in denen drei verschiedene Varianten beobachtet wurden. Diese Varianten unterscheiden sich in den Leistungsmetriken, teilen sich jedoch denselben Basisnamen, was auf eine Familie verwandter Modelle hindeutet.
Auftritte in Bestenlisten
Grok 4.20 0309 erschien erstmals Anfang 2025 auf öffentlichen Bestenlisten, darunter die LMArena (ehemals Chatbot Arena) und verschiedene von Medien betriebene Benchmark-Tabellen. Auf LMArena wurde das Modell unter einer pseudonymen Kennung gelistet, wie es bei unveröffentlichten Modellen, die einem Blindtest unterzogen werden, üblich ist. Die drei Varianten wurden in Community-Diskussionen mit Suffixen wie „A", „B" und „C" bezeichnet, obwohl diese Bezeichnungen nicht offiziell sind.
In Benchmark-Schnappschüssen vom Februar 2025 zeigten die Varianten wettbewerbsfähige Leistungen bei Aufgaben, die natürliches Sprachverständnis, logisches Denken und Codegenerierung umfassen. Beispielsweise erzielte eine Variante einen Platz in den oberen 10 % beim MMLU-Benchmark, während eine andere im HumanEval-Benchmark für Codesynthese herausragte. Diese Ergebnisse waren jedoch nicht von offizieller Dokumentation begleitet, und die genauen Bewertungsbedingungen bleiben unklar.
Technische Merkmale
Basierend auf dem Verhalten in den Bestenlisten wird angenommen, dass Grok 4.20 0309 ein Transformer (architecture)-basiertes Modell ist, was mit den meisten modernen LLMs übereinstimmt. Die Varianten unterscheiden sich wahrscheinlich in der Parameteranzahl oder der Trainingskonfiguration, aber es wurden keine offiziellen Spezifikationen veröffentlicht. Das Modell scheint Long-Context-Eingaben zu unterstützen, wie aus seiner Leistung bei Aufgaben mit erweitertem Denken geschlossen wird, obwohl dies nicht bestätigt ist.
Entwicklung und Zuordnung
Der Modellname „Grok" könnte auf eine Verbindung zu xAI oder ähnlichen Organisationen hindeuten, aber kein Entwickler hat die Verantwortung übernommen. Das Modell ist in keinem offiziellen Modellregister aufgeführt, und es wurde keine Open-Source-Lizenz veröffentlicht. Das Fehlen einer Zuordnung hat zu Spekulationen geführt, dass es sich um einen Forschungsprototyp aus einem akademischen Labor wie Stanford AI Lab oder BAIR (Berkeley AI Research) handeln könnte, aber dies sind unbestätigte Hypothesen.
Rezeption und Auswirkungen
Trotz seines anonymen Status hat Grok 4.20 0309 in der Machine learning-Community aufgrund seiner starken Leistung in den Bestenlisten Interesse geweckt. Einige Forscher haben seine Ausgaben genutzt, um emergente Fähigkeiten in LLMs zu untersuchen, aber der Mangel an Transparenz begrenzt eine breitere Übernahme. Das Modell wurde nicht in kommerzielle Produkte integriert, und seine zukünftige Verfügbarkeit ist ungewiss.