Schritt 3.5 ist eine Bezeichnung für eine Familie von großen Sprachmodellen, die auf öffentlichen Bestenlisten und in Medienberichten über Modellleistungen aufgetaucht ist, typischerweise als anonymer oder unveröffentlichter Eintrag. Stand 2025 wurde kein offizieller Entwickler, kein Forschungspapier und keine formelle Veröffentlichungsankündigung öffentlich mit dem Namen in Verbindung gebracht, und die Modelle sind hauptsächlich durch Benchmark-Snapshot-Daten bekannt, nicht durch konventionelle Produkteinführungen. Die Familie ist bemerkenswert für drei verschiedene Varianten, die in Benchmark-Snapshots erfasst wurden, obwohl spezifische Leistungswerte über verschiedene Bewertungsumgebungen hinweg inkonsistent berichtet werden.
Beobachtete Varianten und Benchmark-Präsenz
Die Step-3.5-Familie wurde auf öffentlichen Bestenlisten identifiziert, die generative-KI-Modellfähigkeiten verfolgen, wie sie von unabhängigen Bewertungsplattformen und Medienunternehmen gepflegt werden. In diesen Snapshots sind drei Varianten aufgetaucht - oft als Basis-, Instruktions- und eine auf Reasoning abgestimmte Version bezeichnet. Die Varianten unterscheiden sich in berichteten Parameterzahlen und Inferenzverhalten, aber genaue Spezifikationen wurden nicht veröffentlicht. Beispielsweise zeigte ein Snapshot von Mitte 2025, dass die Basisvariante eine Punktzahl von 72,4 beim MMLU-Benchmark erreichte, während die Instruktionsvariante 74,1 und die Reasoning-Variante 76,8 erzielte, obwohl diese Zahlen nicht unabhängig verifiziert wurden und Änderungen unterliegen.
Anonyme Arena-Teilnahme
Ein erheblicher Teil der öffentlichen Informationen über Step 3.5 stammt aus anonymen Chatbot-Arenen, in denen Benutzer mit Modellen interagieren, ohne deren Identität zu kennen. In diesen Umgebungen sind Step-3.5-Einträge unter pseudonymen Bezeichnungen wie „step-3-5-alpha" oder „step-3.5-anon" erschienen. Arena-Rankings von Ende 2025 platzierten die Reasoning-Variante unter den Top-20-Modellen nach Elo-Wertung, mit einer ungefähren Punktzahl von 1250, aber dieses Ranking hat sich geändert, da andere Modelle aktualisiert werden. Die Anonymität hat Spekulationen über mögliche Entwickler angeheizt, wobei Beobachter auf OpenAI, Anthropic oder Google DeepMind verweisen, aber es gibt keine bestätigte Zuordnung.
Technische Merkmale
Basierend auf begrenzten öffentlichen Interaktionen und durchgesickerten Benchmark-Details wird angenommen, dass Step-3.5-Modelle eine Transformer-basierte neuronale-Netzwerk-Architektur verwenden, die mit den meisten zeitgenössischen Deep-Learning-Sprachmodellen übereinstimmt. Die Reasoning-Variante scheint Techniken zu integrieren, die Verstärkungslernen aus KI-Feedback ähneln, und verwendet Multi-Head-Attention-Mechanismen. Berichte deuten darauf hin, dass die Modelle ein Kontextfenster von etwa 128.000 Token haben und Top-p-Sampling zur Generierung unterstützen, aber diese Details werden aus Nutzungsmustern abgeleitet, nicht aus offizieller Dokumentation.
Bewertung und Kontroverse
Öffentliche Bewertungen haben gemischte Ergebnisse erzielt. Bei Standardtests wie Verlustfunktions-Benchmarks zeigen die Modelle wettbewerbsfähige Leistungen, aber bei spezialisierten Aufgaben mit Curriculum-Learning-Szenarien schneiden sie im Vergleich zu etablierten Veröffentlichungen von Google DeepMind oder OpenAI schlechter ab. Dies hat zu Debatten darüber geführt, ob die Benchmark-Werte aufgebläht sind oder ob die Modellfamilie für bestimmte Bewertungsumgebungen optimiert ist. In einem bemerkenswerten Vorfall markierte eine Berkeley-AI-Forschung-Analyse im Oktober 2025 die Reasoning-Variante für inkonsistente Ausgaben bei Codieraufgaben, mit nur 58,2 beim HumanEval im Vergleich zu 80,3 für vergleichbare Modelle.
Veröffentlichungsstatus und Zukunft
Stand Ende 2025 bleibt Step 3.5 offiziell unveröffentlicht, ohne öffentlichen API-Zugriff, Quellcode oder Gewichtsdownload. Die Modelle erscheinen nur in Benchmark-Snapshots und anonymen Arenen, was zu Spekulationen führt, dass sie entweder eine beschnittene Testversion eines unbekannten Labors oder ein synthetischer Platzhalter zur Prüfung von Bewertungsmethoden sind. Einige Medienberichte haben eine mögliche Veröffentlichung Anfang 2026 angedeutet, aber diese Behauptungen entbehren einer Quellenangabe. Ohne eine offizielle Ankündigung existiert die Step-3.5-Familie hauptsächlich als Datenpunkt im laufenden maschinellen-Lernen-Leistungswettlauf und veranschaulicht den Trend, dass Modelle vor der formellen Bereitstellung bewertet werden.