Blog›Benchmarks

# LLM-Benchmark-Momentaufnahme, 22. September 2026: Eine eingefrorene Woche an der Spitze

Kein einziger Top-3-Platz hat sich diese Woche über LiveBench, BenchLM, Aider und LMArena verändert. Die eigentliche Action fand abseits der Ranglisten statt: Die Entscheidungsmodelle Jev und Laya eröffneten eine Kategorie, die noch kein Benchmark misst.

# LLM-Benchmark-Momentaufnahme, 22. September 2026: Eine eingefrorene Woche an der Spitze

LLM-Benchmark-Momentaufnahme, 22. September 2026: Eine eingefrorene Woche an der Spitze

Jede Woche fotografieren wir die wichtigsten LLM-Bestenlisten und bewahren die Belege unter /benchmarks/history auf. Das Foto dieser Woche, 22. September, ist bemerkenswert für das, was nicht passiert ist: Über alle fünf von uns verfolgten Quellen hinweg hat sich keine einzige Top-3-Position verändert.

Die Spitzenreiter, nach Quelle

  • LiveBench (gesamt): Claude Fable 5.1 (max effort) hält den ersten Platz bei 83.78, vor Fable 5 (83.38) und GPT-6 Astra max (83.05). Drei Modelle innerhalb von 0.73 Punkten.
  • BenchLM (gesamt): Claude Fable 5.1 bei 84.58, GPT-6 Astra bei 83.79, Claude Opus 5 bei 81.87.
  • Aider polyglot (Codierung): GPT-5 (high) behält seine 88.0, mit GPT-5 (medium) bei 86.7 und o3-pro bei 84.9. OpenAI besitzt weiterhin diese Tafel.
  • LMArena Text-Elo: Claude Fable 5.1 max bei 1507.6, mit zwei Opus-5-Varianten, die ihm mit 1505 im Nacken sitzen - eine Elo-Differenz von 2.6, praktisch ein Gleichstand.
  • LMArena Webdev-Elo: GPT-6 Astra max bei 1800.3, komfortabel vor Fable 5.1 max (1758) - die einzige Tafel, auf der die Lücke groß ist.
  • Die Quellen sind sich weiterhin uneinig

    Das Uneinigkeitsmuster, das wir jede Woche hervorheben, hält an: Anthropic führt bei allgemeinsprachlichen Texten auf drei Tafeln, OpenAI führt bei Codierung (Aider) und Webdev (LMArena) entscheidend. Wenn Sie ein Modell nach "der Bestenliste" auswählen, hängt die Antwort weiterhin vollständig davon ab, welche Bestenliste zu Ihrer Arbeitslast passt.

    Die Action fand abseits der Bestenlisten statt

    Eine eingefrorene Woche an der Spitze bedeutet keine ruhige Woche. Die am meisten diskutierten Veröffentlichungen waren überhaupt keine Chat-Modelle: TypeSafes Jev und das Open-Source-, Apache-2.0-Laya von Indiens Convai Innovations eröffneten die Kategorie der "System One"-Entscheidungsmodelle - getippte Antworten mit kalibrierten Wahrscheinlichkeiten statt generiertem Text. Keine der oben genannten Tafeln misst diese Art von Modell bisher, was selbst eine Lücke ist, die es zu beobachten gilt: Das Benchmark-Ökosystem misst Schreiben und Codieren, während ein wachsender Teil der Produktions-KI schnelle Klassifikation ist. Unser Vergleich: Laya vs Jev.

    Durchsuchen Sie die vollständige Momentaufnahme unter /benchmarks/snapshot/2026-09-22 oder die Live-Tafel unter /benchmarks.

    Tags
    benchmarks·llm·leaderboard·claude·gpt-6·aider·livebench·weekly-snapshot