Blog›Guides

LLM-Benchmark-Momentaufnahme: Woche vom 13. September 2026

Das wöchentliche Foto über fünf Bestenlisten: Claude Fable 5.1 hält Text, LiveBench und BenchLM; GPT-5 behält die Aider-Coding-Krone; GPT-6 Astra dominiert Webentwicklung. Stabilität an der Spitze, aufgeteilt nach Disziplin.

LLM-Benchmark-Momentaufnahme: Woche vom 13. September 2026

Das wöchentliche Foto der LLM-Bestenlisten ist da: Schnappschuss 2026-09-13, über fünf unabhängige Quellen hinweg. Die Schlagzeile dieser Woche ist Stabilität an der Spitze und eine dreifache Aufteilung nach Disziplin.

Spitzenreiter nach Quelle

  • LMArena-Text: Claude Fable 5.1 (max) hält Platz 1 bei 1510 Elo, mit Claude Opus 5-Varianten auf Platz 2 und 3 - ein komplett-Anthropic-Podium.
  • LiveBench: Claude Fable 5.1 (max Aufwand) führt mit 83.78, vor Fable 5 und GPT-6 Astra (83.05). Gleicher Spitzenreiter wie letzte Woche.
  • BenchLM: Claude Fable 5.1 mit 84.61 über GPT-6 Astra (84.08) - die engste Lücke der fünf Bretter.
  • Aider polyglot (Codierung): GPT-5 (hoch) behält die Codierungs-Krone bei 88.0, mit GPT-5 medium und o3-pro dahinter. Anthropic schafft es nicht in diese Top 3.
  • LMArena-Webdev: GPT-6 Astra (max) dominiert bei 1800 Elo, 42 Punkte vor Fable 5.1.
  • Was sich gegenüber letzter Woche geändert hat

    Sehr wenig an der Spitze, und genau das ist die Geschichte: Dieselben zwei Familien haben die Bretter nun zwei Wochen in Folge unter sich aufgeteilt. Anthropic besitzt allgemeine Text- und Mischaufgaben-Benchmarks (Text-Arena, LiveBench, BenchLM); OpenAI besitzt die Entwickler-Bretter (Aider-Codierung, Webdev-Arena). Wenn Sie ein Modell nach Bestenliste auswählen, hängt die Antwort jetzt wirklich davon ab, welche Bestenliste.

    Der Quellen-uneinig-Winkel

    Eine einzelne "bestes Modell"-Behauptung verdeckt eine dreifache Aufteilung: Fable 5.1 ist auf drei Brettern Platz 1, GPT-6 Astra auf einem, GPT-5 auf einem. Genau deshalb machen wir täglich Schnappschüsse von allen fünf - jedes Brett misst eine andere Fähigkeit, und die Belege bleiben in der Akte.

    Durchsuchen Sie die vollständigen Tabellen unter /benchmarks, oder vergleichen Sie über die Zeit in der Historie.

    Tags
    benchmarks·llm·leaderboards·claude·gpt-5·weekly-snapshot