LLM-Benchmark-Momentaufnahme: Woche vom 13. September 2026
Das wöchentliche Foto über fünf Bestenlisten: Claude Fable 5.1 hält Text, LiveBench und BenchLM; GPT-5 behält die Aider-Coding-Krone; GPT-6 Astra dominiert Webentwicklung. Stabilität an der Spitze, aufgeteilt nach Disziplin.

Das wöchentliche Foto der LLM-Bestenlisten ist da: Schnappschuss 2026-09-13, über fünf unabhängige Quellen hinweg. Die Schlagzeile dieser Woche ist Stabilität an der Spitze und eine dreifache Aufteilung nach Disziplin.
Spitzenreiter nach Quelle
Was sich gegenüber letzter Woche geändert hat
Sehr wenig an der Spitze, und genau das ist die Geschichte: Dieselben zwei Familien haben die Bretter nun zwei Wochen in Folge unter sich aufgeteilt. Anthropic besitzt allgemeine Text- und Mischaufgaben-Benchmarks (Text-Arena, LiveBench, BenchLM); OpenAI besitzt die Entwickler-Bretter (Aider-Codierung, Webdev-Arena). Wenn Sie ein Modell nach Bestenliste auswählen, hängt die Antwort jetzt wirklich davon ab, welche Bestenliste.
Der Quellen-uneinig-Winkel
Eine einzelne "bestes Modell"-Behauptung verdeckt eine dreifache Aufteilung: Fable 5.1 ist auf drei Brettern Platz 1, GPT-6 Astra auf einem, GPT-5 auf einem. Genau deshalb machen wir täglich Schnappschüsse von allen fünf - jedes Brett misst eine andere Fähigkeit, und die Belege bleiben in der Akte.
Durchsuchen Sie die vollständigen Tabellen unter /benchmarks, oder vergleichen Sie über die Zeit in der Historie.
Related Articles
- Laya vs. Jev: Die Open-Source-Antwort auf die Entscheidungsmodell-Welle
Sep 22, 2026 · 5 min read
- Laya contre Jev : La réponse open-source à la vague des modèles de décision
Sep 22, 2026 · 5 min read
- Laya vs Jev: La respuesta de código abierto a la ola de modelos de decisión
Sep 22, 2026 · 5 min read
- Laya vs Jev: 오픈소스로 답하는 의사결정 모델 물결
Sep 22, 2026 · 5 min read
- लाया बनाम जेव: निर्णय-मॉडल लहर का ओपन-सोर्स उत्तर
Sep 22, 2026 · 5 min read