Blog›Benchmarks

LLM-Benchmark-Schnappschuss, 6. September: Astra und Fable 5.1 betreten die Bühne

Das wöchentliche Foto: GPT-6 Astra debütiert mit 1797 Elo auf Webdev (+107 über den alten Spitzenreiter), Claude Fable 5.1 übernimmt die Text-Arena und LiveBench, und Aider hat noch nicht aufgeholt.

LLM-Benchmark-Schnappschuss, 6. September: Astra und Fable 5.1 betreten die Bühne

Eine Woche nach dem dichtesten Veröffentlichungsfenster des Jahres haben die Ranglisten gesprochen. Dies ist das wöchentliche Foto für den 6. September 2026: was jede Quelle heute sagt, was sich seit dem Schnappschuss der letzten Woche geändert hat, und wo die Quellen sich uneinig sind. Jede Zahl verlinkt auf eine dauerhafte, datierte Seite.

Die Schlagzeile: die Veröffentlichungswoche ist gelandet

GPT-6 Astra und Claude Fable 5.1, beide in den ersten Septembertagen veröffentlicht, stehen bereits an der Spitze der Ranglisten:

  • Webentwicklungs-Arena: GPT-6 Astra Max debütiert mit 1797 Elo, ein +107-Sprung gegenüber dem Spitzenreiter der letzten Woche (Claude Opus 5 Max, 1691). So große Debüt-Deltas sind selten; der bisherige Rekord dieses Jahres lag unter +60. Claude Fable 5.1 Max landet auf Platz zwei mit 1762.
  • Text-Arena: Claude Fable 5.1 Max nimmt Platz #1 mit 1514 ein und beendet die Herrschaft von Opus 5 Max (1505, jetzt auf Platz drei hinter Opus 5 High).
  • LiveBench: Fable 5.1 Max Effort übertrifft seinen Vorgänger, 83,8 gegenüber 83,4, mit Astra Max direkt dahinter bei 83,1 - drei Modelle innerhalb von 0,7 Punkten auf einer kontaminationsfreien Suite.
  • BenchLM: Fable 5.1 zuerst bei 83,0, Astra zweitens bei 81,1. Beachten Sie den Ausreißer: Der BenchLM-Spitzenreiter der letzten Woche war Claude Mythos 5 (83,4), die Variante mit eingeschränktem Zugriff, was zeigt, wie Zugriffsstufen das Lesen von Ranglisten verkomplizieren.
  • Aider polyglot (praktische Code-Bearbeitung): unverändert - GPT-5 High führt weiterhin mit 88,0%. Weder Astra noch Fable 5.1 wurden dort bisher benchmarkt; beobachten Sie nächste Woche.
  • Wo die Quellen sich uneinig sind

    Arenen krönen bereits das neue Paar; Aider hat sie nicht getestet; LiveBench zeigt die Top Drei durch weniger als einen Punkt getrennt. Wenn Sie nur ein Board lesen, erhalten Sie eine Krönung, wenn Sie alle fünf lesen, ein Fotofinish mit Sternchen. Diese Streuung ist der Grund, warum diese Schnappschüsse existieren.

    Die Belege

  • Das eingefrorene Foto von heute: Benchmark-Schnappschuss 2026-09-06
  • Das der letzten Woche: Schnappschuss 2026-08-30
  • Live-Ranglisten, täglich aktualisiert: Text · Webentwicklung · vollständige Historie
  • Hintergrund zu den Modellen: GPT-6 Astra · Claude Fable 5 und Mythos 5 im AI Wiki
  • Tags
    benchmarks·gpt-6-astra·claude-fable-5-1·snapshot·leaderboards