BlogBenchmarks

LLM-Benchmark-Momentaufnahme: 30. August 2026

Wöchentliches eingefrorenes Foto von sechs LLM-Bestenlisten: Opus 5 max führt die Text-Arena an, Fable 5 hält LiveBench, gpt-5 bleibt bei Aider-Coding, und die Quellen sind sich weiterhin uneinig.

LLM-Benchmark-Momentaufnahme: 30. August 2026

LLM-Benchmark-Momentaufnahme: 30. August 2026

Jeden Sonntag friert Wikiprompt ein Foto der wichtigsten LLM-Ranglisten ein. Dies ist die Momentaufnahme für die Woche bis zum 30. August 2026 - 14.164 Einträge aus sechs Quellen, vollständig durchsuchbar unter /benchmarks/snapshot/2026-08-30.

Spitzenreiter nach Quelle

  • LMArena (Text): claude-opus-5-max übernimmt die Spitze im Elo-Wert (1504,7), knapp vor claude-opus-5-high (1503,6), wobei die Vorgängergeneration claude-opus-4-6-high weiterhin auf Platz drei liegt.
  • LMArena (Webentwicklung): claude-opus-5-max führt mit deutlichem Abstand (1690,6), mit kimi-k3-max (1673,7) und qwen3.8-max (1668,9) als stärksten Open-Weight-Herausforderern.
  • LiveBench: claude-fable-5-max-effort liegt vorn (83,4), gefolgt von gpt-5.6-sol-max (81,7) und gpt-5.5-xhigh (80,8).
  • BenchLM: Die Claude-5-Familie räumt beim Podium ab - Mythos 5 (83,4), Fable 5 (83,2), Opus 5 (83,1) - getrennt durch Bruchteile eines Punktes.
  • Aider polyglot (Codierung): gpt-5 (high) bleibt der Coding-Benchmark-König mit einer Bestehensquote von 88,0%, vor gpt-5 (medium) und o3-pro (high).
  • Artificial Analysis Intelligenz-Index: Claude Opus 5 bei maximaler Anstrengung führt (63,1), mit den Fable-5-Varianten direkt dahinter.
  • Was sich im Vergleich zur letzten Woche geändert hat

    Die Text-Arena-Krone wechselte innerhalb derselben Familie den Besitzer: claude-opus-5-high (1504,2 letzte Woche) wurde von claude-opus-5-max (1504,7) knapp überholt. Statistisch gesehen ein Münzwurf, redaktionell gesehen eine Erinnerung, dass Anstrengungs-Einstellungen an der Tabellenspitze inzwischen genauso wichtig sind wie die Modellwahl.

    Die Quellen sind sich weiterhin uneinig

    Wie jede Woche küren keine zwei Ranglisten dasselbe Modell: LMArenas Community-Elo bevorzugt Opus 5, LiveBenchs kontaminationsfreie akademische Testsets bevorzugen Fable 5, und Aiders realistisches Coding-Geschirr gehört weiterhin gpt-5. Kreuzen Sie die Daten ab, bevor Sie wählen - genau dafür ist die Vergleichsansicht gedacht.

    Durchsuchen Sie die vollständige datierte Tabelle unter /benchmarks/snapshot/2026-08-30 oder das gesamte Archiv unter /benchmarks/history.

    Tags
    benchmarks·llm·leaderboard·weekly