Blog›Guides

LLM-Benchmark-Schnappschuss: 23. August 2026

Die erste wöchentliche Fotoübersicht der LLM-Bestenlisten: LMArena, LiveBench, BenchLM und Aider, eingefroren auf einer zitierbaren Seite. Anthropic räumt drei Podestplätze ab; GPT-5 behält die Coding-Krone.

LLM-Benchmark-Schnappschuss: 23. August 2026

LLM-Benchmark-Schnappschuss: 23. August 2026

Dies ist der erste Eintrag in einer neuen Wikiprompt-Serie: Jede Woche frieren wir ein vollständiges Bild der wichtigsten LLM-Bestenlisten ein und veröffentlichen es als dauerhafte, zitierfähige Seite. Die vollständigen Tabellen für diesen Schnappschuss finden Sie unter /benchmarks/snapshot/2026-08-23, und jedes zukünftige Bild wird unter /benchmarks/history indexiert.

Warum datierte Schnappschüsse?

Benchmark-Zahlen bewegen sich leise: Ein Modell klettert, eine Punktzahl wird neu berechnet, und der Spitzenreiter des letzten Monats wird still zum Vierten. Indem wir eine URL pro wöchentlichem Bild beibehalten, bleibt die Aufzeichnung öffentlich. Sie können "die Rangliste vom 23. August 2026" zitieren, und dieser Link wird immer genau das zeigen.

Was das Bild zeigt

Dieser Schnappschuss umfasst fünf unabhängige, offene Quellen, jede mit ihrer eigenen Methodik:

  • LMArena (Text-Arena): claude-opus-5-high führt die Community-Elo an, mit claude-opus-5-max und claude-opus-4-6-high direkt dahinter. Anthropic hält diese Woche das gesamte Text-Podium.
  • LMArena (Webentwicklung): claude-opus-5-max an der Spitze, gefolgt von kimi-k3-max und qwen3.8-max, zwei Open-Weight-Herausforderern von Moonshot und Alibaba, die die Grenzlabore bedrängen.
  • LiveBench: claude-fable-5-max-effort belegt den ersten Platz mit einem Durchschnitt von 83,4, vor gpt-5.6-sol-max (81,7) und gpt-5.5-xhigh (80,8).
  • BenchLM-Aggregat: Ein reines Anthropic-Podium: Claude Mythos 5 (83,0), Claude Opus 5 (82,7) und Claude Fable 5 (82,7), getrennt durch einen Viertelpunkt.
  • Aider-Polyglot (Codierung): gpt-5 (high) regiert weiterhin die praktische Codierung mit einer Bestehensquote von 88,0 Prozent, vor gpt-5 (medium) und o3-pro (high).
  • Die interessante Lektüre ist die Uneinigkeit: Community-Abstimmung (LMArena), akademische Aufgaben-Suiten (LiveBench), aggregierte Punktzahlen (BenchLM) und praktische Codierung (Aider) krönen nicht dasselbe Modell. Diese Uneinigkeit ist genau der Grund, warum wir viele Quellen verfolgen, anstatt nur eine.

    Entdecken Sie es

  • Live-Bestenlisten, Filter und das Kosten-vs-Leistungs-Diagramm: /benchmarks
  • Das eingefrorene Bild dieser Woche: /benchmarks/snapshot/2026-08-23
  • Alle Schnappschüsse: /benchmarks/history
  • Neue Bilder erscheinen jeden Sonntag. Wenn sich die Ranglisten verschieben, können Sie genau darauf zeigen, wann.

    Tags
    nano-banana-2·image-generation·portrait·photorealistic·prompts·ai-art