Blog›Guides

Aperçu des benchmarks LLM : 23 août 2026

Première photo hebdomadaire des classements LLM : LMArena, LiveBench, BenchLM et Aider, figés sur une page citable. Anthropic balaie trois podiums ; GPT-5 conserve la couronne du codage.

Aperçu des benchmarks LLM : 23 août 2026

Instantané des benchmarks LLM : 23 août 2026

Ceci est la première entrée d'une nouvelle série Wikiprompt : chaque semaine, nous figeons une photo complète des principaux classements de LLM et la publions comme une page permanente et citable. Les tableaux complets de cet instantané se trouvent sur /benchmarks/snapshot/2026-08-23, et chaque future photo sera indexée sur /benchmarks/history.

Pourquoi des instantanés datés ?

Les chiffres des benchmarks évoluent discrètement : un modèle grimpe, un score est recalculé, et le leader du mois dernier devient silencieusement quatrième. En gardant une URL par photo hebdomadaire, le record reste public. Vous pouvez citer « les classements au 23 août 2026 » et ce lien montrera toujours exactement cela.

Ce que montre la photo

Cet instantané couvre cinq sources indépendantes, chacune avec sa propre méthodologie :

  • LMArena (arène de texte) : claude-opus-5-high mène l'Elo communautaire, avec claude-opus-5-max et claude-opus-4-6-high juste derrière. Anthropic détient tout le podium textuel cette semaine.
  • LMArena (développement web) : claude-opus-5-max en tête, suivi de kimi-k3-max et qwen3.8-max, deux challengers open-weight de Moonshot et Alibaba qui pressent les laboratoires frontières.
  • LiveBench : claude-fable-5-max-effort prend la première place avec une moyenne de 83,4, devant gpt-5.6-sol-max (81,7) et gpt-5.5-xhigh (80,8).
  • Agrégat BenchLM : un podium entièrement Anthropic : Claude Mythos 5 (83,0), Claude Opus 5 (82,7) et Claude Fable 5 (82,7), séparés par un quart de point.
  • Aider polyglotte (codage) : gpt-5 (high) règne toujours sur le codage pratique avec un taux de réussite de 88,0 %, devant gpt-5 (medium) et o3-pro (high).
  • La lecture intéressante est le désaccord : les votes communautaires (LMArena), les suites de tâches de style académique (LiveBench), les scores agrégés (BenchLM) et le codage pratique (Aider) ne couronnent pas le même modèle. Ce désaccord est précisément pourquoi nous suivons plusieurs sources au lieu d'une seule.

    Explorez-le

  • Classements en direct, filtres et graphique coût vs performance : /benchmarks
  • La photo figée de cette semaine : /benchmarks/snapshot/2026-08-23
  • Tous les instantanés : /benchmarks/history
  • De nouvelles photos arrivent chaque dimanche. Lorsque les classements changent, vous pourrez pointer exactement quand.

    Tags
    nano-banana-2·image-generation·portrait·photorealistic·prompts·ai-art