BlogBenchmarks

Aperçu des benchmarks LLM : 30 août 2026

Photo hebdomadaire figée de six classements LLM : Opus 5 max domine l’arène textuelle, Fable 5 tient LiveBench, gpt-5 conserve Aider coding, et les sources divergent toujours.

Aperçu des benchmarks LLM : 30 août 2026

Instantané des benchmarks LLM : 30 août 2026

Chaque dimanche, Wikiprompt fige une photo des principaux classements de LLM. Voici l'instantané pour la semaine se terminant le 30 août 2026 - 14 164 entrées provenant de six sources, consultables en intégralité sur /benchmarks/snapshot/2026-08-30.

Leaders par source

  • LMArena (texte) : claude-opus-5-max prend la première place Elo (1504,7), une courte avance sur claude-opus-5-high (1503,6), avec le claude-opus-4-6-high de la génération précédente qui conserve la troisième place.
  • LMArena (développement web) : claude-opus-5-max mène avec une large marge (1690,6), avec kimi-k3-max (1673,7) et qwen3.8-max (1668,9) comme challengers open-weight les plus solides.
  • LiveBench : claude-fable-5-max-effort en tête (83,4), devant gpt-5.6-sol-max (81,7) et gpt-5.5-xhigh (80,8).
  • BenchLM : la famille Claude 5 balaie le podium - Mythos 5 (83,4), Fable 5 (83,2), Opus 5 (83,1) - séparés par des fractions de point.
  • Aider polyglot (codage) : gpt-5 (high) reste le roi des benchmarks de codage avec un taux de réussite de 88,0 %, devant gpt-5 (medium) et o3-pro (high).
  • Indice d'intelligence Artificial Analysis : Claude Opus 5 à effort maximal mène (63,1), avec les variantes Fable 5 juste derrière.
  • Ce qui a changé par rapport à la semaine dernière

    La couronne de l'arène texte a changé de mains au sein de la même famille : claude-opus-5-high (1504,2 la semaine dernière) a été dépassé de justesse par claude-opus-5-max (1504,7). Statistiquement un pile ou face, éditorialement un rappel que les réglages d'effort comptent désormais autant que le choix du modèle en haut du tableau.

    Les sources sont toujours en désaccord

    Comme chaque semaine, aucun classement ne couronne le même modèle : l'Elo communautaire de LMArena favorise Opus 5, les ensembles académiques sans contamination de LiveBench favorisent Fable 5, et le harnais de codage réel d'Aider appartient toujours à gpt-5. Croisez les références avant de choisir - c'est à cela que sert la vue de comparaison.

    Parcourez le tableau complet daté sur /benchmarks/snapshot/2026-08-30, ou l'archive complète sur /benchmarks/history.

    Tags
    benchmarks·llm·leaderboard·weekly