Blog›Benchmarks

Aperçu des benchmarks LLM, 22 septembre 2026 : une semaine figée en tête

Aucune position dans le top 3 n'a changé cette semaine sur LiveBench, BenchLM, Aider et LMArena. La véritable action se passait hors des classements : les modèles de décision Jev et Laya ont ouvert une catégorie qu'aucun benchmark ne mesure encore.

Aperçu des benchmarks LLM, 22 septembre 2026 : une semaine figée en tête

Instantané des benchmarks LLM, 22 septembre 2026 : une semaine figée en tête

Chaque semaine, nous photographions les principaux classements de LLM et conservons les preuves sur /benchmarks/history. La photo de cette semaine, 22 septembre, est remarquable pour ce qui ne s'est pas produit : sur les cinq sources que nous suivons, aucune position dans le top 3 n'a changé de mains.

Les leaders, par source

  • LiveBench (global) : Claude Fable 5.1 (effort maximal) conserve la première place avec 83,78, devant Fable 5 (83,38) et GPT-6 Astra max (83,05). Trois modèles à moins de 0,73 points d'écart.
  • BenchLM (global) : Claude Fable 5.1 à 84,58, GPT-6 Astra à 83,79, Claude Opus 5 à 81,87.
  • Aider polyglot (codage) : GPT-5 (élevé) garde son 88,0, avec GPT-5 (moyen) à 86,7 et o3-pro à 84,9. OpenAI possède toujours ce classement.
  • LMArena text Elo : Claude Fable 5.1 max à 1507,6, avec deux variantes d'Opus 5 qui lui soufflent dans le cou à 1505 - un écart de 2,6 Elo, en pratique une égalité.
  • LMArena webdev Elo : GPT-6 Astra max à 1800,3, confortablement devant Fable 5.1 max (1758) - le seul classement où l'écart est large.
  • Les sources sont toujours en désaccord

    Le schéma de désaccord que nous signalons chaque semaine persiste : Anthropic mène sur les trois classements de texte à usage général, OpenAI mène de manière décisive sur le codage (Aider) et le développement web (LMArena). Si vous choisissez un modèle selon « le classement », la réponse dépend toujours entièrement du classement qui correspond à votre charge de travail.

    L'action se passait hors des classements

    Une semaine figée en tête ne signifie pas une semaine calme. Les lancements les plus discutés n'étaient pas du tout des modèles de chat : le Jev de TypeSafe et le Laya open source sous licence Apache 2.0 de Convai Innovations en Inde ont ouvert la catégorie des « modèles de décision System One » - des réponses typées avec des probabilités calibrées au lieu de texte généré. Aucun des classements ci-dessus ne mesure encore ce type de modèle, ce qui est en soi une lacune à surveiller : l'écosystème de benchmarks mesure l'écriture et le codage, tandis qu'une part croissante de l'IA en production est de la classification rapide. Notre comparaison : Laya vs Jev.

    Parcourez l'instantané complet sur /benchmarks/snapshot/2026-09-22, ou le classement en direct sur /benchmarks.

    Tags
    benchmarks·llm·leaderboard·claude·gpt-6·aider·livebench·weekly-snapshot