Blog›Benchmarks

Instantané des benchmarks LLM, 6 septembre : Astra et Fable 5.1 font leur entrée en scène

La photo de la semaine : GPT-6 Astra fait ses débuts à 1797 Elo sur webdev (+107 par rapport à l'ancien leader), Claude Fable 5.1 remporte l'arène textuelle et LiveBench, et Aider n'a pas encore rattrapé son retard.

Instantané des benchmarks LLM, 6 septembre : Astra et Fable 5.1 font leur entrée en scène

Une semaine après la fenêtre de lancement la plus dense de l'année, les classements ont parlé. Voici l'instantané hebdomadaire du 6 septembre 2026 : ce que dit chaque source aujourd'hui, ce qui a changé depuis l'instantané de la semaine dernière, et où les sources divergent. Chaque numéro renvoie à une page permanente et datée.

Le titre : la semaine de lancement a atterri

GPT-6 Astra et Claude Fable 5.1, tous deux publiés dans les premiers jours de septembre, sont déjà en tête des classements :

  • Arène de développement web : GPT-6 Astra Max fait ses débuts à 1797 Elo, un bond de +107 par rapport au leader de la semaine dernière (Claude Opus 5 Max, 1691). Des écarts de début aussi importants sont rares ; le record précédent cette année était sous +60. Claude Fable 5.1 Max se place deuxième à 1762.
  • Arène de texte : Claude Fable 5.1 Max prend la première place avec 1514, mettant fin au règne d'Opus 5 Max (1505, désormais troisième derrière Opus 5 High).
  • LiveBench : Fable 5.1 Max Effort devance son prédécesseur, 83,8 contre 83,4, avec Astra Max juste derrière à 83,1 - trois modèles à moins de 0,7 points sur une suite sans contamination.
  • BenchLM : Fable 5.1 premier à 83,0, Astra deuxième à 81,1. Notez l'exception : le leader BenchLM de la semaine dernière était Claude Mythos 5 (83,4), la variante à accès restreint, ce qui montre comment les niveaux d'accès compliquent la lecture des classements.
  • Aider polyglotte (édition de code pratique) : inchangé - GPT-5 High mène toujours à 88,0 %. Ni Astra ni Fable 5.1 n'y ont encore été évalués ; surveillez la semaine prochaine.
  • Où les sources divergent

    Les arènes couronnent déjà la nouvelle paire ; Aider ne les a pas testés ; LiveBench montre le top trois séparé par moins d'un point. Si vous lisez un seul classement, vous obtenez un couronnement ; si vous lisez les cinq, vous obtenez une photo finish avec des astérisques. Cet écart est la raison pour laquelle ces instantanés existent.

    Les reçus

  • Photo figée d'aujourd'hui : instantané de référence 2026-09-06
  • Celle de la semaine dernière : instantané 2026-08-30
  • Classements en direct, mis à jour quotidiennement : texte · développement web · historique complet
  • Contexte sur les modèles : GPT-6 Astra · Claude Fable 5 et Mythos 5 dans le Wiki IA
  • Tags
    benchmarks·gpt-6-astra·claude-fable-5-1·snapshot·leaderboards