Blog›Guides

Aperçu des benchmarks LLM : semaine du 13 septembre 2026

La photo hebdomadaire à travers cinq classements : Claude Fable 5.1 détient le texte, LiveBench et BenchLM ; GPT-5 conserve la couronne de codage Aider ; GPT-6 Astra domine le développement web. Stabilité en tête, répartie par discipline.

Aperçu des benchmarks LLM : semaine du 13 septembre 2026

La photo hebdomadaire des classements LLM est arrivée : instantané 2026-09-13, à travers cinq sources indépendantes. Le titre de cette semaine est la stabilité en tête et une répartition en trois volets par discipline.

Leaders par source

  • LMArena texte : Claude Fable 5.1 (max) conserve la #1 à 1510 Elo, avec les variantes Claude Opus 5 en #2 et #3 - un podium entièrement Anthropic.
  • LiveBench : Claude Fable 5.1 (effort max) mène à 83,78, devant Fable 5 et GPT-6 Astra (83,05). Même leader que la semaine dernière.
  • BenchLM : Claude Fable 5.1 à 84,61 sur GPT-6 Astra (84,08) - l'écart le plus serré des cinq tableaux.
  • Aider polyglotte (codage) : GPT-5 (élevé) garde la couronne du codage à 88,0, avec GPT-5 moyen et o3-pro derrière. Anthropic ne perce pas ce top 3.
  • LMArena webdev : GPT-6 Astra (max) domine à 1800 Elo, 42 points devant Fable 5.1.
  • Ce qui a changé vs la semaine dernière

    Très peu en tête, et c'est là l'histoire : les mêmes deux familles ont maintenant réparti les tableaux pendant deux semaines consécutives. Anthropic possède les benchmarks de texte général et de tâches mixtes (arène texte, LiveBench, BenchLM) ; OpenAI possède les tableaux développeurs (codage Aider, arène webdev). Si vous choisissez un modèle par classement, la réponse dépend désormais réellement du classement choisi.

    L'angle des sources en désaccord

    Une seule affirmation de "meilleur modèle" cache une répartition en trois volets : Fable 5.1 est #1 sur trois tableaux, GPT-6 Astra sur un, GPT-5 sur un. C'est exactement pourquoi nous prenons un instantané des cinq chaque jour - chaque tableau mesure une compétence différente, et les preuves restent enregistrées.

    Parcourez les tableaux complets sur /benchmarks, ou comparez dans le temps via l'historique.

    Tags
    benchmarks·llm·leaderboards·claude·gpt-5·weekly-snapshot