Blog›Benchmarks

## Instantâneo de Benchmark de LLM, 22 de setembro de ‍2026: Uma Semana Congelada no Topo

Nenhuma posição no top-3 mudou no LiveBench, BenchLM, Aider e LMArena esta semana. A ação real estava fora das tabelas: os modelos de decisão Jev e Laya abriram uma categoria que nenhum benchmark mede ainda.

## Instantâneo de Benchmark de LLM, 22 de setembro de  ‍2026: Uma Semana Congelada no Topo

Instantâneo dos Rankings de LLM, 22 de setembro de 2026: Uma Semana Congelada no Topo

Toda semana fotografamos os principais rankings de LLM e guardamos os registros em /benchmarks/history. A foto desta semana, 22 de setembro, é notável pelo que não aconteceu: em todas as cinco fontes que acompanhamos, nem uma única posição entre as três primeiras mudou de mãos.

Os líderes, por fonte

  • LiveBench (geral): Claude Fable 5.1 (esforço máximo) mantém o primeiro lugar com 83,78, à frente de Fable 5 (83,38) e GPT-6 Astra max (83,05). Três modelos dentro de 0,73 pontos.
  • BenchLM (geral): Claude Fable 5.1 com 84,58, GPT-6 Astra com 83,79, Claude Opus 5 com 81,87.
  • Aider poliglota (codificação): GPT-5 (alto) mantém seu 88,0, com GPT-5 (médio) em 86,7 e o3-pro em 84,9. A OpenAI ainda domina este ranking.
  • LMArena texto Elo: Claude Fable 5.1 max em 1507,6, com duas variantes do Opus 5 respirando no seu pescoço em 1505 - uma diferença de 2,6 Elo, efetivamente um empate.
  • LMArena webdev Elo: GPT-6 Astra max em 1800,3, confortavelmente à frente de Fable 5.1 max (1758) - o único ranking onde a diferença é ampla.
  • As fontes ainda discordam

    O padrão de discordância que destacamos toda semana se mantém: a Anthropic lidera texto de propósito geral em três rankings, a OpenAI lidera codificação (Aider) e webdev (LMArena) de forma decisiva. Se você escolher um modelo pelo "ranking", a resposta ainda depende inteiramente de qual ranking corresponde à sua carga de trabalho.

    A ação estava fora dos rankings

    Uma semana congelada no topo não significa uma semana tranquila. Os lançamentos mais discutidos não eram modelos de chat: o Jev da TypeSafe e o Laya de código aberto, Apache 2.0, da Convai Innovations da Índia, abriram a categoria de modelos de decisão "System One" - respostas tipadas com probabilidades calibradas em vez de texto gerado. Nenhum dos rankings acima mede esse tipo de modelo ainda, o que por si só é uma lacuna que vale a pena observar: o ecossistema de benchmarks mede escrita e codificação, enquanto uma fatia crescente de IA de produção é classificação rápida. Nossa comparação: Laya vs Jev.

    Navegue pelo instantâneo completo em /benchmarks/snapshot/2026-09-22, ou pelo ranking ao vivo em /benchmarks.

    Tags
    benchmarks·llm·leaderboard·claude·gpt-6·aider·livebench·weekly-snapshot