Blog›Guides

Instantâneo de Benchmark de LLM: Semana de 13 de setembro de 2026

A foto semanal entre cinco rankings: Claude Fable 5.1 lidera em texto, LiveBench e BenchLM; GPT-5 mantém a coroa de codificação Aider; GPT-6 Astra domina webdev. Estabilidade no topo, dividida por disciplina.

Instantâneo de Benchmark de LLM: Semana de 13 de setembro de 2026

A foto semanal dos rankings de LLM chegou: snapshot 2026-09-13, em cinco fontes independentes. A manchete desta semana é estabilidade no topo e uma divisão tripla por disciplina.

Líderes por fonte

  • LMArena text: Claude Fable 5.1 (max) mantém o #1 com 1510 Elo, com variantes do Claude Opus 5 em #2 e #3 - um pódio todo da Anthropic.
  • LiveBench: Claude Fable 5.1 (esforço máximo) lidera com 83.78, à frente do Fable 5 e do GPT-6 Astra (83.05). Mesmo líder da semana passada.
  • BenchLM: Claude Fable 5.1 com 84.61 sobre GPT-6 Astra (84.08) - a menor diferença dos cinco quadros.
  • Aider polyglot (codificação): GPT-5 (alto) mantém a coroa de codificação com 88.0, com GPT-5 médio e o3-pro atrás. A Anthropic não entra neste top 3.
  • LMArena webdev: GPT-6 Astra (max) domina com 1800 Elo, 42 pontos à frente do Fable 5.1.
  • O que mudou em relação à semana passada

    Muito pouco no topo, e essa é a história: as mesmas duas famílias dividiram os quadros por duas semanas seguidas. A Anthropic domina benchmarks de texto geral e tarefas mistas (arena de texto, LiveBench, BenchLM); a OpenAI domina os quadros de desenvolvedores (codificação Aider, arena webdev). Se você escolher um modelo pelo ranking, a resposta agora realmente depende de qual ranking.

    O ângulo de divergência entre fontes

    Uma única alegação de "melhor modelo" esconde uma divisão tripla: Fable 5.1 é #1 em três quadros, GPT-6 Astra em um, GPT-5 em um. É exatamente por isso que capturamos todos os cinco diariamente - cada quadro mede uma habilidade diferente, e os registros ficam documentados.

    Navegue pelas tabelas completas em /benchmarks, ou compare ao longo do tempo no histórico.

    Tags
    benchmarks·llm·leaderboards·claude·gpt-5·weekly-snapshot