BlogBenchmarks

Instantâneo de Benchmark de LLM: 30 de agosto de 2026

Foto semanal congelada de seis rankings de LLMs: Opus 5 lidera a arena de texto, Fable 5 domina o LiveBench, gpt-5 mantém a liderança em codificação Aider, e as fontes ainda discordam.

Instantâneo de Benchmark de LLM: 30 de agosto de 2026

Instantâneo do Benchmark de LLM: 30 de agosto de 2026

Todo domingo, o Wikiprompt congela uma foto dos principais rankings de LLM. Este é o instantâneo da semana que termina em 30 de agosto de 2026 - 14.164 entradas em seis fontes, navegável na íntegra em /benchmarks/snapshot/2026-08-30.

Líderes por fonte

  • LMArena (texto): claude-opus-5-max assume o topo do Elo (1504,7), um pouco acima de claude-opus-5-high (1503,6), com o claude-opus-4-6-high da geração anterior ainda em terceiro.
  • LMArena (desenvolvimento web): claude-opus-5-max lidera por uma margem ampla (1690,6), com kimi-k3-max (1673,7) e qwen3.8-max (1668,9) como os desafiantes de peso aberto mais fortes.
  • LiveBench: claude-fable-5-max-effort no topo (83,4), à frente de gpt-5.6-sol-max (81,7) e gpt-5.5-xhigh (80,8).
  • BenchLM: a família Claude 5 varre o pódio - Mythos 5 (83,4), Fable 5 (83,2), Opus 5 (83,1) - separados por frações de ponto.
  • Aider polyglot (codificação): gpt-5 (alto) continua sendo o rei do benchmark de codificação com 88,0% de taxa de aprovação, à frente de gpt-5 (médio) e o3-pro (alto).
  • Índice de inteligência da Artificial Analysis: Claude Opus 5 no esforço máximo lidera (63,1), com as variantes Fable 5 logo atrás.
  • O que mudou em relação à semana passada

    A coroa da arena de texto mudou de mãos dentro da mesma família: claude-opus-5-high (1504,2 na semana passada) foi superado por claude-opus-5-max (1504,7). Estatisticamente, é um cara ou coroa; editorialmente, é um lembrete de que as configurações de esforço agora importam tanto quanto a escolha do modelo no topo da tabela.

    As fontes ainda discordam

    Como toda semana, nenhum ranking coroa o mesmo modelo: o Elo da comunidade do LMArena favorece o Opus 5, os conjuntos acadêmicos livres de contaminação do LiveBench favorecem o Fable 5, e o harness de codificação do mundo real do Aider ainda pertence ao gpt-5. Faça referência cruzada antes de escolher - é para isso que serve a visão de comparação.

    Navegue pela tabela completa com data em /benchmarks/snapshot/2026-08-30, ou pelo arquivo inteiro em /benchmarks/history.

    Tags
    benchmarks·llm·leaderboard·weekly