Blog›Guides

**Instantâneo do Benchmark de LLM: 23 de agosto de 2026**

A primeira foto semanal dos rankings de LLMs: LMArena, LiveBench, BenchLM e Aider, congelados em uma página citável. A Anthropic varre três pódios; o GPT-5 mantém a coroa de codificação.

**Instantâneo do Benchmark de LLM: 23 de agosto de 2026**

Instantâneo de Benchmark de LLM: 23 de agosto de 2026

Esta é a primeira entrada de uma nova série do Wiki: toda semana, congelamos uma foto completa dos principais rankings de LLM e a publicamos como uma página permanente e citável. As tabelas completas deste instantâneo estão em /benchmarks/snapshot/2026-08-23, e todas as fotos futuras serão indexadas em /benchmarks/history.

Por que instantâneos com data?

Os números dos benchmarks mudam silenciosamente: um modelo sobe, uma pontuação é recalculada e o líder do mês passado se torna o quarto colocado. Ao manter um URL único para cada foto semanal, o registro permanece público. Você pode citar "os rankings de 23 de agosto de 2026" e esse link sempre mostrará exatamente isso.

O que a foto mostra

Este instantâneo abrange cinco fontes independentes e abertas, cada uma com sua própria metodologia:

  • LMArena (arena de texto): claude-opus-5-high lidera o Elo da comunidade, com claude-opus-5-max e claude-opus-4-6-high logo atrás. A Anthropic domina todo o pódio de texto esta semana.
  • LMArena (desenvolvimento web): claude-opus-5-max no topo, seguido por kimi-k-max e qwen3-max, dois desafiadores de código aberto da Moonshot e da Alibaba pressionando os laboratórios de ponta.
  • LiveBench: claude-fable-5-max-effort fica em primeiro com uma média de 83,4, à frente de gpt-5.6-sol-max (81,7) e gpt-5.5-xhigh (80,8).
  • BenchLM agregado: um pódio todo da Anthropic: Claude Mythos 5 (83,0), Claude Opus 5 (82,7) e Claude Fable 5 (82,7), separados por um quarto de ponto.
  • Aider polyglot (codificação): gpt-5 (high) ainda domina a codificação prática com uma taxa de aprovação de 88,0%, à frente de gpt-5 (medium) e o3-pro (high).
  • A leitura interessante é o desacordo: votação da comunidade (LMArena), suítes de tarefas acadêmicas (LiveBench), pontuações agregadas (BenchLM) e codificação prática (Aider) não coroam o mesmo modelo. É exatamente por isso que acompanhamos várias fontes em vez de apenas uma.

    Explore

  • Rankings ao vivo, filtros e o gráfico de custo versus desempenho: /benchmarks
  • Foto congelada desta semana: /benchmarks/snapshot/2026-08-23
  • Todos os instantâneos: /benchmarks/history
  • Novas fotos chegam todo domingo. Quando os rankings mudarem, você poderá apontar exatamente para o momento da mudança.

    Tags
    nano-banana-2·image-generation·portrait·photorealistic·prompts·ai-art