Instantâneo de Benchmark de LLM: 30 de agosto de 2026
Foto semanal congelada de seis rankings de LLMs: Opus 5 lidera a arena de texto, Fable 5 domina o LiveBench, gpt-5 mantém a liderança em codificação Aider, e as fontes ainda discordam.
Instantâneo do Benchmark de LLM: 30 de agosto de 2026
Todo domingo, o Wikiprompt congela uma foto dos principais rankings de LLM. Este é o instantâneo da semana que termina em 30 de agosto de 2026 - 14.164 entradas em seis fontes, navegável na íntegra em /benchmarks/snapshot/2026-08-30.
Líderes por fonte
O que mudou em relação à semana passada
A coroa da arena de texto mudou de mãos dentro da mesma família: claude-opus-5-high (1504,2 na semana passada) foi superado por claude-opus-5-max (1504,7). Estatisticamente, é um cara ou coroa; editorialmente, é um lembrete de que as configurações de esforço agora importam tanto quanto a escolha do modelo no topo da tabela.
As fontes ainda discordam
Como toda semana, nenhum ranking coroa o mesmo modelo: o Elo da comunidade do LMArena favorece o Opus 5, os conjuntos acadêmicos livres de contaminação do LiveBench favorecem o Fable 5, e o harness de codificação do mundo real do Aider ainda pertence ao gpt-5. Faça referência cruzada antes de escolher - é para isso que serve a visão de comparação.
Navegue pela tabela completa com data em /benchmarks/snapshot/2026-08-30, ou pelo arquivo inteiro em /benchmarks/history.
Related Articles
- GPT-6 Astra et Claude Fable 5.1 : Semaine de lancement de la frontière, en direct
Sep 3, 2026 · 6 min read
- # GPT-6 Astra und Claude Fable 5.1: Frontier-Launch-Woche, auf dem Papier
Sep 3, 2026 · 6 min read
- GPT-6 Astra and Claude Fable 5.1: Frontier Launch Week, on the Record
Sep 3, 2026 · 6 min read
- GPT-6 Astra y Claude Fable 5.1: Semana de Lanzamiento de Frontera, en el Registro
Sep 3, 2026 · 6 min read
- # GPT-6 Astra 与 Claude Fable 5.1:前沿发布周,纪实报道
Sep 3, 2026 · 6 min read