Instantâneo de Benchmark de LLM: Semana de 13 de setembro de 2026
A foto semanal entre cinco rankings: Claude Fable 5.1 lidera em texto, LiveBench e BenchLM; GPT-5 mantém a coroa de codificação Aider; GPT-6 Astra domina webdev. Estabilidade no topo, dividida por disciplina.

A foto semanal dos rankings de LLM chegou: snapshot 2026-09-13, em cinco fontes independentes. A manchete desta semana é estabilidade no topo e uma divisão tripla por disciplina.
Líderes por fonte
O que mudou em relação à semana passada
Muito pouco no topo, e essa é a história: as mesmas duas famílias dividiram os quadros por duas semanas seguidas. A Anthropic domina benchmarks de texto geral e tarefas mistas (arena de texto, LiveBench, BenchLM); a OpenAI domina os quadros de desenvolvedores (codificação Aider, arena webdev). Se você escolher um modelo pelo ranking, a resposta agora realmente depende de qual ranking.
O ângulo de divergência entre fontes
Uma única alegação de "melhor modelo" esconde uma divisão tripla: Fable 5.1 é #1 em três quadros, GPT-6 Astra em um, GPT-5 em um. É exatamente por isso que capturamos todos os cinco diariamente - cada quadro mede uma habilidade diferente, e os registros ficam documentados.
Navegue pelas tabelas completas em /benchmarks, ou compare ao longo do tempo no histórico.
Related Articles
- Laya vs. Jev: Die Open-Source-Antwort auf die Entscheidungsmodell-Welle
Sep 22, 2026 · 5 min read
- Laya contre Jev : La réponse open-source à la vague des modèles de décision
Sep 22, 2026 · 5 min read
- Laya vs Jev: La respuesta de código abierto a la ola de modelos de decisión
Sep 22, 2026 · 5 min read
- Laya vs Jev: 오픈소스로 답하는 의사결정 모델 물결
Sep 22, 2026 · 5 min read
- लाया बनाम जेव: निर्णय-मॉडल लहर का ओपन-सोर्स उत्तर
Sep 22, 2026 · 5 min read