Instantánea de Benchmarks de LLM: Semana del 13 de septiembre de 2026
La foto semanal a través de cinco tablas de clasificación: Claude Fable 5.1 mantiene el liderazgo en texto, LiveBench y BenchLM; GPT-5 conserva la corona de codificación Aider; GPT-6 Astra domina el desarrollo web. Estabilidad en la cima, dividida por disciplina.

La foto semanal de los rankings de LLM está aquí: instantánea 2026-09-13, a través de cinco fuentes independientes. El titular de esta semana es la estabilidad en la cima y una división triple por disciplina.
Líderes por fuente
Qué cambió vs la semana pasada
Muy poco en la cima, y esa es la historia: las mismas dos familias han dividido los tableros durante dos semanas consecutivas. Anthropic posee los benchmarks de texto general y tareas mixtas (text arena, LiveBench, BenchLM); OpenAI posee los tableros de desarrolladores (Aider coding, webdev arena). Si eliges un modelo según el ranking, la respuesta ahora realmente depende de cuál ranking uses.
El ángulo de desacuerdo entre fuentes
Una sola afirmación de "mejor modelo" oculta una división triple: Fable 5.1 es #1 en tres tableros, GPT-6 Astra en uno, GPT-5 en uno. Eso es exactamente por qué capturamos los cinco a diario - cada tablero mide una habilidad diferente, y los recibos quedan en el registro.
Explora las tablas completas en /benchmarks, o compara a lo largo del tiempo en el historial.
Related Articles
- Laya vs. Jev: Die Open-Source-Antwort auf die Entscheidungsmodell-Welle
Sep 22, 2026 · 5 min read
- Laya contre Jev : La réponse open-source à la vague des modèles de décision
Sep 22, 2026 · 5 min read
- Laya vs Jev: La respuesta de código abierto a la ola de modelos de decisión
Sep 22, 2026 · 5 min read
- Laya vs Jev: 오픈소스로 답하는 의사결정 모델 물결
Sep 22, 2026 · 5 min read
- लाया बनाम जेव: निर्णय-मॉडल लहर का ओपन-सोर्स उत्तर
Sep 22, 2026 · 5 min read