Blog›Benchmarks

Instantánea de Evaluaciones de LLM, 22 de septiembre de 2026: Una Semana Congelada en la Cima

Ni una sola posición del top-3 cambió esta semana en LiveBench, BenchLM, Aider y LMArena. La acción real estuvo fuera de los rankings: los modelos de decisión Jev y Laya abrieron una categoría que ningún benchmark mide todavía.

Instantánea de Evaluaciones de LLM, 22 de septiembre de 2026: Una Semana Congelada en la Cima

Instantánea de Benchmarks de LLM, 22 de septiembre de 2026: Una Semana Congelada en la Cima

Cada semana fotografiamos los principales rankings de LLM y guardamos los recibos en /benchmarks/history. La foto de esta semana, 22 de septiembre, es notable por lo que no sucedió: en las cinco fuentes que rastreamos, ni una sola posición entre los tres primeros cambió de manos.

Los líderes, por fuente

  • LiveBench (general): Claude Fable 5.1 (esfuerzo máximo) mantiene el primer lugar con 83.78, por delante de Fable 5 (83.38) y GPT-6 Astra max (83.05). Tres modelos dentro de 0.73 puntos.
  • BenchLM (general): Claude Fable 5.1 con 84.58, GPT-6 Astra con 83.79, Claude Opus 5 con 81.87.
  • Aider polyglot (codificación): GPT-5 (alto) conserva su 88.0, con GPT-5 (medio) en 86.7 y o3-pro en 84.9. OpenAI aún domina este ranking.
  • LMArena text Elo: Claude Fable 5.1 max en 1507.6, con dos variantes de Opus 5 pisándole los talones en 1505 - una brecha de 2.6 Elo, efectivamente un empate.
  • LMArena webdev Elo: GPT-6 Astra max en 1800.3, cómodamente por delante de Fable 5.1 max (1758) - el único ranking donde la brecha es amplia.
  • Las fuentes aún discrepan

    El patrón de desacuerdo que señalamos cada semana se mantiene: Anthropic lidera el texto de propósito general en tres rankings, OpenAI lidera la codificación (Aider) y el desarrollo web (LMArena) de manera decisiva. Si eliges un modelo según "el ranking", la respuesta aún depende completamente de qué ranking coincida con tu carga de trabajo.

    La acción estaba fuera de los rankings

    Una semana congelada en la cima no significa una semana tranquila. Los lanzamientos más discutidos no fueron modelos de chat en absoluto: TypeSafe's Jev y el de código abierto, Apache 2.0 Laya de India's Convai Innovations abrieron la categoría de "modelos de decisión System One" - respuestas tipadas con probabilidades calibradas en lugar de texto generado. Ninguno de los rankings anteriores mide ese tipo de modelo todavía, lo cual es en sí mismo una brecha digna de observar: el ecosistema de benchmarks mide escritura y codificación, mientras que una porción creciente de IA de producción es clasificación rápida. Nuestra comparación: Laya vs Jev.

    Explora la instantánea completa en /benchmarks/snapshot/2026-09-22, o el ranking en vivo en /benchmarks.

    Tags
    benchmarks·llm·leaderboard·claude·gpt-6·aider·livebench·weekly-snapshot