Blog›Guides

Instantánea de Benchmarks de LLM: Semana del 13 de septiembre de 2026

La foto semanal a través de cinco tablas de clasificación: Claude Fable 5.1 mantiene el liderazgo en texto, LiveBench y BenchLM; GPT-5 conserva la corona de codificación Aider; GPT-6 Astra domina el desarrollo web. Estabilidad en la cima, dividida por disciplina.

Instantánea de Benchmarks de LLM: Semana del 13 de septiembre de 2026

La foto semanal de los rankings de LLM está aquí: instantánea 2026-09-13, a través de cinco fuentes independientes. El titular de esta semana es la estabilidad en la cima y una división triple por disciplina.

Líderes por fuente

  • LMArena text: Claude Fable 5.1 (max) mantiene el #1 con 1510 Elo, con las variantes de Claude Opus 5 en el #2 y #3 - un podio completamente de Anthropic.
  • LiveBench: Claude Fable 5.1 (esfuerzo máximo) lidera con 83.78, por delante de Fable 5 y GPT-6 Astra (83.05). Mismo líder que la semana pasada.
  • BenchLM: Claude Fable 5.1 con 84.61 sobre GPT-6 Astra (84.08) - la brecha más ajustada de los cinco tableros.
  • Aider polyglot (codificación): GPT-5 (alto) mantiene la corona de codificación con 88.0, con GPT-5 medio y o3-pro detrás. Anthropic no entra en este top 3.
  • LMArena webdev: GPT-6 Astra (max) domina con 1800 Elo, 42 puntos por delante de Fable 5.1.
  • Qué cambió vs la semana pasada

    Muy poco en la cima, y esa es la historia: las mismas dos familias han dividido los tableros durante dos semanas consecutivas. Anthropic posee los benchmarks de texto general y tareas mixtas (text arena, LiveBench, BenchLM); OpenAI posee los tableros de desarrolladores (Aider coding, webdev arena). Si eliges un modelo según el ranking, la respuesta ahora realmente depende de cuál ranking uses.

    El ángulo de desacuerdo entre fuentes

    Una sola afirmación de "mejor modelo" oculta una división triple: Fable 5.1 es #1 en tres tableros, GPT-6 Astra en uno, GPT-5 en uno. Eso es exactamente por qué capturamos los cinco a diario - cada tablero mide una habilidad diferente, y los recibos quedan en el registro.

    Explora las tablas completas en /benchmarks, o compara a lo largo del tiempo en el historial.

    Tags
    benchmarks·llm·leaderboards·claude·gpt-5·weekly-snapshot