Blog›Guides

Instantánea de Benchmarks de LLM: 23 de agosto de 2026

La primera foto semanal de los rankings de LLM: LMArena, LiveBench, BenchLM y Aider, congelados en una página citable. Anthropic barre tres podios; GPT-5 mantiene la corona de codificación.

Instantánea de Benchmarks de LLM: 23 de agosto de 2026

Instantánea de Referencias de LLM: 23 de agosto de 2026

Esta es la primera entrada en una nueva serie de Wikiprompt: cada semana congelamos una foto completa de los principales rankings de LLM y la publicamos como una página permanente y citable. Las tablas completas de esta instantánea viven en /benchmarks/snapshot/2026-08-23, y cada foto futura será indexada en /benchmarks/history.

¿Por qué instantáneas con fecha?

Los números de los rankings se mueven silenciosamente: un modelo sube, una puntuación se recalcula, y el líder del mes pasado se convierte silenciosamente en cuarto. Al mantener una URL por foto semanal, el registro permanece público. Puedes citar "los rankings al 23 de agosto de 2026" y ese enlace siempre mostrará exactamente eso.

Qué muestra la foto

Esta instantánea cubre cinco fuentes independientes y abiertas, cada una con su propia metodología:

  • LMArena (arena de texto): claude-opus-5-high lidera el Elo comunitario, con claude-opus-5-max y claude-opus-4-6-high justo detrás. Anthropic mantiene todo el podio de texto esta semana.
  • LMArena (desarrollo web): claude-opus-5-max en la cima, seguido por kimi-k3-max y qwen3.8-max, dos retadores de peso abierto de Moonshot y Alibaba presionando a los laboratorios frontera.
  • LiveBench: claude-fable-5-max-effort toma el primer lugar con un promedio de 83.4, por delante de gpt-5.6-sol-max (81.7) y gpt-5.5-xhigh (80.8).
  • Agregado de BenchLM: un podio totalmente de Anthropic: Claude Mythos 5 (83.0), Claude Opus 5 (82.7) y Claude Fable 5 (82.7), separados por un cuarto de punto.
  • Aider polyglot (codificación): gpt-5 (high) todavía domina la codificación práctica con una tasa de aprobación del 88.0 por ciento, por delante de gpt-5 (medium) y o3-pro (high).
  • La lectura interesante es el desacuerdo: la votación comunitaria (LMArena), los conjuntos de tareas de estilo académico (LiveBench), las puntuaciones agregadas (BenchLM) y la codificación práctica (Aider) no coronan al mismo modelo. Ese desacuerdo es exactamente por qué rastreamos muchas fuentes en lugar de una sola.

    Explóralo

  • Rankings en vivo, filtros y el gráfico de costo versus rendimiento: /benchmarks
  • La foto congelada de esta semana: /benchmarks/snapshot/2026-08-23
  • Todas las instantáneas: /benchmarks/history
  • Nuevas fotos llegan cada domingo. Cuando los rankings cambien, podrás señalar exactamente cuándo.

    Tags
    nano-banana-2·image-generation·portrait·photorealistic·prompts·ai-art