BlogBenchmarks

# Instantánea de Benchmarks de LLM: 30 de agosto de 2026

Foto semanal congelada de seis tablas de clasificación de LLM: Opus 5 max lidera la arena de texto, Fable 5 mantiene LiveBench, gpt-5 sigue en Aider coding, y las fuentes aún no coinciden.

# Instantánea de Benchmarks de LLM: 30 de agosto de 2026

Instantánea del Benchmark de LLM: 30 de agosto de 2026

Cada domingo, Wikiprompt congela una foto de los principales rankings de LLM. Esta es la instantánea de la semana que termina el 30 de agosto de 2026 - 14,164 entradas de seis fuentes, navegables en su totalidad en /benchmarks/snapshot/2026-08-30.

Líderes por fuente

  • LMArena (texto): claude-opus-5-max toma el primer puesto de Elo (1504.7), un pelo por encima de claude-opus-5-high (1503.6), con la generación anterior claude-opus-4-6-high aún manteniendo el tercer lugar.
  • LMArena (desarrollo web): claude-opus-5-max lidera por un amplio margen (1690.6), con kimi-k3-max (1673.7) y qwen3.8-max (1668.9) como los desafiantes de peso abierto más fuertes.
  • LiveBench: claude-fable-5-max-effort en la cima (83.4), por delante de gpt-5.6-sol-max (81.7) y gpt-5.5-xhigh (80.8).
  • BenchLM: la familia Claude 5 barre el podio - Mythos 5 (83.4), Fable 5 (83.2), Opus 5 (83.1) - separados por fracciones de punto.
  • Aider polyglot (codificación): gpt-5 (high) sigue siendo el rey del benchmark de codificación con una tasa de aprobación del 88.0%, por delante de gpt-5 (medium) y o3-pro (high).
  • Índice de inteligencia de Artificial Analysis: Claude Opus 5 con máximo esfuerzo lidera (63.1), con las variantes Fable 5 justo detrás.
  • Qué cambió respecto a la semana pasada

    La corona de la arena de texto cambió de manos dentro de la misma familia: claude-opus-5-high (1504.2 la semana pasada) fue superado por claude-opus-5-max (1504.7). Estadísticamente un lanzamiento de moneda, editorialmente un recordatorio de que los ajustes de esfuerzo ahora importan tanto como la elección del modelo en la cima de la tabla.

    Las fuentes aún discrepan

    Como cada semana, no hay dos rankings que coronen al mismo modelo: el Elo comunitario de LMArena favorece a Opus 5, los conjuntos académicos libres de contaminación de LiveBench favorecen a Fable 5, y el arnés de codificación del mundo real de Aider aún pertenece a gpt-5. Cruza referencias antes de elegir - para eso está la vista de comparación.

    Navega por la tabla completa con fecha en /benchmarks/snapshot/2026-08-30, o por todo el archivo en /benchmarks/history.

    Tags
    benchmarks·llm·leaderboard·weekly