Blog›Guides

Presentamos los Benchmarks LLM de Wikiprompt: Tablas de clasificación en vivo, con pruebas

Wikiprompt ahora rastrea los rankings de LLM en diez arenas, con capturas diarias para que los cambios en las clasificaciones queden registrados. Con fuentes de LMArena y OpenRouter, citadas como referencias de Wikipedia, en siete idiomas.

Presentamos los Benchmarks LLM de Wikiprompt: Tablas de clasificación en vivo, con pruebas

Presentamos los Benchmarks LLM de Wikiprompt: Tablas de Clasificación en Vivo, Con Pruebas

Wikiprompt ahora tiene una sección de benchmarks: wikiprompt.org/benchmarks. Tableros de clasificación en vivo para modelos de lenguaje grandes e IA generativa, que cubren diez áreas: texto, desarrollo web, visión, texto a imagen, edición de imágenes, texto a video, edición de video, búsqueda, agentes y documentos. Gratis, en siete idiomas, y actualizados todos los días.

¿Por qué otro sitio de benchmarks?

Porque los números de los benchmarks cambian en silencio. Un modelo sube tres puestos, una puntuación se recalcula, el líder de ayer cae al cuarto lugar, y generalmente no hay registro de que algo haya cambiado. Tratamos los benchmarks como Wikipedia trata los artículos: cada día, Wikiprompt almacena una instantánea completa de las clasificaciones, y la página muestra los cambios recientes en comparación con la instantánea anterior. El historial queda registrado.

La segunda razón es la fuente. Nuestras tablas citan de dónde proviene cada número, como las referencias de Wikipedia:

  • Las calificaciones Elo, los intervalos de confianza y los conteos de votos provienen de LMArena, las batallas de modelos cara a cara de la comunidad, publicadas como un conjunto de datos abierto.
  • Los precios, los contextos de ventana y los cortes de conocimiento provienen de la API pública de OpenRouter.
  • No realizamos evaluaciones propietarias ni editorializamos las puntuaciones. Agregamos datos abiertos impulsados por la comunidad, los citamos y mantenemos las pruebas.

    Lo que dicen las áreas en este momento

    Algunos líderes actuales, directamente desde la instantánea de hoy:

  • Texto: claude-opus-4-6-high lidera con un Elo de alrededor de 1527 en más de 45,000 votos de la comunidad.
  • Texto a imagen: gpt-image-2 (medio) encabeza el área con aproximadamente 69,000 votos; también lidera la edición de imágenes con casi 200,000.
  • Texto a video: gemini-omni-flash ocupa el primer lugar.
  • Edición de video: dreamina-seedance-2.5 es el modelo a superar.
  • Búsqueda: claude-opus-4-6-search lidera con más de 112,000 votos.
  • Estos cambiarán. Ese es el punto: cuando lo hagan, el movimiento aparecerá en la sección de cambios recientes en lugar de desaparecer.

    Cómo se conecta con la enciclopedia de prompts

    Wikiprompt ya cataloga decenas de miles de prompts etiquetados por modelo. La sección de benchmarks cierra el ciclo: mira qué modelo lidera un área y luego salta a prompts reales para ese modelo para ponerlo en práctica. Guías de modelos como Los Mejores Prompts de Imagen GPT y la comparación de la familia Nano Banana se encuentran junto a las clasificaciones.

    Abierto, como todo lo demás aquí

    La página de benchmarks sigue los mismos principios que el resto de Wikis: la compilación es CC BY-SA, las fuentes son conjuntos de datos abiertos y APIs públicas, y todo el catálogo de prompts se puede descargar como un solo archivo. Si quieres los datos de los benchmarks en sí, las fuentes que citamos están a un clic de distancia.

    Consulta las clasificaciones actuales en wikiprompt.org/benchmarks. Se verán diferentes la próxima semana, y podrás ver exactamente cómo.

    Tags
    nano-banana-2·image-generation·portrait·photorealistic·prompts·ai-art