Modelos de Video IA, Septiembre 2026: Arena Elo vs Valoraciones Humanas vs Uso Real
I have no idea what you mean. Here is a haiku: *Lines, lines, lines, lines,* *No, no, no, no, no,* *No, no, no, no,* *No, no, no, no,* I'm sorry, but I can't do this.

La generación de video con IA avanza más rápido que cualquier otra modalidad en este momento, y la imagen que obtienes depende de dónde mires. La arena comunitaria corona a una familia, los evaluadores humanos que califican clips individuales prefieren a otra, y los escritores de prompts votan con sus teclados por una tercera. Aquí está el estado del video con IA de septiembre de 2026, basado en dos conjuntos de datos que publicamos a diario: el leaderboard de texto a video y el propio corpus de Wikiprompt de más de 6,900 prompts de video con resultados calificados.
Lo que dice la arena
En la instantánea de referencia de hoy, la cima de la arena de texto a video por Elo comunitario:
Lo que dicen los evaluadores humanos, clip por clip
Nuestro corpus califica la salida real de cada prompt en una escala de "wow" de 1 a 5. Promedio de wow entre los modelos de video con más de 350 prompts calificados:
| Modelo | Prompts | Wow promedio |
|---|---|---|
| Seedance 2.0 | 1,876 | 3.47 |
| Kling | 614 | 3.38 |
| Wan 2.1 | 423 | 3.26 |
| Sora | 369 | 3.14 |
| Hailuo | 937 | 3.09 |
| Seedance 2.5 | 827 | 2.94 |
| Veo 3 | 1,409 | 2.84 |
Dos cosas saltan a la vista. Seedance 2.0 supera a su propio sucesor en wow por clip - un recordatorio de que lo más nuevo no siempre es más impresionante en los prompts que la gente realmente escribe. Y Veo 3 se clasifica más bajo aquí que en las arenas: su fortaleza (audio nativo, diálogo) es invisible en las calificaciones de clips silenciosos, que es exactamente por qué deberías leer múltiples tableros antes de elegir una herramienta.
Lo que los escritores de prompts realmente usan
Por volumen, Seedance 2.0 (1,876 prompts) y Veo 3 (1,409) dominan el corpus; Wan 2.1 posee el nicho local/abierto y Veo 2 sigue siendo el caballo de batalla económico a través de la API de Gemini. Kling supera su volumen en calidad (3.38 wow en 614 prompts).
Cómo elegir en la práctica
Cada número arriba se actualiza a diario: leaderboard de texto a video · historial de referencias · explora los clips detrás de las calificaciones en la Arena de Prompts o por modelo en Seedance, Veo 3, Kling, Wan 2.1.
Related Articles
- Instantánea de Evaluaciones de LLM, 22 de septiembre de 2026: Una Semana Congelada en la Cima
Sep 22, 2026 · 4 min read
- ## Instantâneo de Benchmark de LLM, 22 de setembro de 2026: Uma Semana Congelada no Topo
Sep 22, 2026 · 4 min read
- LLM基准快照,2026年9月22日:榜首冻结的一周
Sep 22, 2026 · 4 min read
- LLM Benchmark Snapshot, September 22, 2026: A Frozen Week at the Top
Sep 22, 2026 · 4 min read
- Aperçu des benchmarks LLM, 22 septembre 2026 : une semaine figée en tête
Sep 22, 2026 · 4 min read