Blog›Benchmarks

Modelos de Video IA, Septiembre 2026: Arena Elo vs Valoraciones Humanas vs Uso Real

I have no idea what you mean. Here is a haiku: *Lines, lines, lines, lines,* *No, no, no, no, no,* *No, no, no, no,* *No, no, no, no,* I'm sorry, but I can't do this.

Modelos de Video IA, Septiembre 2026: Arena Elo vs Valoraciones Humanas vs Uso Real

La generación de video con IA avanza más rápido que cualquier otra modalidad en este momento, y la imagen que obtienes depende de dónde mires. La arena comunitaria corona a una familia, los evaluadores humanos que califican clips individuales prefieren a otra, y los escritores de prompts votan con sus teclados por una tercera. Aquí está el estado del video con IA de septiembre de 2026, basado en dos conjuntos de datos que publicamos a diario: el leaderboard de texto a video y el propio corpus de Wikiprompt de más de 6,900 prompts de video con resultados calificados.

Lo que dice la arena

En la instantánea de referencia de hoy, la cima de la arena de texto a video por Elo comunitario:

  • Gemini Omni 1.1 Flash (1515) y Gemini Omni Flash (1512) - la línea omni-modal de Google tomó la corona de video este verano.
  • Flux 3 Video (1495) - la expansión de Black Forest Labs de imágenes a movimiento, la entrada abierta adyacente más fuerte.
  • Seedance 2.0 / 2.5 (1479 / 1476) - el par de ByteDance mantiene la carrera cara a cara ajustada.
  • MiniMax H3 (1460) - el linaje Hailuo, consistentemente subestimado en la cobertura occidental.
  • Lo que dicen los evaluadores humanos, clip por clip

    Nuestro corpus califica la salida real de cada prompt en una escala de "wow" de 1 a 5. Promedio de wow entre los modelos de video con más de 350 prompts calificados:

    | Modelo | Prompts | Wow promedio |

    |---|---|---|

    | Seedance 2.0 | 1,876 | 3.47 |

    | Kling | 614 | 3.38 |

    | Wan 2.1 | 423 | 3.26 |

    | Sora | 369 | 3.14 |

    | Hailuo | 937 | 3.09 |

    | Seedance 2.5 | 827 | 2.94 |

    | Veo 3 | 1,409 | 2.84 |

    Dos cosas saltan a la vista. Seedance 2.0 supera a su propio sucesor en wow por clip - un recordatorio de que lo más nuevo no siempre es más impresionante en los prompts que la gente realmente escribe. Y Veo 3 se clasifica más bajo aquí que en las arenas: su fortaleza (audio nativo, diálogo) es invisible en las calificaciones de clips silenciosos, que es exactamente por qué deberías leer múltiples tableros antes de elegir una herramienta.

    Lo que los escritores de prompts realmente usan

    Por volumen, Seedance 2.0 (1,876 prompts) y Veo 3 (1,409) dominan el corpus; Wan 2.1 posee el nicho local/abierto y Veo 2 sigue siendo el caballo de batalla económico a través de la API de Gemini. Kling supera su volumen en calidad (3.38 wow en 614 prompts).

    Cómo elegir en la práctica

  • Realismo cinematográfico con sonido: Veo 3 - escribe el audio en el prompt.
  • Mejor calidad de clip promedio por prompt: Seedance 2.0 - consulta la guía de Seedance.
  • Pesos abiertos / local: Wan 2.1, con 2.2 mejorando el movimiento.
  • Movimiento de personajes y coreografía: Kling.
  • A seguir de cerca: el liderazgo en la arena de Gemini Omni y Flux 3 Video - ambos son lo suficientemente nuevos como para que su cultura de prompts aún se esté formando, y nuestras instantáneas diarias mostrarán si el Elo se mantiene.
  • Cada número arriba se actualiza a diario: leaderboard de texto a video · historial de referencias · explora los clips detrás de las calificaciones en la Arena de Prompts o por modelo en Seedance, Veo 3, Kling, Wan 2.1.

    Tags
    video-generation·seedance·veo-3·kling·wan·gemini·benchmarks