Blog›Benchmarks

Modèles vidéo IA, septembre 2026 : Arena Elo vs notes humaines vs usage réel

Gemini Omni mène l'arène, Seedance 2.0 remporte les évaluations humaines par clip, et Veo 3 domine l'utilisation. Trois ensembles de données, trois gagnants différents - et comment choisir.

Modèles vidéo IA, septembre 2026 : Arena Elo vs notes humaines vs usage réel

La génération vidéo par IA progresse plus vite que toute autre modalité en ce moment, et le tableau que vous obtenez dépend de l'endroit où vous regardez. L'arène communautaire couronne une famille, les évaluateurs humains notant des clips individuels préfèrent une autre, et les rédacteurs de prompts votent avec leurs claviers pour une troisième. Voici l'état de la vidéo IA de septembre 2026, basé sur deux ensembles de données que nous publions quotidiennement : le classement texte-vers-vidéo et le propre corpus de Wikipédia de plus de 6 900 prompts vidéo avec résultats notés.

Ce que dit l'arène

Sur l'instantané de référence d'aujourd'hui, le sommet de l'arène texte-vers-vidéo par Elo communautaire :

  • Gemini Omni 1.1 Flash (1515) et Gemini Omni Flash (1512) - La ligne omni-modale de Google a pris la couronne vidéo cet été.
  • Flux 3 Video (1495) - L'expansion de Black Forest Labs des images vers le mouvement, la meilleure entrée quasi-ouverte.
  • Seedance 2.0 / 2.5 (1479 / 1476) - La paire de ByteDance maintient la course en tête-à-tête serrée.
  • MiniMax H3 (1460) - La lignée Hailuo, constamment sous-estimée dans la couverture occidentale.
  • Ce que disent les évaluateurs humains, clip par clip

    Notre corpus note la sortie réelle de chaque prompt sur une échelle de "wow" de 1 à 5. Wow moyen à travers les modèles vidéo avec plus de 350 prompts notés :

    | Modèle | Prompts | Wow moyen |

    |---|---|---|

    | Seedance 2.0 | 1 876 | 3,47 |

    | Kling | 614 | 3,38 |

    | Wan 2.1 | 423 | 3,26 |

    | Sora | 369 | 3,14 |

    | Hailuo | 937 | 3,09 |

    | Seedance 2.5 | 827 | 2,94 |

    | Veo 3 | 1 409 | 2,84 |

    Deux choses ressortent. Seedance 2.0 surpasse son propre successeur en wow par clip - un rappel que plus récent n'est pas toujours plus impressionnant sur les prompts que les gens écrivent réellement. Et Veo 3 se classe plus bas ici que sur les arènes : sa force (audio natif, dialogue) est invisible dans les notations de clips silencieux, ce qui explique exactement pourquoi vous devriez lire plusieurs tableaux avant de choisir un outil.

    Ce que les rédacteurs de prompts utilisent réellement

    En volume, Seedance 2.0 (1 876 prompts) et Veo 3 (1 409) dominent le corpus ; Wan 2.1 possède le créneau local/ouvert et Veo 2 reste le cheval de trait économique via l'API Gemini. Kling dépasse son volume en qualité (3,38 wow sur 614 prompts).

    Comment choisir en pratique

  • Réalisme cinématographique avec son : Veo 3 - écrivez l'audio dans le prompt.
  • Meilleure qualité moyenne de clip par prompt : Seedance 2.0 - voir le guide Seedance.
  • Poids ouverts / local : Wan 2.1, avec 2.2 améliorant le mouvement.
  • Mouvement de personnages et chorégraphie : Kling.
  • À surveiller ensuite : L'avance de Gemini Omni dans l'arène et Flux 3 Video - les deux sont assez nouveaux pour que leur culture de prompts soit encore en formation, et nos instantanés quotidiens montreront si l'Elo tient.
  • Chaque chiffre ci-dessus est mis à jour quotidiennement : classement texte-vers-vidéo · historique des références · parcourez les clips derrière les notations dans l'Arène de prompts ou par modèle à Seedance, Veo 3, Kling, Wan 2.1.

    Tags
    video-generation·seedance·veo-3·kling·wan·gemini·benchmarks