E-VBench est un banc d'essai (benchmark) conçu pour évaluer les systèmes d'intelligence artificielle qui génèrent du contenu vidéo, spécifiquement destiné à mesurer les sorties de longue durée. Introduit en 2025, il répond aux limites des cadres d'évaluation antérieurs qui se concentraient sur de courts extraits, généralement de moins de cinq secondes. E-VBench exige que les modèles produisent des vidéos d'une durée de 10 à 30 secondes, englobant plusieurs scènes et des transitions narratives complexes.
Le banc d'essai a été développé par un consortium de chercheurs académiques et industriels, avec des résultats initiaux publiés début 2025. Il s'appuie sur les fondations de VBench, un banc d'essai de génération vidéo largement utilisé, publié en 2023, mais étend les critères d'évaluation pour inclure la cohérence temporelle à long terme et la cohérence au niveau de l'histoire. E-VBench comprend 1 500 ensembles de prompts, chacun contenant un script détaillé avec des descriptions de scènes, des actions de personnages et des indications de dialogue. Les prompts couvrent 12 catégories, notamment la narration cinématographique, le contenu pédagogique et les séquences sportives dynamiques.
Métriques d'évaluation
E-VBench emploie un système de notation multidimensionnel qui combine des métriques automatisées avec une évaluation humaine. La principale métrique automatisée est le Score de Cohérence Temporelle Étendue (ETCS), qui mesure la cohérence image par image sur des intervalles de plus de 10 secondes. L'ETCS est calculé à l'aide d'un transformateur de vision pré-entraîné qui suit la persistance des objets et la continuité du mouvement. Une métrique secondaire, l'Indice d'Alignement Narratif (NAI), évalue si les scènes générées suivent la progression logique spécifiée dans le script du prompt. Le NAI utilise un grand modèle de langage pour comparer les sous-titres générés aux jalons narratifs attendus.
Les évaluateurs humains notent les sorties sur une échelle de 1 à 5 selon quatre critères : qualité visuelle, adhérence sémantique, fluidité temporelle et plausibilité créative. L'accord inter-annotateurs, mesuré par le kappa de Cohen, atteint en moyenne 0,78. Le score final du banc d'essai est un composite pondéré : 40 % ETCS, 30 % NAI et 30 % évaluations humaines.
Résultats de performance des modèles
Les premiers résultats d'E-VBench, publiés en mars 2025, ont montré une variation significative parmi les principaux systèmes d'IA générative. Le modèle de génération vidéo d'OpenAI, rapporté dans des évaluations internes, a obtenu un ETCS de 0,82 et un NAI de 0,74, se classant premier au total. Le système concurrent de Google DeepMind a obtenu un score de 0,79 sur l'ETCS et de 0,71 sur le NAI. Un modèle d'Anthropic, encore en version bêta, a affiché des scores plus faibles de 0,65 et 0,58, respectivement, indiquant des défis avec la cohérence narrative étendue.
Les modèles open-source, tels que ceux basés sur l'architecture Stable Video Diffusion, ont accusé un retard par rapport aux systèmes commerciaux. La meilleure entrée open-source a atteint un ETCS de 0,61 et un NAI de 0,52. Ces résultats mettent en évidence un écart entre les modèles propriétaires et ouverts, en particulier dans la gestion des transitions multi-scènes et le maintien de l'identité des personnages sur des durées plus longues.
Comparaison avec les bancs d'essai antérieurs
E-VBench diffère des bancs d'essai antérieurs comme VBench et le plus récent VideoGenBench sur plusieurs aspects clés. VBench, publié en 2023, se concentrait sur des extraits de 2 à 4 secondes et évaluait 16 dimensions, y compris la qualité du mouvement et la qualité de l'imagerie. VideoGenBench, introduit fin 2024, a étendu la durée à 8 secondes mais n'exigeait pas de structure narrative. La durée de 10 à 30 secondes d'E-VBench force les modèles à maintenir la cohérence à travers les coupures de scènes, les changements d'éclairage et les sauts temporels.
Une autre distinction est l'inclusion du dialogue et de la synchronisation audiovisuelle. Les prompts d'E-VBench incluent des lignes parlées, et les vidéos générées sont évaluées pour la précision de la synchronisation labiale à l'aide d'une métrique distincte de cohérence audiovisuelle. Cette fonctionnalité était absente des bancs d'essai antérieurs, qui évaluaient uniquement les sorties visuelles.
Limites et orientations futures
Les critiques notent que la dépendance d'E-VBench à l'évaluation humaine le rend coûteux à exécuter à grande échelle. Chaque ensemble de prompts nécessite environ 15 minutes de revue humaine, et le banc d'essai complet prend plus de 375 heures de temps d'annotation. Des efforts sont en cours pour développer des substituts automatisés pour les évaluations humaines, en utilisant des modèles d'apprentissage par renforcement à partir de feedback humain (RLHF) comme juges.
Une autre limite est la focalisation du banc d'essai sur des prompts en anglais, ce qui peut biaiser les résultats vers des modèles entraînés principalement sur des données anglophones. Les versions futures prévoient d'inclure des prompts multilingues dans au moins 10 langues, y compris le mandarin, l'espagnol et l'hindi. L'équipe d'E-VBench a également l'intention de publier un sous-ensemble de 200 ensembles de prompts pour une itération rapide, permettant aux chercheurs de tester les modèles avec un coût de calcul réduit.
Le banc d'essai devrait être mis à jour annuellement, avec la prochaine version prévue pour début 2026. Les mises à jour intégreront de nouvelles catégories de prompts, telles que la narration interactive et adaptative à l'utilisateur, et étendront la durée maximale des vidéos à 60 secondes.
Impact sur le domaine
E-VBench a influencé les priorités de développement de plusieurs groupes de recherche en IA. Des entreprises comme OpenAI et Google DeepMind ont cité le banc d'essai dans des rapports techniques, utilisant ses métriques pour guider les améliorations en modélisation temporelle. Des laboratoires académiques, y compris Berkeley AI Research et Stanford AI Lab, ont adopté E-VBench comme outil d'évaluation standard dans leurs projets de génération vidéo.
Le banc d'essai a également stimulé de nouvelles recherches sur les réseaux neuronaux à mémoire augmentée, car les modèles doivent retenir des informations sur des séquences plus longues. Des techniques telles que les mécanismes d'attention croisée et les encodeurs temporels basés sur des transformateurs ont montré des promesses pour améliorer les scores ETCS. À la fin de 2025, le score ETCS le plus élevé rapporté sur E-VBench est de 0,85, atteint par un modèle utilisant une architecture hybride convolutive et d'attention.