E-VBenchは、動画コンテンツを生成する人工知能システムを評価するためのベンチマークであり、特に長時間の出力を評価するために設計されています。2025年に導入され、5秒未満の短いクリップに焦点を当てた初期の評価フレームワークの限界に対処しています。E-VBenchは、モデルが10秒から30秒の動画を生成することを要求し、複数のシーンと複雑なナラティブ遷移を含みます。
このベンチマークは、学術および産業研究者のコンソーシアムによって開発され、初期結果は2025年初頭に公開されました。これは、2023年にリリースされた広く使用されている動画生成ベンチマークであるVBenchの基盤の上に構築されていますが、評価基準を長期の時間的コヒーレンスとストーリーレベルの一貫性に拡張しています。E-VBenchは、シーン記述、キャラクターアクション、ダイアログキューを含む詳細なスクリプトを含む1,500のプロンプトセットで構成されています。プロンプトは、映画的なストーリーテリング、教育コンテンツ、ダイナミックなスポーツシーケンスを含む12のカテゴリにわたります。
評価指標
E-VBenchは、自動指標と人間による評価を組み合わせた多次元スコアリングシステムを採用しています。主要な自動指標は拡張時間的一貫性スコア(ETCS)であり、10秒を超える間隔でのフレーム間のコヒーレンスを測定します。ETCSは、オブジェクトの永続性とモーションの連続性を追跡する事前学習済みビジョントランスフォーマーを使用して計算されます。二次指標であるナラティブアライメント指数(NAI)は、生成されたシーンがプロンプトスクリプトで指定された論理的な進行に従っているかどうかを評価します。NAIは、大規模言語モデルを使用して生成された字幕を期待されるストーリービートと比較します。
人間の評価者は、視覚品質、意味的遵守、時間的滑らかさ、創造的妥当性の4つの基準にわたって1〜5のスケールで出力を評価します。コーエンのカッパで測定される評価者間の一致度は、平均0.78です。最終的なベンチマークスコアは加重複合であり、ETCSが40%、NAIが30%、人間の評価が30%です。
モデルパフォーマンス結果
2025年3月にリリースされた初期のE-VBench結果は、主要な生成AIシステム間で大きなばらつきを示しました。OpenAIの動画生成モデルは、内部評価で報告されたところによると、ETCS 0.82とNAI 0.74を達成し、全体で1位にランクされました。Google DeepMindの競合システムは、ETCS 0.79とNAI 0.71をスコアしました。Anthropicのモデルは、まだベータ版であり、それぞれ0.65と0.58の低いスコアを記録し、拡張されたナラティブコヒーレンスに課題があることを示しています。
Stable Video Diffusionアーキテクチャに基づくモデルなどのオープンソースモデルは、商用システムに遅れをとりました。最良のオープンソースエントリーは、ETCS 0.61とNAI 0.52を達成しました。これらの結果は、特にマルチシーン遷移の処理と長期間にわたるキャラクターアイデンティティの維持において、プロプライエタリモデルとオープンモデルの間のギャップを浮き彫りにしています。
以前のベンチマークとの比較
E-VBenchは、VBenchやより最近のVideoGenBenchなどの以前のベンチマークと、いくつかの重要な側面で異なります。2023年にリリースされたVBenchは、2〜4秒のクリップに焦点を当て、モーション品質やイメージング品質を含む16の次元を評価しました。2024年後半に導入されたVideoGenBenchは、8秒のクリップに拡張されましたが、ナラティブ構造を要求しませんでした。E-VBenchの10〜30秒の持続時間は、モデルがシーンカット、照明変化、時間的ジャンプにわたって一貫性を維持することを強制します。
もう一つの違いは、ダイアログとオーディオビジュアル同期の包含です。E-VBenchプロンプトには話し言葉が含まれ、生成された動画は、別のオーディオビジュアル一貫性指標を使用してリップシンク精度が評価されます。この機能は、視覚出力のみを評価した以前のベンチマークには存在しませんでした。
限界と将来の方向性
批評家は、E-VBenchが人間の評価に依存しているため、大規模に実行するにはコストがかかると指摘しています。各プロンプトセットには約15分の人間によるレビューが必要であり、フルベンチマークには375時間以上のアノテーター時間がかかります。人間の評価の自動プロキシを開発する取り組みが進行中であり、RLHFモデルを判定者として使用しています。
もう一つの限界は、ベンチマークが英語のプロンプトに焦点を当てていることであり、これは主に英語データでトレーニングされたモデルに結果を偏らせる可能性があります。将来のバージョンでは、北京語、スペイン語、ヒンディー語を含む少なくとも10言語の多言語プロンプトを含める計画があります。E-VBenchチームはまた、研究者が計算コストを削減してモデルをテストできるように、迅速な反復のための200のプロンプトセットのサブセットをリリースする予定です。
ベンチマークは毎年更新される予定であり、次のバージョンは2026年初頭にリリースされる予定です。更新には、インタラクティブでユーザー適応型のストーリーテリングなどの新しいプロンプトカテゴリが組み込まれ、最大動画持続時間が60秒に拡張されます。
分野への影響
E-VBenchは、いくつかのAI研究グループの開発優先事項に影響を与えました。OpenAIやGoogle DeepMindなどの企業は、技術レポートでベンチマークを引用し、その指標を使用して時間的モデリングの改善を導いています。Berkeley AI ResearchやStanford AI Labなどの学術ラボは、動画生成プロジェクトでE-VBenchを標準的な評価ツールとして採用しています。
ベンチマークはまた、モデルが長いシーケンスにわたって情報を保持する必要があるため、メモリ拡張ニューラルネットワークへの新しい研究を促進しました。クロスアテンションメカニズムやトランスフォーマーベースの時間的エンコーダなどの技術は、ETCSスコアの改善に有望を示しています。2025年後半の時点で、E-VBenchで報告された最高のETCSは0.85であり、ハイブリッド畳み込みおよびアテンションアーキテクチャを使用するモデルによって達成されました。