E-VBench는 확장된 길이의 출력을 평가하도록 특별히 설계된, 비디오 콘텐츠를 생성하는 인공지능 시스템을 평가하기 위한 벤치마크입니다. 2025년에 도입되었으며, 일반적으로 5초 미만의 짧은 클립에 초점을 맞춘 초기 평가 프레임워크의 한계를 해결합니다. E-VBench는 모델이 여러 장면과 복잡한 내러티브 전환을 포함하는 10~30초 길이의 비디오를 생성하도록 요구합니다.
이 벤치마크는 학계 및 산업계 연구자들의 컨소시엄에 의해 개발되었으며, 초기 결과는 2025년 초에 발표되었습니다. 이는 2023년에 출시된 널리 사용되는 비디오 생성 벤치마크인 VBench의 기반 위에 구축되었지만, 장기적인 시간적 일관성과 스토리 수준의 일관성을 포함하도록 평가 기준을 확장합니다. E-VBench는 각각 장면 설명, 캐릭터 동작 및 대화 큐가 포함된 상세한 스크립트를 포함하는 1,500개의 프롬프트 세트로 구성됩니다. 프롬프트는 시네마틱 스토리텔링, 교육 콘텐츠 및 역동적인 스포츠 시퀀스를 포함한 12개 범주에 걸쳐 있습니다.
평가 지표
E-VBench는 자동화된 지표와 인간 평가를 결합한 다차원 점수 시스템을 사용합니다. 주요 자동화 지표는 10초 이상의 간격에 걸친 프레임 간 일관성을 측정하는 확장된 시간적 일관성 점수(ETCS)입니다. ETCS는 사전 훈련된 비전 트랜스포머를 사용하여 객체 지속성과 모션 연속성을 추적하여 계산됩니다. 보조 지표인 내러티브 정렬 지수(NAI)는 생성된 장면이 프롬프트 스크립트에 지정된 논리적 진행을 따르는지 여부를 평가합니다. NAI는 대규모 언어 모델을 사용하여 생성된 자막을 예상 스토리 비트와 비교합니다.
인간 평가자는 시각적 품질, 의미론적 준수, 시간적 매끄러움 및 창의적 타당성의 네 가지 기준에 대해 1-5점 척도로 출력을 평가합니다. Cohen's kappa로 측정된 평가자 간 일치도는 평균 0.78입니다. 최종 벤치마크 점수는 가중 복합 점수로, ETCS 40%, NAI 30%, 인간 평가 30%로 구성됩니다.
모델 성능 결과
2025년 3월에 발표된 초기 E-VBench 결과는 주요 생성 AI 시스템 간에 상당한 차이를 보여주었습니다. 내부 평가에서 보고된 OpenAI의 비디오 생성 모델은 ETCS 0.82와 NAI 0.74를 달성하여 전체 1위를 차지했습니다. Google DeepMind의 경쟁 시스템은 ETCS 0.79와 NAI 0.71을 기록했습니다. 아직 베타 버전인 Anthropic의 모델은 각각 0.65와 0.58로 더 낮은 점수를 기록하여 확장된 내러티브 일관성에 어려움이 있음을 나타냈습니다.
Stable Video Diffusion 아키텍처를 기반으로 구축된 모델과 같은 오픈소스 모델은 상용 시스템보다 뒤처졌습니다. 최고의 오픈소스 참가작은 ETCS 0.61과 NAI 0.52를 달성했습니다. 이러한 결과는 특히 다중 장면 전환 처리 및 더 긴 지속 시간 동안 캐릭터 정체성 유지에 있어 독점 모델과 오픈 모델 간의 격차를 강조합니다.
이전 벤치마크와의 비교
E-VBench는 VBench 및 보다 최근의 VideoGenBench와 같은 이전 벤치마크와 몇 가지 주요 측면에서 다릅니다. 2023년에 출시된 VBench는 2~4초 클립에 초점을 맞추고 모션 품질과 이미징 품질을 포함한 16개 차원을 평가했습니다. 2024년 말에 도입된 VideoGenBench는 8초 클립으로 확장되었지만 내러티브 구조를 요구하지 않았습니다. E-VBench의 10~30초 지속 시간은 모델이 장면 전환, 조명 변화 및 시간적 점프 전반에 걸쳐 일관성을 유지하도록 강제합니다.
또 다른 차이점은 대화 및 시청각 동기화의 포함입니다. E-VBench 프롬프트에는 음성 대사가 포함되며, 생성된 비디오는 별도의 시청각 일관성 지표를 사용하여 립싱크 정확도에 대해 평가됩니다. 이 기능은 시각적 출력만 평가했던 이전 벤치마크에는 없었습니다.
한계 및 향후 방향
비평가들은 E-VBench가 인간 평가에 의존하기 때문에 대규모로 실행하는 데 비용이 많이 든다고 지적합니다. 각 프롬프트 세트는 약 15분의 인간 검토가 필요하며, 전체 벤치마크는 375시간 이상의 주석 작업 시간이 소요됩니다. 인간 평가에 대한 자동화된 대리 지표를 개발하기 위한 노력이 진행 중이며, RLHF 모델을 판정자로 사용합니다.
또 다른 한계는 벤치마크가 영어 프롬프트에 초점을 맞추고 있어 주로 영어 데이터로 훈련된 모델에 편향된 결과를 초래할 수 있다는 점입니다. 향후 버전은 만다린, 스페인어 및 힌디어를 포함한 최소 10개 언어의 다국어 프롬프트를 포함할 계획입니다. E-VBench 팀은 또한 연구자들이 계산 비용을 줄여 모델을 테스트할 수 있도록 빠른 반복을 위한 200개의 프롬프트 세트 하위 집합을 출시할 예정입니다.
이 벤치마크는 매년 업데이트될 예정이며, 다음 버전은 2026년 초에 출시될 예정입니다. 업데이트에는 대화형 및 사용자 적응형 스토리텔링과 같은 새로운 프롬프트 범주가 포함되고 최대 비디오 지속 시간이 60초로 확장됩니다.
분야에 미치는 영향
E-VBench는 여러 AI 연구 그룹의 개발 우선순위에 영향을 미쳤습니다. OpenAI 및 Google DeepMind와 같은 회사는 기술 보고서에서 이 벤치마크를 인용하고 그 지표를 사용하여 시간적 모델링 개선을 안내했습니다. Berkeley AI Research 및 Stanford AI Lab을 포함한 학계 연구소는 비디오 생성 프로젝트에서 E-VBench를 표준 평가 도구로 채택했습니다.
이 벤치마크는 또한 모델이 더 긴 시퀀스에 걸쳐 정보를 유지해야 하므로 메모리 증강 신경망에 대한 새로운 연구를 촉발했습니다. 교차 주의 메커니즘 및 트랜스포머 기반 시간적 인코더와 같은 기술은 ETCS 점수를 개선하는 데 유망한 것으로 나타났습니다. 2025년 말 현재 E-VBench에서 보고된 가장 높은 ETCS는 하이브리드 컨볼루션 및 어텐션 아키텍처를 사용하는 모델이 달성한 0.85입니다.