E-VBench是一个用于评估生成视频内容的人工智能系统的基准测试,专门设计用于评估长时长的输出。它于2025年推出,解决了早期评估框架仅关注短片段(通常不足五秒)的局限性。E-VBench要求模型生成时长10至30秒的视频,涵盖多个场景和复杂的叙事转换。
该基准测试由学术和工业研究人员组成的联盟开发,初步结果于2025年初发布。它建立在VBench的基础上,VBench是2023年发布的广泛使用的视频生成基准测试,但E-VBench将评估标准扩展至包括长期时间连贯性和故事级一致性。E-VBench包含1,500组提示词,每组包含详细的脚本,包括场景描述、角色动作和对话提示。这些提示词涵盖12个类别,包括电影叙事、教学内容和动态体育序列。
评估指标
E-VBench采用多维评分系统,结合自动化指标与人工评估。主要的自动化指标是扩展时间一致性得分(ETCS),用于测量超过10秒间隔的帧间连贯性。ETCS使用预训练的视觉变换器计算,跟踪对象持久性和运动连续性。次要指标是叙事对齐指数(NAI),评估生成场景是否遵循提示脚本中指定的逻辑进展。NAI使用大型语言模型将生成的字幕与预期的故事节拍进行比较。
人工评估员按1-5分制对输出进行评分,涵盖四个标准:视觉质量、语义遵循度、时间流畅性和创意合理性。评估员间一致性(通过Cohen's kappa测量)平均为0.78。最终基准测试得分是加权综合:40%的ETCS、30%的NAI和30%的人工评分。
模型性能结果
E-VBench的初步结果于2025年3月发布,显示领先的生成式AI系统之间存在显著差异。OpenAI的视频生成模型在内部评估中报告,ETCS得分为0.82,NAI得分为0.74,总体排名第一。Google DeepMind的竞争系统在ETCS上得分为0.79,在NAI上得分为0.71。Anthropic的一个仍处于测试阶段的模型得分较低,分别为0.65和0.58,表明在扩展叙事连贯性方面存在挑战。
开源模型,如基于Stable Video Diffusion架构的模型,落后于商业系统。最佳开源参赛作品在ETCS上得分为0.61,在NAI上得分为0.52。这些结果突显了专有模型与开源模型之间的差距,特别是在处理多场景转换和保持角色身份在较长时间内的一致性方面。
与先前基准测试的比较
E-VBench在几个关键方面与早期基准测试(如VBench和更近期的VideoGenBench)有所不同。VBench于2023年发布,专注于2-4秒的片段,并评估16个维度,包括运动质量和成像质量。VideoGenBench于2024年底推出,将片段扩展至8秒,但不要求叙事结构。E-VBench的10-30秒时长迫使模型在场景切换、光照变化和时间跳跃中保持一致性。
另一个区别是包含对话和音视频同步。E-VBench提示词包括口语台词,生成的视频使用单独的视听一致性指标评估唇形同步准确性。此功能在先前基准测试中不存在,这些基准测试仅评估视觉输出。
局限性与未来方向
批评者指出,E-VBench依赖人工评估使其在大规模运行时成本高昂。每组提示词需要约15分钟的人工审查,完整基准测试需要超过375小时的标注时间。目前正在努力开发人工评分的自动化代理,使用基于人类反馈的强化学习(RLHF)模型作为评判者。
另一个局限性是该基准测试专注于英语提示词,这可能使结果偏向于主要在英语数据上训练的模型。未来版本计划包括至少10种语言的多语言提示词,包括普通话、西班牙语和印地语。E-VBench团队还打算发布200组提示词的子集用于快速迭代,使研究人员能够以降低的计算成本测试模型。
该基准测试预计每年更新一次,下一版本计划于2026年初发布。更新将纳入新的提示词类别,如交互式和用户自适应叙事,并将最大视频时长扩展至60秒。
对领域的影响
E-VBench影响了多个AI研究小组的发展优先级。像OpenAI和Google DeepMind这样的公司在技术报告中引用了该基准测试,使用其指标指导时间建模的改进。学术实验室,包括Berkeley AI Research和Stanford AI Lab,已将E-VBench作为其视频生成项目的标准评估工具。
该基准测试还促进了记忆增强神经网络的新研究,因为模型必须在更长的序列中保留信息。诸如交叉注意力机制和基于变换器的时间编码器等技术在提高ETCS得分方面显示出前景。截至2025年底,E-VBench上报告的最高ETCS为0.85,由使用混合卷积和注意力架构的模型实现。