E-VBench एक बेंचमार्क है जो वीडियो सामग्री उत्पन्न करने वाली कृत्रिम बुद्धिमत्ता प्रणालियों का मूल्यांकन करने के लिए डिज़ाइन किया गया है, विशेष रूप से विस्तारित अवधि के आउटपुट का आकलन करने के लिए। 2025 में पेश किया गया, यह पहले के मूल्यांकन ढांचों की सीमाओं को संबोधित करता है जो आमतौर पर पांच सेकंड से कम की छोटी क्लिप पर केंद्रित थे। E-VBench को मॉडलों से 10 से 30 सेकंड तक चलने वाले वीडियो उत्पन्न करने की आवश्यकता होती है, जिसमें कई दृश्य और जटिल कथात्मक संक्रमण शामिल होते हैं।
यह बेंचमार्क शैक्षणिक और औद्योगिक शोधकर्ताओं के एक संघ द्वारा विकसित किया गया था, जिसके प्रारंभिक परिणाम 2025 की शुरुआत में प्रकाशित हुए थे। यह VBench की नींव पर आधारित है, जो 2023 में जारी एक व्यापक रूप से उपयोग किया जाने वाला वीडियो जनरेशन बेंचमार्क है, लेकिन मूल्यांकन मानदंडों को दीर्घकालिक अस्थायी सुसंगतता और कहानी-स्तर की स्थिरता को शामिल करने के लिए विस्तारित करता है। E-VBench में 1,500 प्रॉम्प्ट सेट शामिल हैं, जिनमें से प्रत्येक में दृश्य विवरण, चरित्र क्रियाओं और संवाद संकेतों के साथ एक विस्तृत स्क्रिप्ट होती है। प्रॉप्ट्स 12 श्रेणियों में फैले हुए हैं, जिनमें सिनेमाई कहानी कहना, निर्देशात्मक सामग्री और गतिशील खेल अनुक्रम शामिल हैं।
मूल्यांकन मेट्रिक्स
E-VBench एक बहुआयामी स्कोरिंग प्रणाली का उपयोग करता है जो स्वचालित मेट्रिक्स को मानव मूल्यांकन के साथ जोड़ती है। प्राथमिक स्वचालित मेट्रिक्स विस्तारित अस्थायी सुसंगतता स्कोर (ETCS) है, जो 10 सेकंड से अधिक के अंतराल पर फ्रेम-दर-फ्रेम सुसंगतता को मापता है। ETCS की गणना एक पूर्व-प्रशिक्षित विज़न ट्रांसफॉर्मर का उपयोग करके की जाती है जो वस्तु दृढ़ता और गति निरंतरता को ट्रैक करता है। एक द्वितीयक मेट्रिक्स, कथात्मक संरेखण सूचकांक (NAI), मूल्यांकन करता है कि उत्पन्न दृश्य प्रॉम्प्ट स्क्रिप्ट में निर्दिष्ट तार्किक प्रगति का पालन करते हैं या नहीं। NAI उत्पन्न उपशीर्षक की तुलना अपेक्षित कहानी बीट्स से करने के लिए एक बड़े भाषा मॉडल का उपयोग करता है।
मानव मूल्यांकनकर्ता चार मानदंडों पर 1-5 पैमाने पर आउटपुट का मूल्यांकन करते हैं: दृश्य गुणवत्ता, शब्दार्थ पालन, अस्थायी चिकनाई और रचनात्मक प्रशंसनीयता। कोहेन के कप्पा से मापी गई अंतर-मूल्यांकनकर्ता सहमति औसत 0.78 है। अंतिम बेंचमार्क स्कोर एक भारित समग्र है: 40% ETCS, 30% NAI, और 30% मानव रेटिंग।
मॉडल प्रदर्शन परिणाम
मार्च 2025 में जारी प्रारंभिक E-VBench परिणामों ने प्रमुख जनरेटिव एआई प्रणालियों के बीच महत्वपूर्ण भिन्नता दिखाई। OpenAI का वीडियो जनरेशन मॉडल, आंतरिक मूल्यांकन में रिपोर्ट किया गया, ETCS 0.82 और NAI 0.74 हासिल किया, जो समग्र रूप से पहले स्थान पर रहा। Google DeepMind की प्रतिस्पर्धी प्रणाली ने ETCS पर 0.79 और NAI पर 0.71 स्कोर किया। Anthropic का एक मॉडल, जो अभी भी बीटा में है, क्रमशः 0.65 और 0.58 के कम स्कोर पोस्ट किया, जो विस्तारित कथात्मक सुसंगतता में चुनौतियों का संकेत देता है।
ओपन-सोर्स मॉडल, जैसे कि स्टेबल वीडियो डिफ्यूजन आर्किटेक्चर पर निर्मित, वाणिज्यिक प्रणालियों से पीछे रहे। सर्वश्रेष्ठ ओपन-सोर्स प्रविष्टि ने ETCS 0.61 और NAI 0.52 हासिल किया। ये परिणाम स्वामित्व और ओपन मॉडल के बीच अंतर को उजागर करते हैं, विशेष रूप से मल्टी-सीन संक्रमणों को संभालने और लंबी अवधि में चरित्र पहचान बनाए रखने में।
पिछले बेंचमार्क के साथ तुलना
E-VBench पहले के बेंचमार्क जैसे VBench और अधिक हाल के VideoGenBench से कई प्रमुख पहलुओं में भिन्न है। VBench, 2023 में जारी, 2-4 सेकंड की क्लिप पर केंद्रित था और 16 आयामों का मूल्यांकन किया, जिसमें गति गुणवत्ता और इमेजिंग गुणवत्ता शामिल थी। VideoGenBench, देर से 2024 में पेश किया गया, 8-सेकंड की क्लिप तक विस्तारित हुआ लेकिन कथात्मक संरचना की आवश्यकता नहीं थी। E-VBench की 10-30 सेकंड की अवधि मॉडलों को दृश्य कट, प्रकाश परिवर्तन और अस्थायी छलांग में स्थिरता बनाए रखने के लिए मजबूर करती है।
एक और अंतर संवाद और ऑडियो-विज़ुअल सिंक्रनाइज़ेशन का समावेश है। E-VBench प्रॉम्प्ट में बोले गए वाक्य शामिल हैं, और उत्पन्न वीडियो का मूल्यांकन एक अलग ऑडियो-विज़ुअल सुसंगतता मेट्रिक्स का उपयोग करके लिप-सिंक सटीकता के लिए किया जाता है। यह सुविधा पिछले बेंचमार्क में अनुपस्थित थी, जो केवल दृश्य आउटपुट का मूल्यांकन करती थी।
सीमाएं और भविष्य की दिशाएं
आलोचक ध्यान देते हैं कि E-VBench की मानव मूल्यांकन पर निर्भरता इसे बड़े पैमाने पर चलाने के लिए महंगी बनाती है। प्रत्येक प्रॉम्प्ट सेट के लिए लगभग 15 मिनट की मानव समीक्षा की आवश्यकता होती है, और पूरे बेंचमार्क में एनोटेटर समय के 375 घंटे से अधिक लगते हैं। मानव रेटिंग के लिए स्वचालित प्रॉक्सी विकसित करने के प्रयास चल रहे हैं, जिसमें न्यायाधीशों के रूप में मानव फीडबैक से सुदृढीकरण सीखने (RLHF) मॉडल का उपयोग किया जा रहा है।
एक और सीमा अंग्रेजी-भाषा प्रॉम्प्ट पर बेंचमार्क का ध्यान केंद्रित करना है, जो मुख्य रूप से अंग्रेजी डेटा पर प्रशिक्षित मॉडलों की ओर परिणामों को पक्षपाती कर सकता है। भविष्य के संस्करणों में मंदारिन, स्पेनिश और हिंदी सहित कम से कम 10 भाषाओं में बहुभाषी प्रॉम्प्ट शामिल करने की योजना है। E-VBench टीम तेजी से पुनरावृत्ति के लिए 200 प्रॉम्प्ट सेट का एक उपसमूह जारी करने का भी इरादा रखती है, जिससे शोधकर्ता कम कम्प्यूटेशनल लागत के साथ मॉडलों का परीक्षण कर सकें।
बेंचमार्क को सालाना अपडेट करने की उम्मीद है, अगला संस्करण शुरुआती 2026 में जारी होने वाला है। अपडेट में इंटरैक्टिव और उपयोगकर्ता-अनुकूल कहानी कहने जैसी नई प्रॉम्प्ट श्रेणियां शामिल होंगी, और अधिकतम वीडियो अवधि को 60 सेकंड तक विस्तारित करेंगे।
क्षेत्र पर प्रभाव
E-VBench ने कई एआई अनुसंधान समूहों की विकास प्राथमिकताओं को प्रभावित किया है। OpenAI और Google DeepMind जैसी कंपनियों ने तकनीकी रिपोर्टों में बेंचमार्क का हवाला दिया है, इसके मेट्रिक्स का उपयोग अस्थायी मॉडलिंग में सुधार को निर्देशित करने के लिए किया है। बर्कले एआई रिसर्च और स्टैनफोर्ड एआई लैब सहित शैक्षणिक प्रयोगशालाओं ने अपने वीडियो जनरेशन परियोजनाओं में E-VBench को एक मानक मूल्यांकन उपकरण के रूप में अपनाया है।
बेंचमार्क ने मेमोरी-संवर्धित तंत्रिका नेटवर्क में नए शोध को भी प्रेरित किया, क्योंकि मॉडलों को लंबे अनुक्रमों में जानकारी बनाए रखनी होती है। क्रॉस-अटेंशन तंत्र और ट्रांसफॉर्मर-आधारित अस्थायी एनकोडर जैसी तकनीकों ने ETCS स्कोर में सुधार करने में वादा दिखाया है। 2025 के अंत तक, E-VBench पर उच्चतम रिपोर्ट किया गया ETCS 0.85 है, जो एक हाइब्रिड कन्वोल्यूशनल और अटेंशन आर्किटेक्चर का उपयोग करने वाले मॉडल द्वारा प्राप्त किया गया है।