VBench एक बेंचमार्क है जिसे टेक्स्ट-टू-वीडियो (T2V) जनरेशन मॉडल की गुणवत्ता का मूल्यांकन करने के लिए डिज़ाइन किया गया है। 2023 में सिंघुआ विश्वविद्यालय और अन्य संस्थानों के शोधकर्ताओं द्वारा पेश किया गया, यह कई आयामों में उत्पन्न वीडियो का आकलन करने के लिए एक व्यापक ढांचा प्रदान करता है। जैसे-जैसे टेक्स्ट-टू-वीडियो मॉडल, जैसे कि डीप लर्निंग और ट्रांसफॉर्मर आर्किटेक्चर पर आधारित, प्रचुर मात्रा में उपलब्ध हुए हैं, VBench मानकीकृत मूल्यांकन विधियों की आवश्यकता को संबोधित करता है जो दृश्य गुणवत्ता और टेक्स्ट प्रॉम्प्ट के पालन दोनों को कवर करते हैं।
बेंचमार्क 16 अलग-अलग आयामों को परिभाषित करता है, जिनमें से प्रत्येक वीडियो जनरेशन के एक विशिष्ट पहलू को लक्षित करता है। इनमें दृश्य गुणवत्ता मेट्रिक्स (जैसे, विषय निष्ठा, पृष्ठभूमि स्थिरता), गति गुणवत्ता मेट्रिक्स (जैसे, गतिशीलता की डिग्री, गति की सहजता), और अस्थायी स्थिरता उपाय (जैसे, झिलमिलाहट, अस्थायी शैली) शामिल हैं। इसमें यह मूल्यांकन करने के लिए आयाम भी शामिल हैं कि उत्पन्न वीडियो अपने टेक्स्ट प्रॉम्प्ट की शब्दार्थ सामग्री से कितनी अच्छी तरह मेल खाता है, जैसे कि वस्तु वर्गीकरण और एकाधिक वस्तुएं। VBench आउटपुट को स्वचालित रूप से स्कोर करने के लिए, अक्सर बड़े भाषा मॉडल और विज़न एनकोडर पर आधारित, मल्टीमॉडल विधियों का एक सेट नियोजित करता है, जिससे मैन्युअल मूल्यांकन का समय और लागत कम हो जाती है।
VBench के प्रमुख योगदानों में से एक इसकी पदानुक्रमित वर्गीकरण प्रणाली है, जो आयामों को चार मुख्य पहलुओं में व्यवस्थित करती है: दृश्य गुणवत्ता, गति गुणवत्ता, अस्थायी स्थिरता, और टेक्स्ट विवरण के साथ स्थिरता। प्रत्येक पहलू में कई सूक्ष्म-स्तरीय मेट्रिक्स शामिल हैं। VBench में 100 से अधिक अद्वितीय प्रॉम्प्ट शामिल हैं, जिनमें से प्रत्येक विशिष्ट क्षमताओं का परीक्षण करने के लिए डिज़ाइन किया गया है, जिससे टेक्स्ट-टू-वीडियो मॉडल का व्यवस्थित बेंचमार्किंग संभव होता है।
स्वचालित मूल्यांकन पाइपलाइन
VBench मानव पूर्वाग्रहों से बचने और प्रतिलिपि प्रस्तुत करने की क्षमता में सुधार करने के लिए मूल्यांकन पाइपलाइन को स्वचालित करता है। प्रत्येक आयाम के लिए, यह विषय निष्ठा के लिए Orcus1-image या CLIP-आधारित मॉडल A/B परीक्षण जोड़े का उपयोग करता है, जबकि गति गतिशीलता को एक पूर्व-प्रशिक्षित वीडियो बैकबोन से फ्रेम-वार फीचर अंतर का उपयोग करके मापा जाता है। पाइपलाइन प्रत्येक आयाम के लिए 0 से 100 तक का स्कोर आउटपुट करती है, और एक समग्र समायोजित स्कोर जो उपयोगकर्ता अध्ययनों से प्राप्त भार के साथ सभी आयामों का औसत निकालता है।
बेंचमार्क विशेष रूप से एक एकल समग्र स्कोर के विपरीत, बहु-आयामी अपघटन के उपयोग के लिए उल्लेखनीय है, जो मॉडल की विशिष्ट शक्तियों और कमजोरियों की पहचान करने में मदद करता है। उदाहरण के लिए, यह उन मॉडलों के बीच अंतर कर सकता है जो उच्च-गुणवत्ता वाली स्थिर वस्तुएं उत्पन्न करते हैं लेकिन सुसंगत गति में विफल होते हैं, बनाम उन मॉडलों के बीच जो अस्थायी सामंजस्य बनाए रखते हैं लेकिन खराब दृश्य स्पष्टता के साथ।
अनुसंधान और उद्योग में उपयोग
अपने प्रकाशन के बाद से, VBench को शैक्षणिक समूहों और उद्योग प्रयोगशालाओं द्वारा एक मानक मूल्यांकन उपकरण के रूप में अपनाया गया है। इसका उपयोग Sora और ओपनएआई और गूगल डीपमाइंड जैसी कंपनियों द्वारा प्रस्तुत अन्य प्रमुख टेक्स्ट-टू-वीडियो सिस्टम जैसे मॉडलों की तुलना करने में किया गया है। बेंचमार्क अनुसंधान दिशाओं का समर्थन करता है, मॉडल आर्किटेक्चर, डेटा क्यूरेशन और प्रशिक्षण रणनीतियों में सुधार का मार्गदर्शन करता है।
सीमाएं और विकास
VBench, किसी भी बेंचमार्क की तरह जो स्वचालित विधियों पर निर्भर करता है, की सीमाएं हैं। कुछ आयाम स्वाभाविक रूप से व्यक्तिपरक हैं, और पाइपलाइन की पूर्व-प्रशिक्षित मॉडल पर निर्भरता का मतलब है कि यह मॉडल पूर्वाग्रहों के प्रति संवेदनशील है। इन्हें संबोधित करने के लिए, अनुरक्षकों ने VBench-1.0 और भविष्य के संस्करण जारी किए हैं जो मानव प्रतिक्रिया लूप को एकीकृत करते हैं और छवि-से-वीडियो और वीडियो संपादन कार्यों के मूल्यांकन तक विस्तार करते हैं। बेंचमार्क समुदाय के इनपुट के साथ विकसित होता रहता है।