抱歉,您只提供了“VBench”这个标题,但没有提供需要翻译的英文正文内容。请提供完整的文章内容,我将按照您的要求翻译成印地语。

अंग्रेज़ी से अनुवादित

VBench एक बेंचमार्क है जो टेक्स्ट-टू-वीडियो जनरेशन मॉडल का मूल्यांकन करने के लिए उपयोग किया जाता है, जो दृश्य गुणवत्ता, अस्थायी स्थिरता और अर्थगत निष्ठा को मापने के लिए 16 आयामों का एक सेट प्रदान करता है। इसका उपयोग व्यापक रूप से जनरेटिव AI सिस्टम की तुलना करने के लिए किया जाता है।

VBench एक बेंचमार्क है जिसे टेक्स्ट-टू-वीडियो (T2V) जनरेशन मॉडल की गुणवत्ता का मूल्यांकन करने के लिए डिज़ाइन किया गया है। 2023 में सिंघुआ विश्वविद्यालय और अन्य संस्थानों के शोधकर्ताओं द्वारा पेश किया गया, यह कई आयामों में उत्पन्न वीडियो का आकलन करने के लिए एक व्यापक ढांचा प्रदान करता है। जैसे-जैसे टेक्स्ट-टू-वीडियो मॉडल, जैसे कि डीप लर्निंग और ट्रांसफॉर्मर आर्किटेक्चर पर आधारित, प्रचुर मात्रा में उपलब्ध हुए हैं, VBench मानकीकृत मूल्यांकन विधियों की आवश्यकता को संबोधित करता है जो दृश्य गुणवत्ता और टेक्स्ट प्रॉम्प्ट के पालन दोनों को कवर करते हैं।

बेंचमार्क 16 अलग-अलग आयामों को परिभाषित करता है, जिनमें से प्रत्येक वीडियो जनरेशन के एक विशिष्ट पहलू को लक्षित करता है। इनमें दृश्य गुणवत्ता मेट्रिक्स (जैसे, विषय निष्ठा, पृष्ठभूमि स्थिरता), गति गुणवत्ता मेट्रिक्स (जैसे, गतिशीलता की डिग्री, गति की सहजता), और अस्थायी स्थिरता उपाय (जैसे, झिलमिलाहट, अस्थायी शैली) शामिल हैं। इसमें यह मूल्यांकन करने के लिए आयाम भी शामिल हैं कि उत्पन्न वीडियो अपने टेक्स्ट प्रॉम्प्ट की शब्दार्थ सामग्री से कितनी अच्छी तरह मेल खाता है, जैसे कि वस्तु वर्गीकरण और एकाधिक वस्तुएं। VBench आउटपुट को स्वचालित रूप से स्कोर करने के लिए, अक्सर बड़े भाषा मॉडल और विज़न एनकोडर पर आधारित, मल्टीमॉडल विधियों का एक सेट नियोजित करता है, जिससे मैन्युअल मूल्यांकन का समय और लागत कम हो जाती है।

VBench के प्रमुख योगदानों में से एक इसकी पदानुक्रमित वर्गीकरण प्रणाली है, जो आयामों को चार मुख्य पहलुओं में व्यवस्थित करती है: दृश्य गुणवत्ता, गति गुणवत्ता, अस्थायी स्थिरता, और टेक्स्ट विवरण के साथ स्थिरता। प्रत्येक पहलू में कई सूक्ष्म-स्तरीय मेट्रिक्स शामिल हैं। VBench में 100 से अधिक अद्वितीय प्रॉम्प्ट शामिल हैं, जिनमें से प्रत्येक विशिष्ट क्षमताओं का परीक्षण करने के लिए डिज़ाइन किया गया है, जिससे टेक्स्ट-टू-वीडियो मॉडल का व्यवस्थित बेंचमार्किंग संभव होता है।

स्वचालित मूल्यांकन पाइपलाइन

VBench मानव पूर्वाग्रहों से बचने और प्रतिलिपि प्रस्तुत करने की क्षमता में सुधार करने के लिए मूल्यांकन पाइपलाइन को स्वचालित करता है। प्रत्येक आयाम के लिए, यह विषय निष्ठा के लिए Orcus1-image या CLIP-आधारित मॉडल A/B परीक्षण जोड़े का उपयोग करता है, जबकि गति गतिशीलता को एक पूर्व-प्रशिक्षित वीडियो बैकबोन से फ्रेम-वार फीचर अंतर का उपयोग करके मापा जाता है। पाइपलाइन प्रत्येक आयाम के लिए 0 से 100 तक का स्कोर आउटपुट करती है, और एक समग्र समायोजित स्कोर जो उपयोगकर्ता अध्ययनों से प्राप्त भार के साथ सभी आयामों का औसत निकालता है।

बेंचमार्क विशेष रूप से एक एकल समग्र स्कोर के विपरीत, बहु-आयामी अपघटन के उपयोग के लिए उल्लेखनीय है, जो मॉडल की विशिष्ट शक्तियों और कमजोरियों की पहचान करने में मदद करता है। उदाहरण के लिए, यह उन मॉडलों के बीच अंतर कर सकता है जो उच्च-गुणवत्ता वाली स्थिर वस्तुएं उत्पन्न करते हैं लेकिन सुसंगत गति में विफल होते हैं, बनाम उन मॉडलों के बीच जो अस्थायी सामंजस्य बनाए रखते हैं लेकिन खराब दृश्य स्पष्टता के साथ।

अनुसंधान और उद्योग में उपयोग

अपने प्रकाशन के बाद से, VBench को शैक्षणिक समूहों और उद्योग प्रयोगशालाओं द्वारा एक मानक मूल्यांकन उपकरण के रूप में अपनाया गया है। इसका उपयोग Sora और ओपनएआई और गूगल डीपमाइंड जैसी कंपनियों द्वारा प्रस्तुत अन्य प्रमुख टेक्स्ट-टू-वीडियो सिस्टम जैसे मॉडलों की तुलना करने में किया गया है। बेंचमार्क अनुसंधान दिशाओं का समर्थन करता है, मॉडल आर्किटेक्चर, डेटा क्यूरेशन और प्रशिक्षण रणनीतियों में सुधार का मार्गदर्शन करता है।

सीमाएं और विकास

VBench, किसी भी बेंचमार्क की तरह जो स्वचालित विधियों पर निर्भर करता है, की सीमाएं हैं। कुछ आयाम स्वाभाविक रूप से व्यक्तिपरक हैं, और पाइपलाइन की पूर्व-प्रशिक्षित मॉडल पर निर्भरता का मतलब है कि यह मॉडल पूर्वाग्रहों के प्रति संवेदनशील है। इन्हें संबोधित करने के लिए, अनुरक्षकों ने VBench-1.0 और भविष्य के संस्करण जारी किए हैं जो मानव प्रतिक्रिया लूप को एकीकृत करते हैं और छवि-से-वीडियो और वीडियो संपादन कार्यों के मूल्यांकन तक विस्तार करते हैं। बेंचमार्क समुदाय के इनपुट के साथ विकसित होता रहता है।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:benchmark·text-to-video·evaluation·generative-ai
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास