अंग्रेज़ी से अनुवादित

VQGAN+CLIP एक जनरेटिव AI विधि है जो वेक्टर क्वांटाइज़्ड जनरेटिव एडवर्सेरियल नेटवर्क को CLIP के साथ जोड़ती है, जिससे समर्पित प्रशिक्षण के बिना टेक्स्ट-टू-इमेज संश्लेषण संभव होता है। यह 2021 में कलात्मक छवि निर्माण के लिए लोकप्रिय था।

VQGAN+CLIP एक तकनीक है जो Generative AI में एक वेक्टर क्वांटाइज़्ड जनरेटिव एडवरसैरियल नेटवर्क (VQGAN) को CLIP मॉडल के साथ जोड़कर पाठ्य विवरणों से छवियाँ उत्पन्न करती है। यह 2021 की शुरुआत में शून्य-शॉट टेक्स्ट-टू-इमेज जनरेशन के एक उल्लेखनीय उदाहरण के रूप में उभरा, जो नए मॉडल को शुरू से प्रशिक्षित करने के बजाय पूर्व-प्रशिक्षित घटकों का लाभ उठाता है। यह विधि कलाकारों और शोधकर्ताओं के बीच शैलीबद्ध और अक्सर अतियथार्थवादी कल्पना उत्पन्न करने की क्षमता के लिए लोकप्रिय हुई, जो बाद के बड़े पैमाने के प्रसार मॉडल से पहले आई थी।

यह दृष्टिकोण कैथरीन क्रोसन और ओपन-सोर्स समुदाय के अन्य लोगों द्वारा पेश किया गया था, जो पैट्रिक एसर, रॉबिन रॉम्बैक और ब्योर्न ओमर द्वारा हीडलबर्ग विश्वविद्यालय में विकसित VQGAN मॉडल और जनवरी 2021 में OpenAI द्वारा जारी CLIP मॉडल पर आधारित था। VQGAN+CLIP एक VQGAN के अव्यक्त स्थान में एक छवि को पुनरावृत्त रूप से अनुकूलित करके काम करता है ताकि छवि और दिए गए पाठ संकेत के बीच समानता को अधिकतम किया जा सके, जैसा कि CLIP के कंट्रास्टिव एम्बेडिंग द्वारा मापा जाता है। यह अनुकूलन ग्रेडिएंट डिसेंट का उपयोग करके किया जाता है, आमतौर पर Adam (Optimizer) या समान प्रकार के साथ, और अक्सर आउटपुट गुणवत्ता में सुधार के लिए Data Augmentation जैसी तकनीकों को शामिल करता है।

तंत्र

मुख्य तंत्र में दो पूर्व-प्रशिक्षित Neural network घटक शामिल हैं। VQGAN एक जनरेटिव मॉडल है जो दृश्य टोकन की एक असतत कोडबुक सीखता है, जिससे यह छवियों को संपीड़ित और पुनर्निर्माण कर सकता है। CLIP, एक Transformer (architecture)-आधारित मॉडल, छवियों और पाठ दोनों को एक साझा एम्बेडिंग स्थान में एन्कोड करता है, जहाँ अर्थपूर्ण रूप से समान जोड़े निकट होते हैं। एक छवि उत्पन्न करने के लिए, सिस्टम एक यादृच्छिक अव्यक्त कोड प्रारंभ करता है, फिर VQGAN के माध्यम से इसे बार-बार डिकोड करके एक छवि उत्पन्न करता है, उस छवि और संकेत के बीच CLIP समानता की गणना करता है, और अव्यक्त कोड को अद्यतन करने के लिए ग्रेडिएंट को पिछड़े प्रसारित करता है। यह प्रक्रिया, जिसे अक्सर 'CLIP-निर्देशित संश्लेषण' कहा जाता है, सैकड़ों या हजारों पुनरावृत्तियों के लिए दोहराई जाती है।

एक प्रमुख संस्करण एक विशिष्ट डेटासेट, जैसे ImageNet, पर प्रशिक्षित VQGAN का उपयोग करता है, जो आउटपुट की शैली और सामग्री को प्रभावित करता है। अनुकूलन आमतौर पर पिक्सेल स्थान के बजाय अव्यक्त स्थान में किया जाता है, जो कम्प्यूटेशनल रूप से कुशल है और चिकनी ग्रेडिएंट की अनुमति देता है। कई कार्यान्वयन 'CLIP लॉस' नामक तकनीक का भी उपयोग करते हैं जो कोसाइन समानता को अतिरिक्त नियमितीकरण शर्तों, जैसे कुल भिन्नता हानि, के साथ जोड़ता है ताकि सुसंगत छवियों को प्रोत्साहित किया जा सके।

ऐतिहासिक संदर्भ

VQGAN+CLIP 2021 के वसंत में प्रमुखता से उभरा, CLIP की रिलीज़ और VQGAN पर पहले के काम के बाद। यह पहली विधियों में से एक थी जिसने प्रदर्शित किया कि उच्च-गुणवत्ता वाली टेक्स्ट-टू-इमेज जनरेशन एक समर्पित सशर्त मॉडल को प्रशिक्षित किए बिना प्राप्त की जा सकती है, इसके बजाय मौजूदा घटकों का पुन: उपयोग किया जा सकता है। यह AttnGAN या StackGAN जैसे पहले के दृष्टिकोणों के विपरीत था, जिन्हें बड़े युग्मित डेटासेट और व्यापक प्रशिक्षण की आवश्यकता होती थी। विधि की पहुँच, क्योंकि यह एक एकल उपभोक्ता GPU पर चल सकती थी, ने ट्विटर और रेडिट जैसे ऑनलाइन समुदायों में इसके तेजी से अपनाने में योगदान दिया, जहाँ उपयोगकर्ताओं ने उत्पन्न कलाकृतियों को साझा किया।

इस तकनीक ने बाद के शोध को भी प्रभावित किया। यह DALL-E 2 और स्टेबल डिफ्यूज़न जैसे बाद के मॉडलों का अग्रदूत था, जिन्होंने मार्गदर्शन के लिए CLIP का उपयोग करने के समान विचारों को अपनाया लेकिन VQGAN को प्रसार मॉडल से बदल दिया। VQGAN+CLIP की पुनरावृत्त अनुकूलन पर निर्भरता ने इसे फीड-फॉरवर्ड जनरेटर की तुलना में धीमा बना दिया, लेकिन इसने प्रॉम्प्ट इंजीनियरिंग और पैरामीटर समायोजन के माध्यम से सूक्ष्म-नियंत्रण की पेशकश की।

अनुप्रयोग और सीमाएँ

प्राथमिक अनुप्रयोगों में कलात्मक निर्माण, अवधारणा कला और मीम निर्माण शामिल थे। कलाकारों ने पाठ संकेतों से दृश्य विचारों का पता लगाने के लिए इसका उपयोग किया, अक्सर कई संकेतों को जोड़कर या कुछ पहलुओं पर जोर देने के लिए 'प्रॉम्प्ट वेटिंग' का उपयोग किया। इसका उपयोग इंटरैक्टिव इंस्टॉलेशन और रचनात्मक कोडिंग के लिए एक उपकरण के रूप में भी किया गया था। हालाँकि, विधि में उल्लेखनीय सीमाएँ थीं: आउटपुट अक्सर कम-रिज़ॉल्यूशन (आमतौर पर 256x256 पिक्सेल) होते थे, कलाकृतियों से ग्रस्त होते थे, और रनों के बीच असंगत हो सकते थे। अनुकूलन प्रक्रिया स्थानीय न्यूनतम में फंस सकती थी, जिससे दोहराव या अर्थहीन छवियाँ उत्पन्न होती थीं। इसके अतिरिक्त, सीखने की दर, पुनरावृत्तियों की संख्या और संवर्धन शक्ति जैसे हाइपरपैरामीटर के सावधानीपूर्वक ट्यूनिंग की आवश्यकता थी।

बाद के Diffusion model-आधारित प्रणालियों की तुलना में, VQGAN+CLIP में बारीक विवरण के साथ फोटोरियलिस्टिक छवियाँ उत्पन्न करने की क्षमता का अभाव था। इसकी ताकत अमूर्त, चित्रात्मक या स्वप्निल परिणाम उत्पन्न करने में थी, जो कई उपयोगकर्ताओं को सौंदर्य की दृष्टि से आकर्षक लगे। विधि में प्रति छवि अपेक्षाकृत उच्च कम्प्यूटेशनल लागत भी थी, क्योंकि प्रत्येक पीढ़ी के लिए एक पूर्ण अनुकूलन लूप की आवश्यकता होती थी।

विरासत

VQGAN+CLIP को 2021-2022 के दौरान Generative AI के तेजी से विकास में एक मील का पत्थर माना जाता है। इसने नए कार्यों के लिए बड़े पूर्व-प्रशिक्षित मॉडलों के संयोजन की शक्ति का प्रदर्शन किया, एक प्रतिमान जो Machine learning अनुसंधान में केंद्रीय बन गया। 2022 तक प्रसार मॉडल द्वारा काफी हद तक प्रतिस्थापित होने के बावजूद, यह ऐतिहासिक रूप से महत्वपूर्ण बना हुआ है और इसकी अद्वितीय सौंदर्यशास्त्र के लिए अभी भी विशिष्ट अनुप्रयोगों में उपयोग किया जाता है। कैथरीन क्रोसन और रयान मर्डॉक जैसे ओपन-सोर्स कार्यान्वयन संग्रहीत हैं और शैक्षणिक साहित्य में संदर्भित होते रहते हैं।

इस तकनीक ने OpenAI के CLIP के मूल वर्गीकरण उद्देश्य से परे एक बहुमुखी उपकरण के रूप में महत्व को भी उजागर किया, जिसने छवि संपादन और पुनर्प्राप्ति में बाद के काम को प्रभावित किया। इसने शून्य-शॉट लर्निंग और फाउंडेशन मॉडल के पुन: उपयोग के व्यापक चलन में योगदान दिया, जो बाद में Artificial intelligence अनुसंधान में एक प्रमुख विषय बन गया।

तकनीकी विवरण

एक विशिष्ट VQGAN+CLIP कार्यान्वयन 16384 के कोडबुक आकार और 256 के अव्यक्त आयाम के साथ एक VQGAN का उपयोग करता है, जो ImageNet पर 256x256 रिज़ॉल्यूशन पर प्रशिक्षित होता है। उपयोग किया जाने वाला CLIP मॉडल आमतौर पर ViT-B/32 या ViT-B/16 होता है, जो छवियों को 512-आयामी एम्बेडिंग में एन्कोड करता है। अनुकूलन लूप 50 से 500 पुनरावृत्तियों के लिए चलता है, जिसमें अव्यक्त स्थान में लगभग 0.1 की सीखने की दर होती है। CLIP लॉस की गणना करने से पहले डिकोड की गई छवि पर यादृच्छिक क्रॉप और फ्लिप जैसे डेटा संवर्धन लागू किए जाते हैं ताकि विशिष्ट पिक्सेल पैटर्न के लिए अति-फिटिंग कम हो सके। कुछ कार्यान्वयन 'कटआउट' तकनीक का उपयोग करते हैं जहाँ कई यादृच्छिक क्रॉप का मूल्यांकन और औसत किया जाता है। अंतिम छवि अनुकूलित अव्यक्त कोड से डिकोड की जाती है और इसे अलग तरीकों का उपयोग करके अपस्केल किया जा सकता है।

कई सॉफ्टवेयर पैकेज, जिनमें लोकप्रिय 'CLIP गाइडेड डिफ्यूज़न' और 'VQGAN-CLIP' नोटबुक शामिल हैं, ने विधि का उपयोग करना आसान बना दिया। इनमें अक्सर प्रॉम्प्ट शेड्यूलिंग जैसी सुविधाएँ शामिल होती थीं, जहाँ पाठ संकेत पुनरावृत्तियों के दौरान बदलता है, और 'इनिशियल इमेज' एक प्रारंभिक चित्र से पीढ़ी को निर्देशित करने के लिए होती थी। विधि का लचीलापन और प्रवेश में कम बाधा इसके व्यापक अपनाने की कुंजी थी।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:generative-ai·text-to-image·neural-networks·computer-vision
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास