VQGAN (वेक्टर क्वांटाइज़्ड जनरेटिव एडवरसैरियल नेटवर्क) जनरेटिव तंत्रिका नेटवर्क आर्किटेक्चर का एक वर्ग है, जिसे उच्च-रिज़ॉल्यूशन छवि संश्लेषण के लिए डिज़ाइन किया गया है। यह वेक्टर क्वांटाइज़ेशन (VQ) की असतत अव्यक्त प्रतिनिधित्व सीखने को जनरेटिव एडवरसैरियल नेटवर्क (GAN) की अवधारणात्मक गुणवत्ता सुधारों के साथ जोड़ता है। 2021 में हीडलबर्ग विश्वविद्यालय और IWR में पैट्रिक एस्सर, रॉबिन रॉम्बैक और ब्योर्न ओमर द्वारा प्रकाशित एक पेपर में पेश किया गया, VQGAN बाद के टेक्स्ट-टू-इमेज मॉडलों के लिए एक आधारभूत घटक बन गया, जिसमें स्टेबल डिफ्यूज़न में उपयोग किए जाने वाले अव्यक्त डिफ्यूज़न मॉडल शामिल हैं।
VQGAN का मुख्य विचार प्रशिक्षण छवियों से दृश्य विशेषताओं का एक संपीड़ित, असतत कोडबुक सीखना है। एक एनकोडर नेटवर्क एक इनपुट छवि को इस कोडबुक में सूचकांकों के अनुक्रम में मैप करता है, और एक डिकोडर उन सूचकांकों से छवि का पुनर्निर्माण करता है। एक GAN विभेदक को एनकोडर और डिकोडर के साथ प्रशिक्षित किया जाता है ताकि यह सुनिश्चित किया जा सके कि पुनर्निर्मित छवियां वास्तविक छवियों से अवधारणात्मक रूप से अप्रभेद्य हैं, जबकि एक पूर्व-प्रशिक्षित नेटवर्क (जैसे VGG) पर आधारित अवधारणात्मक हानि निष्ठा को और बेहतर बनाती है। यह दृष्टिकोण VQGAN को 1024x1024 पिक्सेल और उससे अधिक के रिज़ॉल्यूशन पर छवियां उत्पन्न करने की अनुमति देता है, जो VQ-VAE जैसे पहले के मॉडलों के लिए चुनौतीपूर्ण था।
आर्किटेक्चर और प्रशिक्षण
VQGAN आर्किटेक्चर में तीन मुख्य घटक होते हैं: एक एनकोडर, एक डिकोडर, और सीखने योग्य वेक्टरों की एक कोडबुक। एनकोडर इनपुट छवि को अव्यक्त कोडों के एक स्थानिक ग्रिड में डाउनसैंपल करता है, जिनमें से प्रत्येक को निकटतम कोडबुक प्रविष्टि में क्वांटाइज़ किया जाता है। डिकोडर इन कोडों को वापस छवि स्थान में अपसैंपल करता है। प्रशिक्षण पुनर्निर्माण हानि (L2), अवधारणात्मक हानि, और एक प्रतिबद्धता हानि के संयोजन को कम करता है जो एनकोडर आउटपुट को कोडबुक प्रविष्टियों के करीब रहने के लिए प्रोत्साहित करता है। GAN विभेदक, आमतौर पर एक PatchGAN, वास्तविक और पुनर्निर्मित छवियों के बीच अंतर करने के लिए प्रतिकूल रूप से प्रशिक्षित किया जाता है, जो डिकोडर को तेज विवरण उत्पन्न करने के लिए प्रेरित करता है।
एक प्रमुख नवाचार क्वांटाइज़्ड कोडों के अनुक्रम को मॉडल करने के लिए ट्रांसफॉर्मर जैसे ट्रांसफॉर्मर मॉडल का उपयोग था। असतत कोडों को टोकन के रूप में मानकर, ट्रांसफॉर्मर वैश्विक निर्भरताएं सीख सकता था और स्वप्रतिगामी रूप से नई छवियां उत्पन्न कर सकता था, जिससे सुसंगत बड़े पैमाने की संरचना सक्षम होती थी। यह हाइब्रिड दृष्टिकोण - ट्रांसफॉर्मर प्रायर के साथ कन्वोल्यूशनल एनकोडर/डिकोडर - VQGAN को स्थानीय बनावट और वैश्विक संदर्भ दोनों को पकड़ने की अनुमति देता था।
अव्यक्त डिफ्यूज़न में अनुप्रयोग
VQGAN का सबसे प्रभावशाली अनुप्रयोग अव्यक्त डिफ्यूज़न मॉडलों में इसके एकीकरण के माध्यम से आया। 2022 के पेपर "हाई-रिज़ॉल्यूशन इमेज सिंथेसिस विद लेटेंट डिफ्यूज़न मॉडल्स" में, रॉम्बैक और सहयोगियों ने छवियों को एक निम्न-आयामी अव्यक्त स्थान में संपीड़ित करने के लिए VQGAN-शैली ऑटोएनकोडर का उपयोग किया। फिर डिफ्यूज़न मॉडल इन अव्यक्तों पर काम करता था, न कि कच्चे पिक्सेल पर, जिससे कम्प्यूटेशनल लागत नाटकीय रूप से कम हो जाती थी जबकि छवि गुणवत्ता बनी रहती थी। यह आर्किटेक्चर स्टेबल डिफ्यूज़न का आधार बन गया, जो व्यापक रूप से उपयोग की जाने वाली ओपन-सोर्स टेक्स्ट-टू-इमेज प्रणाली है। इन मॉडलों में VQGAN घटक को अक्सर स्टेबल डिफ्यूज़न पारिस्थितिकी तंत्र में "VAE" (वैरिएशनल ऑटोएनकोडर) कहा जाता है, हालांकि यह वेक्टर-क्वांटाइज़्ड डिज़ाइन को बनाए रखता है।
अन्य जनरेटिव मॉडलों के साथ तुलना
StyleGAN जैसे शुद्ध GAN के विपरीत, जो सीधे एक शोर वेक्टर से छवियां उत्पन्न करते हैं, VQGAN एक असतत अव्यक्त प्रतिनिधित्व उत्पन्न करता है जिसे हेरफेर और संपादित किया जा सकता है। यह गुण इसे छवि इनपेंटिंग, सुपर-रिज़ॉल्यूशन और सिमेंटिक संश्लेषण जैसे कार्यों के लिए उपयुक्त बनाता है। VQ-VAE की तुलना में, VQGAN प्रतिकूल और अवधारणात्मक हानियां जोड़ता है, जो आउटपुट की तीक्ष्णता और यथार्थवाद में काफी सुधार करता है। हालांकि, कोडबुक और ट्रांसफॉर्मर प्रायर पर VQGAN की निर्भरता प्रशिक्षण को सरल ऑटोएनकोडर की तुलना में अधिक जटिल और कम्प्यूटेशनल रूप से गहन बनाती है।
विरासत और प्रभाव
VQGAN ने गहन शिक्षण और कृत्रिम बुद्धिमत्ता में बाद के शोध को प्रभावित किया, विशेष रूप से जनरेटिव मॉडलिंग के क्षेत्र में। इसकी असतत अव्यक्त स्थान अवधारणा को विभिन्न मल्टीमॉडल मॉडलों में अपनाया गया और बड़े भाषा मॉडल के विकास में योगदान दिया जो दृश्य टोकन शामिल करते हैं। कोड और पूर्व-प्रशिक्षित मॉडल सार्वजनिक रूप से जारी किए गए, जिससे व्यापक प्रयोग संभव हुआ। 2025 तक, VQGAN छवि निर्माण में असतत और सतत अव्यक्त प्रतिनिधित्व के बीच व्यापार-नापसंद को समझने के लिए एक संदर्भ बिंदु बना हुआ है, और इसके सिद्धांत व्यापक मशीन लर्निंग समुदाय में नए आर्किटेक्चर को सूचित करना जारी रखते हैं।
सीमाएं
अपनी ताकत के बावजूद, VQGAN की ज्ञात सीमाएं हैं। कोडबुक आकार और आयाम को सावधानीपूर्वक ट्यूनिंग की आवश्यकता होती है; बहुत छोटी कोडबुक विवरण की हानि की ओर ले जाती है, जबकि बहुत बड़ी मेमोरी उपयोग बढ़ाती है। ट्रांसफॉर्मर प्रायर से नमूना लेना धीमा हो सकता है, विशेष रूप से उच्च-रिज़ॉल्यूशन छवियों के लिए। इसके अतिरिक्त, मॉडल समान क्षेत्रों में धुंधलापन या दोहराव वाले पैटर्न जैसे कलाकृतियां प्रदर्शित कर सकता है, विशेष रूप से जब कोडबुक पर्याप्त रूप से अभिव्यंजक नहीं होती है। इन मुद्दों ने बाद के दृष्टिकोणों को प्रेरित किया जो सतत अव्यक्तों की ओर बढ़े, जैसा कि कुछ डिफ्यूज़न मॉडलों में देखा गया है।