एक वैरिएशनल ऑटोएन्कोडर (VAE) एक कृत्रिम तंत्रिका नेटवर्क आर्किटेक्चर है जिसे 2013 में डिडेरिक पी. किंग्मा और मैक्स वेलिंग द्वारा प्रस्तुत किया गया था। यह प्रोबेबिलिस्टिक ग्राफिकल मॉडल और वैरिएशनल बायेसियन विधियों के परिवारों से संबंधित है। VAE एक एन्कोडर नेटवर्क और एक डिकोडर नेटवर्क को जोड़ता है, जो एक प्रोबेबिलिस्टिक लेटेंट स्पेस के माध्यम से जुड़े होते हैं जो आमतौर पर एक बहुचर गाऊसी वितरण का अनुसरण करता है। एन्कोडर प्रत्येक इनपुट डेटा बिंदु, जैसे कि एक छवि, को लेटेंट स्पेस में एक वितरण में मैप करता है, न कि एक एकल बिंदु पर, जबकि डिकोडर लेटेंट स्पेस से वापस इनपुट स्पेस में मैप करता है। यह प्रोबेबिलिस्टिक मैपिंग प्रशिक्षण डेटा पर ओवरफिटिंग से बचने में मदद करती है। मॉडल को रिपैरामीटराइज़ेशन ट्रिक का उपयोग करके प्रशिक्षित किया जाता है, और इसे मूल रूप से अनपर्यवेक्षित शिक्षण के लिए डिज़ाइन किया गया था, हालांकि यह अर्ध-पर्यवेक्षित और पर्यवेक्षित शिक्षण कार्यों के लिए भी प्रभावी साबित हुआ है।
VAE एक जनरेटिव मॉडल है जो डेटासेट के अंतर्निहित प्रायिकता वितरण को सीखता है। यह डेटा संभावना पर एक निचली सीमा को अनुकूलित करता है, जिसे एविडेंस लोअर बाउंड (ELBO) के रूप में जाना जाता है, जो कम्प्यूटेशनल रूप से सुलभ है। एन्कोडर एक परिशोधित अनुमान नेटवर्क के रूप में कार्य करता है, जो सभी डेटा बिंदुओं पर वैरिएशनल पोस्टीरियर को संयुक्त रूप से अनुकूलित करता है, जिसके परिणामस्वरूप प्रति-डेटा-बिंदु अनुकूलन की तुलना में महत्वपूर्ण मेमोरी बचत होती है। डिकोडर लेटेंट चर से डेटा उत्पन्न करता है, और दोनों नेटवर्क को एक साथ प्रशिक्षित किया जाता है ताकि एक पुनर्निर्माण शब्द और एक कुल्बैक-लीब्लर (KL) विचलन शब्द से बने हानि फलन को कम किया जा सके।
आर्किटेक्चर और संचालन
VAE आर्किटेक्चर में दो मुख्य घटक होते हैं: एक एन्कोडर और एक डिकोडर। एन्कोडर एक तंत्रिका नेटवर्क है जो इनपुट डेटा बिंदु लेता है और एक वैरिएशनल वितरण के लिए पैरामीटर आउटपुट करता है, आमतौर पर एक गाऊसी का माध्य और विचरण। यह इनपुट स्पेस से एक निम्न-आयामी लेटेंट स्पेस में मैप करता है। डिकोडर एक दूसरा तंत्रिका नेटवर्क है जो लेटेंट स्पेस से वापस इनपुट स्पेस में मैप करता है, अक्सर शोर वितरण के माध्य उत्पन्न करता है। कुछ कार्यान्वयनों में, डिकोडर विचरण पैरामीटर भी आउटपुट करता है, लेकिन सरलता के लिए इसे छोड़ा जा सकता है, विचरण को ग्रेडिएंट डिसेंट के माध्यम से अनुकूलित किया जाता है।
प्रशिक्षण उद्देश्य में प्रोबेबिलिस्टिक मॉडल की मुक्त ऊर्जा अभिव्यक्ति से प्राप्त दो शब्द शामिल हैं: पुनर्निर्माण त्रुटि और KL विचलन। पुनर्निर्माण शब्द मापता है कि डिकोडर लेटेंट चर से इनपुट को कितनी अच्छी तरह पुनर्निर्मित करता है, इसकी अपेक्षा की गणना करने के लिए एक नमूनाकरण सन्निकटन की आवश्यकता होती है। KL विचलन शब्द वैरिएशनल पोस्टीरियर और लेटेंट चर पर पूर्व वितरण के बीच अंतर को मापता है, प्रायिकता द्रव्यमान के अतिव्यापन को अधिकतम करता है। शोर वितरण का चुनाव डेटा प्रकार पर निर्भर करता है; उदाहरण के लिए, गाऊसी शोर निरंतर डेटा जैसे छवियों के लिए विशिष्ट है, जबकि बर्नौली शोर बाइनरी डेटा जैसे बाइनरीकृत MNIST अंकों के लिए उपयोग किया जाता है।
सूत्रीकरण
प्रोबेबिलिस्टिक मॉडलिंग परिप्रेक्ष्य से, लक्ष्य एक पैरामीटरयुक्त वितरण \(p_\theta(x) = p(x|\theta)\) के तहत डेटा \(x\) की संभावना को अधिकतम करना है, जिसे अक्सर गाऊसी के रूप में चुना जाता है। हालांकि, जब लेटेंट चर \(z\) पर एक पूर्व मान लिया जाता है, तो सीमांत संभावना \(p_\theta(x) = \int_z p_\theta(x,z) dz\) अव्यावहारिक हो जाती है। इसे संबोधित करने के लिए, VAE एक वैरिएशनल पोस्टीरियर \(q_\phi(z|x)\) प्रस्तुत करता है, जो एन्कोडर द्वारा पैरामीटरयुक्त होता है, और ELBO को अनुकूलित करता है:
\[\log p_\theta(x) \geq \mathbb{E}_{q_\phi(z|x)}[\log p_\theta(x|z)] - D_{KL}(q_\phi(z|x) \| p_\theta(z))\]
पहला शब्द पुनर्निर्माण संभावना है, और दूसरा शब्द वैरिएशनल पोस्टीरियर और पूर्व के बीच KL विचलन है। रिपैरामीटराइज़ेशन ट्रिक ग्रेडिएंट्स को नमूनाकरण प्रक्रिया के माध्यम से प्रवाहित करने की अनुमति देती है, \(z\) को एन्कोडर आउटपुट और एक यादृच्छिक शोर चर के नियतात्मक फलन के रूप में व्यक्त करके, जिससे मानक बैकप्रोपेगेशन सक्षम होता है।
प्रशिक्षण और अनुकूलन
VAE को प्रशिक्षित करने में स्टोकेस्टिक ग्रेडिएंट डिसेंट का उपयोग करके नकारात्मक ELBO को कम करना शामिल है। पुनर्निर्माण शब्द आमतौर पर मोंटे कार्लो नमूनाकरण का उपयोग करके अनुमानित किया जाता है, जबकि KL विचलन अक्सर विश्लेषणात्मक रूप से गणना की जा सकती है जब दोनों पूर्व और पोस्टीरियर गाऊसी हों। रिपैरामीटराइज़ेशन ट्रिक प्रशिक्षण के लिए महत्वपूर्ण है, क्योंकि यह लेटेंट चर नमूनाकरण के स्टोकेस्टिक भाग को नियतात्मक भाग से अलग करती है। शोर मॉडल का विचरण अलग से सीखा या निश्चित किया जा सकता है।
हाल के दृष्टिकोणों ने मोड पतन जैसे मुद्दों को संबोधित करने और उत्पन्न नमूनों की गुणवत्ता में सुधार करने के लिए KL विचलन को अन्य सांख्यिकीय दूरियों, जैसे वासेरस्टीन दूरी, के साथ बदलने की खोज की है। इन वेरिएंट को अक्सर सांख्यिकीय दूरी VAE वेरिएंट के रूप में संदर्भित किया जाता है।
अनुप्रयोग
वैरिएशनल ऑटोएन्कोडर व्यापक रूप से जनरेटिव कार्यों के लिए उपयोग किए गए हैं, जिनमें छवि निर्माण, विसंगति का पता लगाना और प्रतिनिधित्व शिक्षण शामिल हैं। वे अनपर्यवेक्षित शिक्षण के लिए विशेष रूप से प्रभावी हैं, जहां वे डेटा के कॉम्पैक्ट लेटेंट प्रतिनिधित्व सीखते हैं। VAE को अर्ध-पर्यवेक्षित शिक्षण पर भी लागू किया गया है, जहां वे लेबल किए गए कार्यों पर प्रदर्शन में सुधार के लिए अलेबल डेटा का लाभ उठाते हैं, और कुछ संदर्भों में पर्यवेक्षित शिक्षण में भी। आर्किटेक्चर ने कई विस्तारों को प्रेरित किया है, जैसे सशर्त VAE, जो निर्माण प्रक्रिया में वर्ग लेबल शामिल करते हैं, और पदानुक्रमित VAE, जो लेटेंट चर की कई परतों का उपयोग करते हैं।
वेरिएंट और विस्तार
VAE के कई वेरिएंट इसके प्रदर्शन में सुधार और सीमाओं को संबोधित करने के लिए विकसित किए गए हैं। बीटा-VAE KL विचलन शब्द पर एक भार कारक \(\beta\) प्रस्तुत करता है ताकि अधिक अलग-अलग प्रतिनिधित्व को प्रोत्साहित किया जा सके। VQ-VAE (वेक्टर क्वांटाइज्ड VAE) असतत लेटेंट चर का उपयोग करता है, जो पाठ और ऑडियो निर्माण जैसे कार्यों के लिए उपयोगी हैं। अन्य विस्तारों में CVAE (सशर्त VAE) शामिल है, जो सहायक जानकारी पर निर्माण को सशर्त बनाता है, और VAE-GAN, जो तेज छवियों का उत्पादन करने के लिए VAE को एक जनरेटिव एडवर्सरियल नेटवर्क के साथ जोड़ता है। इन वेरिएंट ने विभिन्न डोमेन में VAE की प्रयोज्यता का विस्तार किया है।
अन्य मॉडलों से संबंध
VAE अन्य जनरेटिव मॉडल, जैसे जनरेटिव एडवर्सरियल नेटवर्क (GAN) और नॉर्मलाइज़िंग फ्लो से निकटता से संबंधित है। जबकि GAN स्पष्ट संभावना के बिना यथार्थवादी नमूने उत्पन्न करने पर ध्यान केंद्रित करते हैं, VAE एक सैद्धांतिक प्रोबेबिलिस्टिक ढांचा प्रदान करते हैं जिसमें एक सुलभ उद्देश्य होता है। नॉर्मलाइज़िंग फ्लो सटीक संभावना गणना प्रदान करते हैं लेकिन अक्सर अधिक कम्प्यूटेशनल रूप से महंगे होते हैं। VAE की एन्कोडर-डिकोडर संरचना पारंपरिक ऑटोएन्कोडर के साथ समानताएं साझा करती है, लेकिन प्रोबेबिलिस्टिक लेटेंट स्पेस और नियमितीकरण इसे नियतात्मक ऑटोएन्कोडर से अलग करते हैं।
सीमाएं और भविष्य की दिशाएं
अपनी सफलता के बावजूद, VAE में सीमाएं हैं, जिनमें GAN की तुलना में धुंधले नमूने उत्पन्न करने की प्रवृत्ति शामिल है, जो गाऊसी शोर धारणा और पुनर्निर्माण उद्देश्य के कारण है। KL विचलन पोस्टीरियर पतन भी पैदा कर सकता है, जहां लेटेंट चर अनजानकारीपूर्ण हो जाते हैं। चल रहे शोध का उद्देश्य बेहतर पूर्व, अधिक अभिव्यंजक पोस्टीरियर और वैकल्पिक विचलन उपायों के माध्यम से इन मुद्दों को संबोधित करना है। VAE Deep learning और Generative AI में एक मौलिक मॉडल बना हुआ है, जिसकी प्रासंगिकता शैक्षणिक अनुसंधान और व्यावहारिक अनुप्रयोगों दोनों में बनी हुई है।