अंग्रेज़ी से अनुवादित

एक वैरिएशनल ऑटोएनकोडर (VAE) एक जनरेटिव न्यूरल नेटवर्क आर्किटेक्चर है जो एक प्रमाण निचली सीमा को अधिकतम करके एक संभाव्य अव्यक्त स्थान सीखता है, जिसमें एक एनकोडर और डिकोडर को पुनःपैरामीटराइजेशन ट्रिक के साथ संयुक्त रूप से प्रशिक्षित किया जाता है।

वैरिएशनल ऑटोएन्कोडर (VAE) एक प्रकार का कृत्रिम तंत्रिका नेटवर्क है जिसका उपयोग जनरेटिव मॉडलिंग के लिए किया जाता है, जिसे 2013 में डिडेरिक पी. किंग्मा और मैक्स वेलिंग द्वारा प्रस्तुत किया गया था। यह प्रायिकतावादी ग्राफिकल मॉडल और वैरिएशनल बायेसियन विधियों के परिवार से संबंधित है। एक VAE उच्च-आयामी डेटा (जैसे छवियों) को निम्न-आयामी अव्यक्त स्थान में एन्कोड करना सीखता है और फिर उस अव्यक्त स्थान से नमूनों को वापस डेटा में डिकोड करता है, प्रभावी रूप से प्रशिक्षण डेटा के अंतर्निहित प्रायिकता वितरण को सीखता है।

वास्तुकला और संचालन का अवलोकन

एक VAE में दो मुख्य तंत्रिका नेटवर्क घटक होते हैं: एक एन्कोडर और एक डिकोडर। एन्कोडर प्रत्येक इनपुट डेटा बिंदु \(x\) को अव्यक्त चर \(z\) पर वितरण में मैप करता है, आमतौर पर माध्य \(\mu(x)\) और प्रसरण \(\sigma^2(x)\) के साथ एक बहुचर गाऊसी। एकल बिंदु को एन्कोड करने के बजाय, एन्कोडर प्रायिकता वितरण के लिए पैरामीटर आउटपुट करता है, जो मॉडल को अनिश्चितता का प्रतिनिधित्व करने और डेटा में निरंतर भिन्नताओं को पकड़ने की अनुमति देता है। डिकोडर इस अव्यक्त वितरण से एक नमूना \(z\) लेता है और इसे मूल डेटा स्थान पर वापस मैप करता है, जिससे पुनर्निर्माण \(\hat{x}\) उत्पन्न होता है।

VAE का प्रशिक्षण उद्देश्य डेटा की लॉग-संभावना पर साक्ष्य निचली सीमा (ELBO) को अधिकतम करना है। इसमें दो पद शामिल हैं: पुनर्निर्माण हानि, जो मापता है कि डिकोडर अव्यक्त नमूने से इनपुट को कितनी अच्छी तरह पुनर्निर्मित करता है, और एन्कोडर के आउटपुट वितरण और \(z\) पर पूर्व वितरण (आमतौर पर एक मानक सामान्य) के बीच कुल्बैक-लाइब्लर विचलन (KL विचलन)। KL पद एक नियमितीकरणकर्ता के रूप में कार्य करता है, जो अव्यक्त स्थान को सुचारू और निरंतर होने के लिए प्रोत्साहित करता है।

यादृच्छिक नमूनाकरण चरण के माध्यम से बैकप्रोपेगेशन को सक्षम करने के लिए, VAE पुनर्पैरामीटरीकरण ट्रिक का उपयोग करता है: सीधे \(q_\phi(z|x)\) से \(z\) नमूना लेने के बजाय, मॉडल एक सहायक शोर चर \(\epsilon \sim \mathcal{N}(0, I)\) नमूना करता है और \(z = \mu(x) + \sigma(x) \odot \epsilon\) की गणना करता है। यह नमूनाकरण संचालन को एन्कोडर मापदंडों के संबंध में अवकलनीय बनाता है।

गणितीय सूत्रीकरण

प्रायिकतावादी दृष्टिकोण से, लक्ष्य देखे गए डेटा की सीमांत संभावना \(p_\theta(x) = \int p_\theta(x|z) p(z) dz\) को अधिकतम करना है। हालाँकि, यह समाकल अक्सर दुर्गम होता है। VAE एक अनुमानित पश्च \(q_\phi(z|x)\) प्रस्तुत करता है और ELBO प्राप्त करता है:

\[

\log p_\theta(x) \geq \mathbb{E}_{q_\phi(z|x)}[\log p_\theta(x|z)] - D_{KL}(q_\phi(z|x) \| p(z))

\]

पहला पद पुनर्निर्माण संभावना है, और दूसरा पद KL विचलन है। पुनर्पैरामीटरीकरण ट्रिक का उपयोग करते समय दोनों पद मापदंडों \(\theta\) और \(\phi\) के संबंध में अवकलनीय हैं।

पूर्व \(p(z)\) और संभावना \(p_\theta(x|z)\) का चुनाव डेटा प्रकार पर निर्भर करता है। निरंतर डेटा के लिए, एक गाऊसी संभावना सामान्य है; बाइनरी डेटा (जैसे, बाइनरीकृत MNIST) के लिए, एक बर्नौली संभावना का उपयोग किया जाता है। अव्यक्त पूर्व आमतौर पर एक मानक सामान्य वितरण होता है।

प्रशिक्षण गतिशीलता

VAE को ELBO पर स्टोकेस्टिक ग्रेडिएंट डिसेंट द्वारा प्रशिक्षित किया जाता है। पुनर्निर्माण हानि डिकोडर को इनपुट के करीब आउटपुट उत्पन्न करने के लिए प्रोत्साहित करती है, जबकि KL विचलन एन्कोडर के पश्च को पूर्व की ओर धकेलता है। यह एक व्यापार-बंद बनाता है: पुनर्निर्माण पर बहुत अधिक भार अतिअनुकूलन और खंडित अव्यक्त स्थान की ओर ले जाता है, जबकि KL पर बहुत अधिक भार पश्च पतन नामक घटना की ओर ले जाता है, जहाँ अव्यक्त चर अनजानकारीपूर्ण हो जाता है और मॉडल \(z\) को अनदेखा कर देता है। KL एनीलिंग या बीटा-VAE जैसी विभिन्न तकनीकें इस संतुलन को समायोजित करती हैं।

प्रकार और विस्तार

VAE के कई प्रकार विकसित किए गए हैं। बीटा-VAE KL पद को भारित करने के लिए एक हाइपरपैरामीटर \(\beta\) प्रस्तुत करता है, जो अधिक अव्यवस्थित प्रतिनिधित्व को सक्षम बनाता है। सशर्त VAE (CVAE) एन्कोडर और डिकोडर दोनों में वर्ग लेबल या अन्य कंडीशनिंग जानकारी शामिल करते हैं। वेक्टर-परिमाणित VAE (VQ-VAE) असतत अव्यक्त कोड का उपयोग करते हैं, जो उच्च-निष्ठा छवि निर्माण के लिए विशेष रूप से प्रभावी हैं। अन्य विस्तारों में पदानुक्रमित VAE, सामान्यीकरण प्रवाह और प्रतिकूल ऑटोएन्कोडर शामिल हैं।

अनुप्रयोग

VAE को विभिन्न डोमेन में व्यापक रूप से लागू किया गया है। कंप्यूटर विज़न में, इसका उपयोग छवि निर्माण, शोर हटाने और इनपेंटिंग के लिए किया जाता है। प्राकृतिक भाषा प्रसंस्करण में, VAE को पाठ निर्माण और वाक्य प्रतिनिधित्व सीखने के लिए लागू किया गया है। चिकित्सा इमेजिंग में, उनका उपयोग विसंगति का पता लगाने के लिए किया जाता है। VAE अधिक जटिल जनरेटिव मॉडल के लिए बिल्डिंग ब्लॉक के रूप में भी काम करते हैं, जैसे कि दवा खोज और आणविक डिजाइन में उपयोग किए जाने वाले।

अन्य जनरेटिव मॉडल से संबंध

VAE तीन मुख्य प्रकार के गहरे जनरेटिव मॉडल में से एक हैं, साथ ही जनरेटिव प्रतिकूल नेटवर्क (GAN) और ऑटोरेग्रेसिव मॉडल। GAN के विपरीत, जो वास्तविक और नकली नमूनों को अलग करने के लिए एक विभेदक को प्रशिक्षित करते हैं, VAE संभावना-आधारित उद्देश्य को अनुकूलित करते हैं, जिससे वे प्रशिक्षित करने के लिए अधिक स्थिर होते हैं लेकिन अक्सर धुंधले आउटपुट उत्पन्न करते हैं। ऑटोरेग्रेसिव मॉडल, जैसे कि PixelCNN, संयुक्त वितरण को सशर्त के उत्पाद के रूप में मॉडल करते हैं, लेकिन उनमें निम्न-आयामी अव्यक्त स्थान की कमी होती है। VAE ट्रैक्टेबल अनुमान और अभिव्यंजक निर्माण के बीच संतुलन प्रदान करते हैं।

सीमाएँ और वर्तमान अनुसंधान

उनकी सफलता के बावजूद, VAE की ज्ञात सीमाएँ हैं। गाऊसी संभावना धारणा के कारण उत्पन्न नमूने अक्सर GAN की तुलना में कम तीक्ष्ण होते हैं। अव्यक्त स्थान पूरी तरह से अव्यवस्थित नहीं हो सकता है, और पश्च पतन एक सक्रिय अनुसंधान क्षेत्र बना हुआ है। हालिया कार्य पूर्व और पश्च की अभिव्यंजना में सुधार, अधिक लचीले वितरण का उपयोग और VAE को अन्य मॉडलों के साथ संयोजित करने पर केंद्रित है। यह क्षेत्र विकसित हो रहा है, सुदृढीकरण सीखने और प्रतिनिधित्व सीखने तक अनुप्रयोगों का विस्तार हो रहा है।

यह भी देखें

संदर्भ

  • किंग्मा, डी. पी., और वेलिंग, एम. (2013)। ऑटो-एन्कोडिंग वैरिएशनल बेयस। arXiv:1312.6114.
  • डोर्श, सी. (2016)। वैरिएशनल ऑटोएन्कोडर पर ट्यूटोरियल। arXiv:1606.05908.
  • ब्लेई, डी. एम., कुकुएलबिर, ए., और मैकऑलिफ, जे. डी. (2017)। वैरिएशनल इन्फ्रेंस: सांख्यिकीविदों के लिए एक समीक्षा। जर्नल ऑफ द अमेरिकन स्टैटिस्टिकल एसोसिएशन।
  • हिगिंस, आई., एट अल. (2017)। बीटा-VAE: एक बाधित वैरिएशनल फ्रेमवर्क के साथ बुनियादी दृश्य अवधारणाओं को सीखना। ICLR।
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:generative-models·neural-networks·unsupervised-learning·probabilistic-models
इस पृष्ठ को अंतिम बार संपादित किया गया 9 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास