वैरिएशनल ऑटोएन्कोडर (VAE) एक प्रकार का कृत्रिम तंत्रिका नेटवर्क है जिसका उपयोग जनरेटिव मॉडलिंग के लिए किया जाता है, जिसे 2013 में डिडेरिक पी. किंग्मा और मैक्स वेलिंग द्वारा प्रस्तुत किया गया था। यह प्रायिकतावादी ग्राफिकल मॉडल और वैरिएशनल बायेसियन विधियों के परिवार से संबंधित है। एक VAE उच्च-आयामी डेटा (जैसे छवियों) को निम्न-आयामी अव्यक्त स्थान में एन्कोड करना सीखता है और फिर उस अव्यक्त स्थान से नमूनों को वापस डेटा में डिकोड करता है, प्रभावी रूप से प्रशिक्षण डेटा के अंतर्निहित प्रायिकता वितरण को सीखता है।
वास्तुकला और संचालन का अवलोकन
एक VAE में दो मुख्य तंत्रिका नेटवर्क घटक होते हैं: एक एन्कोडर और एक डिकोडर। एन्कोडर प्रत्येक इनपुट डेटा बिंदु \(x\) को अव्यक्त चर \(z\) पर वितरण में मैप करता है, आमतौर पर माध्य \(\mu(x)\) और प्रसरण \(\sigma^2(x)\) के साथ एक बहुचर गाऊसी। एकल बिंदु को एन्कोड करने के बजाय, एन्कोडर प्रायिकता वितरण के लिए पैरामीटर आउटपुट करता है, जो मॉडल को अनिश्चितता का प्रतिनिधित्व करने और डेटा में निरंतर भिन्नताओं को पकड़ने की अनुमति देता है। डिकोडर इस अव्यक्त वितरण से एक नमूना \(z\) लेता है और इसे मूल डेटा स्थान पर वापस मैप करता है, जिससे पुनर्निर्माण \(\hat{x}\) उत्पन्न होता है।
VAE का प्रशिक्षण उद्देश्य डेटा की लॉग-संभावना पर साक्ष्य निचली सीमा (ELBO) को अधिकतम करना है। इसमें दो पद शामिल हैं: पुनर्निर्माण हानि, जो मापता है कि डिकोडर अव्यक्त नमूने से इनपुट को कितनी अच्छी तरह पुनर्निर्मित करता है, और एन्कोडर के आउटपुट वितरण और \(z\) पर पूर्व वितरण (आमतौर पर एक मानक सामान्य) के बीच कुल्बैक-लाइब्लर विचलन (KL विचलन)। KL पद एक नियमितीकरणकर्ता के रूप में कार्य करता है, जो अव्यक्त स्थान को सुचारू और निरंतर होने के लिए प्रोत्साहित करता है।
यादृच्छिक नमूनाकरण चरण के माध्यम से बैकप्रोपेगेशन को सक्षम करने के लिए, VAE पुनर्पैरामीटरीकरण ट्रिक का उपयोग करता है: सीधे \(q_\phi(z|x)\) से \(z\) नमूना लेने के बजाय, मॉडल एक सहायक शोर चर \(\epsilon \sim \mathcal{N}(0, I)\) नमूना करता है और \(z = \mu(x) + \sigma(x) \odot \epsilon\) की गणना करता है। यह नमूनाकरण संचालन को एन्कोडर मापदंडों के संबंध में अवकलनीय बनाता है।
गणितीय सूत्रीकरण
प्रायिकतावादी दृष्टिकोण से, लक्ष्य देखे गए डेटा की सीमांत संभावना \(p_\theta(x) = \int p_\theta(x|z) p(z) dz\) को अधिकतम करना है। हालाँकि, यह समाकल अक्सर दुर्गम होता है। VAE एक अनुमानित पश्च \(q_\phi(z|x)\) प्रस्तुत करता है और ELBO प्राप्त करता है:
\[
\log p_\theta(x) \geq \mathbb{E}_{q_\phi(z|x)}[\log p_\theta(x|z)] - D_{KL}(q_\phi(z|x) \| p(z))
\]
पहला पद पुनर्निर्माण संभावना है, और दूसरा पद KL विचलन है। पुनर्पैरामीटरीकरण ट्रिक का उपयोग करते समय दोनों पद मापदंडों \(\theta\) और \(\phi\) के संबंध में अवकलनीय हैं।
पूर्व \(p(z)\) और संभावना \(p_\theta(x|z)\) का चुनाव डेटा प्रकार पर निर्भर करता है। निरंतर डेटा के लिए, एक गाऊसी संभावना सामान्य है; बाइनरी डेटा (जैसे, बाइनरीकृत MNIST) के लिए, एक बर्नौली संभावना का उपयोग किया जाता है। अव्यक्त पूर्व आमतौर पर एक मानक सामान्य वितरण होता है।
प्रशिक्षण गतिशीलता
VAE को ELBO पर स्टोकेस्टिक ग्रेडिएंट डिसेंट द्वारा प्रशिक्षित किया जाता है। पुनर्निर्माण हानि डिकोडर को इनपुट के करीब आउटपुट उत्पन्न करने के लिए प्रोत्साहित करती है, जबकि KL विचलन एन्कोडर के पश्च को पूर्व की ओर धकेलता है। यह एक व्यापार-बंद बनाता है: पुनर्निर्माण पर बहुत अधिक भार अतिअनुकूलन और खंडित अव्यक्त स्थान की ओर ले जाता है, जबकि KL पर बहुत अधिक भार पश्च पतन नामक घटना की ओर ले जाता है, जहाँ अव्यक्त चर अनजानकारीपूर्ण हो जाता है और मॉडल \(z\) को अनदेखा कर देता है। KL एनीलिंग या बीटा-VAE जैसी विभिन्न तकनीकें इस संतुलन को समायोजित करती हैं।
प्रकार और विस्तार
VAE के कई प्रकार विकसित किए गए हैं। बीटा-VAE KL पद को भारित करने के लिए एक हाइपरपैरामीटर \(\beta\) प्रस्तुत करता है, जो अधिक अव्यवस्थित प्रतिनिधित्व को सक्षम बनाता है। सशर्त VAE (CVAE) एन्कोडर और डिकोडर दोनों में वर्ग लेबल या अन्य कंडीशनिंग जानकारी शामिल करते हैं। वेक्टर-परिमाणित VAE (VQ-VAE) असतत अव्यक्त कोड का उपयोग करते हैं, जो उच्च-निष्ठा छवि निर्माण के लिए विशेष रूप से प्रभावी हैं। अन्य विस्तारों में पदानुक्रमित VAE, सामान्यीकरण प्रवाह और प्रतिकूल ऑटोएन्कोडर शामिल हैं।
अनुप्रयोग
VAE को विभिन्न डोमेन में व्यापक रूप से लागू किया गया है। कंप्यूटर विज़न में, इसका उपयोग छवि निर्माण, शोर हटाने और इनपेंटिंग के लिए किया जाता है। प्राकृतिक भाषा प्रसंस्करण में, VAE को पाठ निर्माण और वाक्य प्रतिनिधित्व सीखने के लिए लागू किया गया है। चिकित्सा इमेजिंग में, उनका उपयोग विसंगति का पता लगाने के लिए किया जाता है। VAE अधिक जटिल जनरेटिव मॉडल के लिए बिल्डिंग ब्लॉक के रूप में भी काम करते हैं, जैसे कि दवा खोज और आणविक डिजाइन में उपयोग किए जाने वाले।
अन्य जनरेटिव मॉडल से संबंध
VAE तीन मुख्य प्रकार के गहरे जनरेटिव मॉडल में से एक हैं, साथ ही जनरेटिव प्रतिकूल नेटवर्क (GAN) और ऑटोरेग्रेसिव मॉडल। GAN के विपरीत, जो वास्तविक और नकली नमूनों को अलग करने के लिए एक विभेदक को प्रशिक्षित करते हैं, VAE संभावना-आधारित उद्देश्य को अनुकूलित करते हैं, जिससे वे प्रशिक्षित करने के लिए अधिक स्थिर होते हैं लेकिन अक्सर धुंधले आउटपुट उत्पन्न करते हैं। ऑटोरेग्रेसिव मॉडल, जैसे कि PixelCNN, संयुक्त वितरण को सशर्त के उत्पाद के रूप में मॉडल करते हैं, लेकिन उनमें निम्न-आयामी अव्यक्त स्थान की कमी होती है। VAE ट्रैक्टेबल अनुमान और अभिव्यंजक निर्माण के बीच संतुलन प्रदान करते हैं।
सीमाएँ और वर्तमान अनुसंधान
उनकी सफलता के बावजूद, VAE की ज्ञात सीमाएँ हैं। गाऊसी संभावना धारणा के कारण उत्पन्न नमूने अक्सर GAN की तुलना में कम तीक्ष्ण होते हैं। अव्यक्त स्थान पूरी तरह से अव्यवस्थित नहीं हो सकता है, और पश्च पतन एक सक्रिय अनुसंधान क्षेत्र बना हुआ है। हालिया कार्य पूर्व और पश्च की अभिव्यंजना में सुधार, अधिक लचीले वितरण का उपयोग और VAE को अन्य मॉडलों के साथ संयोजित करने पर केंद्रित है। यह क्षेत्र विकसित हो रहा है, सुदृढीकरण सीखने और प्रतिनिधित्व सीखने तक अनुप्रयोगों का विस्तार हो रहा है।
यह भी देखें
- ऑटोएन्कोडर
- जनरेटिव प्रतिकूल नेटवर्क
- बायेसियन अनुमान
- अव्यक्त चर मॉडल
- पुनर्पैरामीटरीकरण ट्रिक
- साक्ष्य निचली सीमा
- बीटा-VAE
- सशर्त वैरिएशनल ऑटोएन्कोडर
- वेक्टर-परिमाणित वैरिएशनल ऑटोएन्कोडर
- सामान्यीकरण प्रवाह
- प्रायिकतावादी ग्राफिकल मॉडल
- गहन सीखना
- अनुपरीक्षित सीखना
- स्टोकेस्टिक ग्रेडिएंट डिसेंट
- कुल्बैक-लाइब्लर विचलन
- गाऊसी वितरण
- बर्नौली वितरण
- MNIST डेटाबेस
- छवि निर्माण
- प्रतिनिधित्व सीखना
संदर्भ
- किंग्मा, डी. पी., और वेलिंग, एम. (2013)। ऑटो-एन्कोडिंग वैरिएशनल बेयस। arXiv:1312.6114.
- डोर्श, सी. (2016)। वैरिएशनल ऑटोएन्कोडर पर ट्यूटोरियल। arXiv:1606.05908.
- ब्लेई, डी. एम., कुकुएलबिर, ए., और मैकऑलिफ, जे. डी. (2017)। वैरिएशनल इन्फ्रेंस: सांख्यिकीविदों के लिए एक समीक्षा। जर्नल ऑफ द अमेरिकन स्टैटिस्टिकल एसोसिएशन।
- हिगिंस, आई., एट अल. (2017)। बीटा-VAE: एक बाधित वैरिएशनल फ्रेमवर्क के साथ बुनियादी दृश्य अवधारणाओं को सीखना। ICLR।