वैरिएशनल ऑटोएनकोडर (विवरण)

अंग्रेज़ी से अनुवादित

एक वैरिएशनल ऑटोएनकोडर (VAE) एक तंत्रिका नेटवर्क वास्तुकला है जिसे 2013 में डीडेरिक पी. किंगमा और मैक्स वेलिंग द्वारा पेश किया गया था, जो जनरेटिव मॉडलिंग के लिए एक संभाव्य अव्यक्त स्थान सीखता है, जिसमें एक एनकोडर और डिकोडर को वैरिएशनल बायेसियन विधियों के साथ प्रशिक्षित किया जाता है।

एक वैरिएशनल ऑटोएनकोडर (VAE) एक कृत्रिम तंत्रिका नेटवर्क आर्किटेक्चर है जिसे 2013 में डिडेरिक पी. किंगमा और मैक्स वेलिंग द्वारा प्रस्तुत किया गया था। यह प्रायिकतावादी ग्राफिकल मॉडल और वैरिएशनल बायेसियन विधियों के परिवारों से संबंधित है। VAE जनरेटिव मॉडल हैं जो डेटा को एक संपीड़ित अव्यक्त स्थान में प्रस्तुत करना सीखते हैं और उस स्थान से नए नमूने उत्पन्न करते हैं। मानक ऑटोएनकोडर के विपरीत, जो इनपुट को अव्यक्त स्थान में निश्चित बिंदुओं पर मैप करते हैं, VAE इनपुट को एक प्रायिकता वितरण, आमतौर पर एक बहुचर गाऊसी, पर मैप करते हैं, जो ओवरफिटिंग से बचने में मदद करता है और स्मूथ इंटरपोलेशन और जनरेशन को सक्षम बनाता है।

आर्किटेक्चर में दो तंत्रिका नेटवर्क होते हैं: एक एनकोडर और एक डिकोडर। एनकोडर प्रत्येक इनपुट डेटा बिंदु (जैसे, एक छवि) को अव्यक्त स्थान में एक वैरिएशनल वितरण के मापदंडों, जैसे कि माध्य और विचरण वेक्टर, पर मैप करता है। डिकोडर अव्यक्त स्थान से वापस इनपुट स्थान पर मैप करता है, जिससे पुनर्निर्माण या नए नमूने उत्पन्न होते हैं। दोनों नेटवर्क को पुनर्मापदीकरण ट्रिक का उपयोग करके संयुक्त रूप से प्रशिक्षित किया जाता है, जो स्टोकेस्टिक सैंपलिंग के माध्यम से बैकप्रोपेगेशन की अनुमति देता है। VAE शुरू में अनुपयोजित शिक्षण के लिए डिज़ाइन किए गए थे, लेकिन वे अर्ध-पर्यवेक्षित और पर्यवेक्षित शिक्षण कार्यों के लिए भी प्रभावी साबित हुए हैं।

आर्किटेक्चर और संचालन का अवलोकन

एक वैरिएशनल ऑटोएनकोडर एक जनरेटिव मॉडल है जिसमें अव्यक्त चर पर एक पूर्व वितरण और डेटा के लिए एक शोर वितरण होता है। पारंपरिक जनरेटिव मॉडल, जैसे कि प्रायिकतावादी PCA या स्पार्स कोडिंग, को अपेक्षा-अधिकतमीकरण (EM) मेटा-एल्गोरिदम का उपयोग करके प्रशिक्षित किया जाता है। EM डेटा संभावना पर एक निचली सीमा को अनुकूलित करता है, जो अक्सर कम्प्यूटेशनल रूप से दुर्गम होती है, और प्रत्येक डेटा बिंदु के लिए एक अलग अनुकूलन प्रक्रिया में q-वितरण (वैरिएशनल पोस्टीरियर) की खोज की आवश्यकता होती है। इसके विपरीत, VAE एक तंत्रिका नेटवर्क का उपयोग एक परिशोधित दृष्टिकोण के रूप में करते हैं जो सभी डेटा बिंदुओं पर संयुक्त रूप से अनुकूलन करता है। इसका मतलब है कि समान नेटवर्क पैरामीटर कई डेटा बिंदुओं के लिए पुन: उपयोग किए जाते हैं, जिसके परिणामस्वरूप महत्वपूर्ण मेमोरी बचत होती है।

एनकोडर नेटवर्क इनपुट डेटा बिंदु लेता है और वैरिएशनल वितरण के लिए मापदंड आउटपुट करता है। चूंकि यह एक ज्ञात इनपुट स्थान से निम्न-आयामी अव्यक्त स्थान पर मैप करता है, इसे एनकोडर कहा जाता है। डिकोडर दूसरा तंत्रिका नेटवर्क है; यह अव्यक्त स्थान से इनपुट स्थान पर मैप करता है, आमतौर पर शोर वितरण के माध्य आउटपुट करता है। विचरण आउटपुट करने के लिए एक और नेटवर्क का उपयोग करना संभव है, लेकिन सरलता के लिए इसे अक्सर छोड़ दिया जाता है, और विचरण को ग्रेडिएंट डिसेंट के माध्यम से अनुकूलित किया जा सकता है।

मॉडल को अनुकूलित करने के लिए, दो शब्दों की आवश्यकता होती है: पुनर्निर्माण त्रुटि और कुलबैक-लीब्लर विचलन (KL-D)। दोनों शब्द प्रायिकतावादी मॉडल की मुक्त ऊर्जा अभिव्यक्ति से प्राप्त होते हैं, और वे शोर वितरण और डेटा के माने गए पूर्व (p-वितरण) के आधार पर भिन्न होते हैं। उदाहरण के लिए, ImageNet जैसा एक मानक VAE कार्य आमतौर पर गाऊसी शोर मानता है, जबकि बाइनरीकृत MNIST जैसे कार्यों के लिए बर्नौली शोर की आवश्यकता होती है। KL-D शब्द q-वितरण की प्रायिकता द्रव्यमान को अधिकतम करता है जो p-वितरण के साथ ओवरलैप होता है, जिससे मोड-खोज व्यवहार हो सकता है। पुनर्निर्माण शब्द मुक्त ऊर्जा अभिव्यक्ति का शेष भाग है और इसके अपेक्षा मान की गणना करने के लिए एक सैंपलिंग सन्निकटन की आवश्यकता होती है। हाल के दृष्टिकोण KL-D को विभिन्न सांख्यिकीय दूरियों से बदल देते हैं, जैसा कि सांख्यिकीय दूरी VAE वेरिएंट अनुभाग में चर्चा की गई है।

सूत्रीकरण

प्रायिकतावादी मॉडलिंग परिप्रेक्ष्य से, लक्ष्य चुने गए पैरामीटरयुक्त प्रायिकता वितरण p_θ(x) = p(x|θ) के तहत डेटा x की संभावना को अधिकतम करना है। यह वितरण अक्सर एक गाऊसी N(x|μ, σ) चुना जाता है, जो माध्य μ और विचरण σ द्वारा पैरामीटरयुक्त होता है, और घातीय परिवार के सदस्य के रूप में इसके साथ काम करना आसान होता है। सरल वितरणों को अधिकतम करना सीधा है, लेकिन जब अव्यक्त चर z पर एक पूर्व मान लिया जाता है, तो परिणामी इंटीग्रल दुर्गम हो जाते हैं। p_θ(x) खोजने के लिए, z पर मार्जिनलाइज़ किया जाता है:

p_θ(x) = ∫ p_θ(x, z) dz,

जहां p_θ(x, z) p_θ के तहत अवलोकन योग्य डेटा x और अव्यक्त एन्कोडिंग z का संयुक्त वितरण है। श्रृंखला नियम का उपयोग करके, इसे फिर से लिखा जा सकता है:

p_θ(x) = ∫ p_θ(x|z) p_θ(z) dz.

यह इंटीग्रल आम तौर पर दुर्गम है क्योंकि अव्यक्त स्थान उच्च-आयामी है और संभावना p_θ(x|z) जटिल हो सकती है। वैरिएशनल अनुमान वास्तविक पोस्टीरियर p_θ(z|x) को एक सरल वितरण q_φ(z|x) के साथ अनुमानित करता है, जो एनकोडर नेटवर्क द्वारा पैरामीटरयुक्त होता है। मॉडल को अनुकूलित करने के लिए साक्ष्य निचली सीमा (ELBO) प्राप्त की जाती है:

log p_θ(x) ≥ E_{q_φ(z|x)}[log p_θ(x|z)] - KL(q_φ(z|x) || p_θ(z)).

पहला शब्द पुनर्निर्माण संभावना है, और दूसरा शब्द अनुमानित पोस्टीरियर और पूर्व के बीच KL विचलन है। पुनर्मापदीकरण ट्रिक z को μ + σ * ε के रूप में व्यक्त करके q_φ(z|x) से सैंपलिंग की अनुमति देती है, जहां ε एक मानक सामान्य वितरण से खींचा जाता है, जिससे ग्रेडिएंट-आधारित अनुकूलन सक्षम होता है।

एनकोडर और डिकोडर नेटवर्क

एनकोडर नेटवर्क, जिसे अक्सर q_φ(z|x) के रूप में दर्शाया जाता है, एक इनपुट x लेता है और एक वैरिएशनल वितरण के मापदंड आउटपुट करता है, आमतौर पर एक गाऊसी का माध्य μ और लॉग-विचरण log σ²। यह वितरण इनपुट की अव्यक्त एन्कोडिंग का प्रतिनिधित्व करता है। डिकोडर नेटवर्क, जिसे p_θ(x|z) के रूप में दर्शाया जाता है, एक अव्यक्त नमूना z लेता है और डेटा वितरण के लिए मापदंड आउटपुट करता है, जैसे कि निरंतर डेटा के लिए एक गाऊसी का माध्य या बर्नौली डेटा के लिए संभावनाएं।

दोनों नेटवर्क आमतौर पर पुनर्मापदीकरण ट्रिक का उपयोग करके एक साथ प्रशिक्षित किए जाते हैं। एनकोडर और डिकोडर आमतौर पर डेटा प्रकार के आधार पर बहुपरत परसेप्ट्रॉन (MLP) या कन्वोल्यूशनल तंत्रिका नेटवर्क (CNN) के रूप में लागू किए जाते हैं। छवि डेटा के लिए, CNN आम हैं, जैसा कि कन्वोल्यूशनल VAE जैसे मॉडल में देखा जाता है। नेटवर्क आर्किटेक्चर का चुनाव मॉडल की क्षमता और प्रदर्शन को प्रभावित करता है।

प्रशिक्षण और पुनर्मापदीकरण ट्रिक

VAE को प्रशिक्षित करने में ELBO को अधिकतम करना शामिल है, जो पुनर्निर्माण शब्द और KL विचलन शब्द का योग है। पुनर्निर्माण शब्द डिकोडर को अव्यक्त नमूने से इनपुट को सटीक रूप से पुनर्निर्माण करने के लिए प्रोत्साहित करता है, जबकि KL विचलन शब्द अनुमानित पोस्टीरियर को पूर्व के करीब होने के लिए प्रोत्साहित करता है, आमतौर पर एक मानक सामान्य वितरण N(0, I)। यह संतुलन ओवरफिटिंग को रोकता है और एक स्मूथ अव्यक्त स्थान सुनिश्चित करता है।

पुनर्मापदीकरण ट्रिक प्रशिक्षण के लिए महत्वपूर्ण है क्योंकि यह स्टोकेस्टिक सैंपलिंग प्रक्रिया के माध्यम से ग्रेडिएंट को प्रवाहित करने की अनुमति देता है। q_φ(z|x) से सीधे z सैंपल करने के बजाय, जो गैर-अवकलनीय है, एनकोडर μ और σ आउटपुट करता है, और z की गणना z = μ + σ * ε के रूप में की जाती है, जहां ε ~ N(0, I)। यह सैंपलिंग ऑपरेशन को मापदंडों के संबंध में अवकलनीय बनाता है, जिससे मानक बैकप्रोपेगेशन सक्षम होता है।

प्रशिक्षण के दौरान, शोर मॉडल के विचरण को अलग से सीखा या तय किया जा सकता है। कुछ कार्यान्वयनों में, डिकोडर माध्य और विचरण दोनों आउटपुट करता है, जबकि अन्य में, विचरण एक हाइपरपैरामीटर है या अलग से अनुकूलित किया जाता है। प्रशिक्षण प्रक्रिया आमतौर पर स्टोकेस्टिक ग्रेडिएंट डिसेंट (SGD) या Adam जैसे वेरिएंट का उपयोग करती है, जिसमें सीखने की दर अनुसूचियां होती हैं।

हानि फलन और KL विचलन

VAE के लिए हानि फलन नकारात्मक ELBO है, जिसमें दो शब्द होते हैं: पुनर्निर्माण हानि और KL विचलन। पुनर्निर्माण हानि मापती है कि डिकोडर अव्यक्त नमूने से इनपुट को कितनी अच्छी तरह पुनर्निर्माण करता है। गाऊसी शोर के साथ निरंतर डेटा के लिए, यह अक्सर इनपुट और पुनर्निर्मित आउटपुट के बीच माध्य वर्ग त्रुटि (MSE) होती है। बाइनरी डेटा के लिए, यह बाइनरी क्रॉस-एन्ट्रॉपी है।

KL विचलन शब्द की गणना अनुमानित पोस्टीरियर q_φ(z|x) और पूर्व p(z) के बीच की जाती है। गाऊसी वितरण के लिए, इसका एक बंद-रूप अभिव्यक्ति है:

KL(q_φ(z|x) || p(z)) = -0.5 * (1 + log σ² - μ² - σ²),

यह मानते हुए कि पूर्व N(0, I) है। यह शब्द अव्यक्त वितरण को पूर्व से विचलित होने के लिए दंडित करता है, एक संक्षिप्त और निरंतर अव्यक्त स्थान को प्रोत्साहित करता है।

KL विचलन मोड-खोज व्यवहार का कारण बन सकता है, जहां मॉडल डेटा वितरण के कुछ मोड पर ध्यान केंद्रित करता है। इसे संबोधित करने के लिए, विभिन्न विकल्प प्रस्तावित किए गए हैं, जैसे कि वासरस्टीन दूरी या अधिकतम माध्य विचलन (MMD) जैसी विभिन्न सांख्यिकीय दूरियों का उपयोग करना।

वेरिएंट और विस्तार

VAE की शुरुआत के बाद से, उनके प्रदर्शन में सुधार और सीमाओं को संबोधित करने के लिए कई वेरिएंट विकसित किए गए हैं। कुछ उल्लेखनीय वेरिएंट में शामिल हैं:

  • β-VAE: अधिक विघटित प्रतिनिधित्व को प्रोत्साहित करने के लिए KL विचलन शब्द पर एक भार कारक β पेश करता है। यह अक्सर व्याख्या योग्य कारकों की अनुपयोजित शिक्षण में उपयोग किया जाता है।
  • कंडीशनल VAE (CVAE): नियंत्रित जनरेशन को सक्षम करने के लिए एनकोडर और डिकोडर दोनों को अतिरिक्त जानकारी, जैसे कि वर्ग लेबल, पर कंडीशन करता है।
  • VQ-VAE: अव्यक्त स्थान में वेक्टर क्वांटाइजेशन का उपयोग करता है, जिससे असतत अव्यक्त कोड उत्पन्न होते हैं, जो छवि जनरेशन और प्रतिनिधित्व शिक्षण जैसे कार्यों के लिए उपयोगी होते हैं।
  • सांख्यिकीय दूरी VAE वेरिएंट: प्रशिक्षण स्थिरता और नमूना गुणवत्ता में सुधार के लिए KL विचलन को अन्य सांख्यिकीय दूरियों, जैसे कि वासरस्टीन दूरी, से बदल देते हैं।

इन वेरिएंट को विभिन्न डोमेन में लागू किया गया है, जिसमें छवि जनरेशन, पाठ जनरेशन और विसंगति का पता लगाना शामिल है।

अनुप्रयोग और महत्व

वैरिएशनल ऑटोएनकोडर के मशीन लर्निंग और कृत्रिम बुद्धिमत्ता में व्यापक अनुप्रयोग हैं। उनका उपयोग जनरेटिव मॉडलिंग के लिए किया जाता है, जहां वे प्रशिक्षण डेटा के समान नए डेटा नमूने उत्पन्न कर सकते हैं, जैसे कि छवियां, ऑडियो और पाठ। VAE का उपयोग प्रतिनिधित्व शिक्षण के लिए भी किया जाता है, जहां अव्यक्त स्थान डेटा की सार्थक विशेषताओं को पकड़ता है, जिससे क्लस्टरिंग और आयामीता में कमी जैसे कार्य सक्षम होते हैं।

अर्ध-पर्यवेक्षित शिक्षण में, VAE उपयोगी प्रतिनिधित्व सीखने के लिए अलेबल डेटा का लाभ उठा सकते हैं, जिससे सीमित लेबल वाले डेटा वाले कार्यों पर प्रदर्शन में सुधार होता है। पर्यवेक्षित शिक्षण में, VAE का उपयोग फीचर एक्सट्रैक्टर के रूप में या डेटा वृद्धि के लिए किया जा सकता है। VAE को विसंगति का पता लगाने में भी लागू किया गया है, जहां एक डेटा बिंदु की पुनर्निर्माण त्रुटि या संभावना इंगित करती है कि यह सामान्य है या असामान्य।

VAE का महत्व अनुपयोजित तरीके से प्रायिकतावादी अव्यक्त प्रतिनिधित्व सीखने की उनकी क्षमता में निहित है, जो जनरेटिव मॉडलिंग के लिए एक सैद्धांतिक रूपरेखा प्रदान करता है। उन्होंने गहन शिक्षण में कई बाद के विकासों को प्रभावित किया है, जिसमें जनरेटिव AI का व्यापक क्षेत्र शामिल है, और वे अनुसंधान का एक सक्रिय क्षेत्र बने हुए हैं।

अन्य जनरेटिव मॉडल से संबंध

VAE जनरेटिव एडवर्सरियल नेटवर्क (GAN) और डिफ्यूजन मॉडल के साथ कई प्रमुख जनरेटिव मॉडल परिवारों में से एक हैं। जबकि GAN एक प्रतिकूल प्रशिक्षण प्रक्रिया के माध्यम से यथार्थवादी नमूने उत्पन्न करने पर ध्यान केंद्रित करते हैं, VAE प्रायिकतावादी अनुमान और एक स्मूथ अव्यक्त स्थान पर जोर देते हैं। डिफ्यूजन मॉडल, जिन्होंने हाल ही में लोकप्रियता हासिल की है, एक शोर प्रक्रिया को उलट कर डेटा उत्पन्न करते हैं। प्रत्येक दृष्टिकोण की अपनी ताकत और कमजोरियां हैं; VAE स्थिर प्रशिक्षण और एक अच्छी तरह से परिभाषित अव्यक्त स्थान प्रदान करते हैं, लेकिन GAN की तुलना में धुंधले नमूने उत्पन्न कर सकते हैं। मॉडल का चुनाव विशिष्ट अनुप्रयोग और आवश्यकताओं पर निर्भर करता है।

गहन शिक्षण के संदर्भ में, VAE का उपयोग अक्सर बड़े आर्किटेक्चर में बिल्डिंग ब्लॉक के रूप में किया जाता है, जैसे कि वैरिएशनल ऑटोएनकोडर-आधारित ट्रांसफॉर्मर या बहु-मोडल मॉडल में घटकों के रूप में। वे बड़े भाषा मॉडल के विकास के लिए भी प्रासंगिक हैं, हालांकि वे आम तौर पर VAE के बजाय ऑटोरेग्रेसिव या ट्रांसफॉर्मर आर्किटेक्चर पर निर्भर करते हैं।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:machine-learning·generative-model·neural-network·probabilistic-model
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास