वैरिएशनल ऑटोएनकोडर (Variational Autoencoder)

अंग्रेज़ी से अनुवादित

वैरिएशनल ऑटोएनकोडर (VAE) एक जनरेटिव कृत्रिम तंत्रिका नेटवर्क है जो एक प्रायिक अव्यक्त स्थान सीखता है, जिसे 2013 में डिडेरिक पी. किंग्मा और मैक्स वेलिंग द्वारा प्रस्तुत किया गया था। यह डेटा वितरणों को मॉडल करने के लिए एक एनकोडर और डिकोडर को जोड़ता है, जैसे कि छवि निर्माण जैसे कार्यों के लिए।

एक वैरिएशनल ऑटोएन्कोडर (VAE) एक कृत्रिम तंत्रिका नेटवर्क वास्तुकला है जिसे 2013 में डिडेरिक पी. किंग्मा और मैक्स वेलिंग द्वारा प्रस्तुत किया गया था। यह संभाव्य चित्रात्मक मॉडलों और वैरिएशनल बायेसियन विधियों के परिवारों से संबंधित है। एक ऑटोएन्कोडर वास्तुकला होने के अलावा, एक VAE का अध्ययन वैरिएशनल बायेसियन विधियों के गणितीय सूत्रीकरण के भीतर किया जा सकता है, जो एक तंत्रिका एन्कोडर नेटवर्क को उसके डिकोडर से एक संभाव्य अव्यक्त स्थान के माध्यम से जोड़ता है, जैसे कि एक बहुचर गाऊसी वितरण, जो एक वैरिएशनल वितरण के मापदंडों के अनुरूप होता है।

एन्कोडर एक बड़े जटिल डेटासेट, जैसे कि एक छवि, से प्रत्येक बिंदु को अव्यक्त स्थान के भीतर एक वितरण में मैप करता है, न कि एकल बिंदु पर। डिकोडर विपरीत कार्य करता है, अव्यक्त स्थान से इनपुट स्थान तक एक वितरण के अनुसार मैप करता है, हालांकि व्यवहार में डिकोडिंग के दौरान शोर शायद ही कभी जोड़ा जाता है। एक बिंदु को एकल बिंदु के बजाय एक वितरण में मैप करके, नेटवर्क प्रशिक्षण डेटा को अतिअनुकूलित (overfit) करने से बच सकता है। दोनों नेटवर्क आमतौर पर पुनर्मापदीकरण चाल (reparameterization trick) का उपयोग करके एक साथ प्रशिक्षित किए जाते हैं, हालांकि शोर मॉडल का विचरण अलग से सीखा जा सकता है। हालांकि शुरू में अपर्यवेक्षित शिक्षण के लिए डिज़ाइन किया गया था, यह मॉडल अर्ध-पर्यवेक्षित और पर्यवेक्षित शिक्षण के लिए प्रभावी साबित हुआ है।

वास्तुकला और संचालन

एक VAE एक जनरेटिव मॉडल है जिसमें एक पूर्व (prior) और शोर वितरण होता है। ऐसे मॉडल अक्सर अपेक्षा-अधिकतमीकरण मेटा-एल्गोरिदम का उपयोग करके प्रशिक्षित किए जाते हैं, जैसा कि संभाव्य PCA या स्पार्स कोडिंग के साथ होता है। यह योजना डेटा संभावना की एक निचली सीमा को अनुकूलित करती है, जो आमतौर पर संगणकीय रूप से दुर्गम होती है, और q-वितरण, या वैरिएशनल पश्च (posteriors) की खोज की आवश्यकता होती है। ये q-वितरण सामान्यतः प्रत्येक व्यक्तिगत डेटा बिंदु के लिए एक अलग अनुकूलन प्रक्रिया में पैरामीट्रिज़ किए जाते हैं। हालांकि, VAE एक तंत्रिका नेटवर्क का उपयोग एक परिशोधित (amortized) दृष्टिकोण के रूप में करते हैं ताकि डेटा बिंदुओं में संयुक्त रूप से अनुकूलन किया जा सके, कई डेटा बिंदुओं के लिए समान मापदंडों का पुन: उपयोग करके और भारी मेमोरी बचत प्राप्त की जा सके। पहला तंत्रिका नेटवर्क, जिसे एन्कोडर कहा जाता है, डेटा बिंदुओं को इनपुट के रूप में लेता है और वैरिएशनल वितरण के लिए मापदंड आउटपुट करता है, जो एक ज्ञात इनपुट स्थान से निम्न-आयामी अव्यक्त स्थान तक मैप करता है।

डिकोडर दूसरा तंत्रिका नेटवर्क है, जो अव्यक्त स्थान से इनपुट स्थान तक मैप करता है, उदाहरण के लिए शोर वितरण के माध्य के रूप में। विचरण के लिए मैप करने के लिए एक और तंत्रिका नेटवर्क का उपयोग करना संभव है, लेकिन सरलता के लिए इसे छोड़ा जा सकता है; ऐसे मामले में, विचरण को ग्रेडिएंट डिसेंट के साथ अनुकूलित किया जा सकता है।

मॉडल को अनुकूलित करने के लिए, दो शब्दों की आवश्यकता होती है: पुनर्निर्माण त्रुटि और कुल्बैक-लीब्लर विचलन (KL-D)। दोनों शब्द संभाव्य मॉडल की मुक्त ऊर्जा अभिव्यक्ति से प्राप्त होते हैं और शोर वितरण और डेटा के माने गए पूर्व के आधार पर भिन्न होते हैं, जिसे p-वितरण कहा जाता है। उदाहरण के लिए, IMAGENET जैसा एक मानक VAE कार्य आमतौर पर गाऊसी शोर मानता है, जबकि बाइनरीकृत MNIST जैसे कार्यों के लिए बर्नौली शोर की आवश्यकता होती है। KL-D शब्द q-वितरण के संभाव्य द्रव्यमान को अधिकतम करता है जो p-वितरण के साथ ओवरलैप होता है, जिसके परिणामस्वरूप मोड-खोज व्यवहार हो सकता है। पुनर्निर्माण शब्द मुक्त ऊर्जा अभिव्यक्ति का शेष भाग है और इसके अपेक्षा मान की गणना करने के लिए एक नमूनाकरण सन्निकटन की आवश्यकता होती है। हाल के दृष्टिकोण KL-D को विभिन्न सांख्यिकीय दूरियों से प्रतिस्थापित करते हैं।

सूत्रीकरण

संभाव्य मॉडलिंग के दृष्टिकोण से, कोई अपने चुने हुए पैरामीट्रीकृत संभाव्य वितरण p_θ(x) = p(x|θ) द्वारा डेटा x की संभावना को अधिकतम करना चाहता है। यह वितरण आमतौर पर एक गाऊसी N(x|μ, σ) चुना जाता है, जो μ और σ द्वारा पैरामीट्रीकृत होता है, और घातांकीय परिवार के सदस्य के रूप में शोर वितरण के रूप में काम करना आसान होता है। सरल वितरण को अधिकतम करना आसान होता है, लेकिन अव्यक्त z पर पूर्व वाले वितरण के परिणामस्वरूप दुर्गम समाकलन होते हैं। p_θ(x) खोजने के लिए, कोई z पर सीमांकन करता है:

p_θ(x) = ∫_z p_θ(x, z) dz,

जहाँ p_θ(x, z) अवलोकनीय डेटा x और उसके अव्यक्त प्रतिनिधित्व z का p_θ के अंतर्गत संयुक्त वितरण है। श्रृंखला नियम द्वारा, इसे p_θ(x) = ∫_z p_θ(x|z) p_θ(z) dz के रूप में फिर से लिखा जा सकता है।

यह समाकलन आमतौर पर दुर्गम होता है, इसलिए VAE पश्च p_θ(z|x) का अनुमान लगाने के लिए एक वैरिएशनल वितरण q_φ(z|x) के साथ एक एन्कोडर नेटवर्क प्रस्तुत करता है। प्रशिक्षण उद्देश्य साक्ष्य निचली सीमा (ELBO) है, जो पुनर्निर्माण शब्द और KL विचलन को जोड़ता है, और पुनर्मापदीकरण चाल का उपयोग करके स्टोकेस्टिक ग्रेडिएंट डिसेंट के माध्यम से अनुकूलित किया जाता है।

प्रशिक्षण और पुनर्मापदीकरण चाल

पुनर्मापदीकरण चाल VAE को प्रशिक्षित करने के लिए एक प्रमुख तकनीक है। यह स्टोकेस्टिक नमूनाकरण के माध्यम से बैकप्रोपेगेशन की अनुमति देता है, अव्यक्त चर z को इनपुट और एक शोर चर के नियतात्मक फलन के रूप में व्यक्त करके। गाऊसी अव्यक्त स्थान के लिए, z को z = μ + σ ⊙ ε के रूप में नमूना किया जाता है, जहाँ ε एक मानक सामान्य वितरण से खींचा जाता है। यह ELBO के ग्रेडिएंट को एन्कोडर और डिकोडर मापदंडों के संबंध में गणना योग्य बनाता है।

एन्कोडर वैरिएशनल वितरण के माध्य μ और विचरण σ को आउटपुट करता है, और डिकोडर नमूना किए गए z से इनपुट का पुनर्निर्माण करता है। पुनर्निर्माण त्रुटि मापती है कि डिकोडर इनपुट का कितनी अच्छी तरह से पुनर्निर्माण करता है, जबकि KL विचरण अव्यक्त स्थान को पूर्व, आमतौर पर एक मानक सामान्य वितरण, से मिलाने के लिए नियमित करता है। यह संतुलन एक चिकने, निरंतर अव्यक्त स्थान को प्रोत्साहित करता है जिसे उत्पादन के लिए नमूना किया जा सकता है।

अनुप्रयोग और प्रकार

VAE को Generative AI में छवि निर्माण, विसंगति का पता लगाने और प्रतिनिधित्व सीखने के लिए व्यापक रूप से लागू किया गया है। इनका उपयोग अर्ध-पर्यवेक्षित शिक्षण में भी किया जाता है, जहाँ अव्यक्त स्थान वर्गीकरण के लिए सार्थक विशेषताओं को पकड़ सकता है। प्रकारों में बीटा-VAE शामिल है, जो असंबद्ध प्रतिनिधित्व को प्रोत्साहित करने के लिए KL शब्द को भारित करता है, और VQ-VAE, जो असतत अव्यक्त कोड का उपयोग करता है। सांख्यिकीय दूरी VAE प्रकार KL-D को अन्य दूरियों से प्रतिस्थापित करते हैं ताकि मजबूती या नमूना गुणवत्ता में सुधार हो सके।

जनरेटिव प्रतिकूल नेटवर्क (GAN) जैसे अन्य जनरेटिव मॉडल की तुलना में, VAE स्थिर प्रशिक्षण और एक सैद्धांतिक संभाव्य ढांचा प्रदान करते हैं, लेकिन अक्सर धुंधले नमूने उत्पन्न करते हैं। वे Deep learning वास्तुकलाओं से भी संबंधित हैं और Machine learning में एक मौलिक विषय हैं। मॉडल को कई तरीकों से विस्तारित किया गया है, जिसमें सशर्त VAE और पदानुक्रमित VAE शामिल हैं, और यह Artificial intelligence में अनुसंधान का एक सक्रिय क्षेत्र बना हुआ है।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:generative-models·neural-networks·probabilistic-models·machine-learning
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास