अंग्रेज़ी से अनुवादित

एक वैरिएशनल ऑटोएन्कोडर (VAE) एक कृत्रिम तंत्रिका नेटवर्क वास्तुकला है जिसे 2013 में डिडेरिक पी. किंगमा और मैक्स वेलिंग द्वारा प्रस्तुत किया गया था, जिसका उपयोग प्रायिक अव्यक्त स्थानों और वैरिएशनल बायेसियन विधियों के माध्यम से जनरेटिव मॉडलिंग के लिए किया जाता है।

एक वैरिएशनल ऑटोएनकोडर (VAE) एक कृत्रिम तंत्रिका नेटवर्क वास्तुकला है जिसे 2013 में डीडेरिक पी. किंगमा और मैक्स वेलिंग द्वारा प्रस्तुत किया गया था। यह संभाव्य ग्राफिकल मॉडल और वैरिएशनल बायेसियन विधियों के परिवारों का हिस्सा है। ऑटोएनकोडर तंत्रिका नेटवर्क वास्तुकला के रूप में देखे जाने के अलावा, वैरिएशनल ऑटोएनकोडर का अध्ययन वैरिएशनल बायेसियन विधियों के गणितीय सूत्रीकरण के भीतर भी किया जा सकता है, जो एक तंत्रिका एनकोडर नेटवर्क को उसके डिकोडर से एक संभाव्य अव्यक्त स्थान (उदाहरण के लिए, एक बहुचर गाऊसी वितरण के रूप में) के माध्यम से जोड़ता है जो एक वैरिएशनल वितरण के मापदंडों के अनुरूप होता है।

एनकोडर एक बड़े जटिल डेटासेट से प्रत्येक बिंदु (जैसे एक छवि) को अव्यक्त स्थान में एक वितरण में मैप करता है, न कि उस स्थान में एक एकल बिंदु पर। डिकोडर का विपरीत कार्य होता है, जो अव्यक्त स्थान से इनपुट स्थान तक मैप करना है, फिर से एक वितरण के अनुसार (हालांकि व्यवहार में, डिकोडिंग चरण के दौरान शोर शायद ही कभी जोड़ा जाता है)। एक बिंदु को एक एकल बिंदु के बजाय एक वितरण में मैप करके, नेटवर्क प्रशिक्षण डेटा को ओवरफिट करने से बच सकता है। दोनों नेटवर्क आमतौर पर रिपैरामीटराइज़ेशन ट्रिक के उपयोग के साथ एक साथ प्रशिक्षित किए जाते हैं, हालांकि शोर मॉडल के विचरण को अलग से सीखा जा सकता है। हालांकि इस प्रकार का मॉडल शुरू में अनुपरीक्षित शिक्षण के लिए डिज़ाइन किया गया था, अर्ध-पर्यवेक्षित शिक्षण और पर्यवेक्षित शिक्षण के लिए इसकी प्रभावशीलता सिद्ध हो चुकी है।

वास्तुकला और संचालन का अवलोकन

एक वैरिएशनल ऑटोएनकोडर एक जनरेटिव मॉडल है जिसमें क्रमशः एक पूर्व और शोर वितरण होता है। आमतौर पर ऐसे मॉडलों को अपेक्षा-अधिकतमीकरण मेटा-एल्गोरिदम (जैसे, संभाव्य PCA, स्पार्स कोडिंग) का उपयोग करके प्रशिक्षित किया जाता है। ऐसी योजना डेटा संभावना की एक निचली सीमा को अनुकूलित करती है, जो आमतौर पर कम्प्यूटेशनल रूप से दुर्गम होती है, और ऐसा करने में q-वितरण, या वैरिएशनल पोस्टीरियर की खोज की आवश्यकता होती है। ये q-वितरण सामान्यतः एक अलग अनुकूलन प्रक्रिया में प्रत्येक व्यक्तिगत डेटा बिंदु के लिए पैरामीटराइज़ किए जाते हैं। हालांकि, वैरिएशनल ऑटोएनकोडर एक परिशोधित दृष्टिकोण के रूप में एक तंत्रिका नेटवर्क का उपयोग करते हैं ताकि डेटा बिंदुओं में संयुक्त रूप से अनुकूलन किया जा सके। इस तरह, एक ही पैरामीटर कई डेटा बिंदुओं के लिए पुन: उपयोग किए जाते हैं, जिसके परिणामस्वरूप बड़ी मेमोरी बचत हो सकती है। पहला तंत्रिका नेटवर्क इनपुट के रूप में डेटा बिंदुओं को लेता है, और वैरिएशनल वितरण के लिए पैरामीटर आउटपुट करता है। चूंकि यह एक ज्ञात इनपुट स्थान से निम्न-आयामी अव्यक्त स्थान तक मैप करता है, इसे एनकोडर कहा जाता है।

डिकोडर इस मॉडल का दूसरा तंत्रिका नेटवर्क है। यह एक फ़ंक्शन है जो अव्यक्त स्थान से इनपुट स्थान तक मैप करता है, उदाहरण के लिए, शोर वितरण के साधन के रूप में। एक और तंत्रिका नेटवर्क का उपयोग करना संभव है जो विचरण के लिए मैप करता है, हालांकि सरलता के लिए इसे छोड़ा जा सकता है। ऐसे मामले में, विचरण को ग्रेडिएंट डिसेंट के साथ अनुकूलित किया जा सकता है।

इस मॉडल को अनुकूलित करने के लिए, किसी को दो शब्दों को जानना होगा: "पुनर्निर्माण त्रुटि", और कुलबैक-लीब्लर विचलन (KL-D)। दोनों शब्द संभाव्य मॉडल की मुक्त ऊर्जा अभिव्यक्ति से प्राप्त होते हैं, और इसलिए शोर वितरण और डेटा के माने गए पूर्व के आधार पर भिन्न होते हैं, जिसे यहां p-वितरण कहा जाता है। उदाहरण के लिए, IMAGENET जैसा एक मानक VAE कार्य आमतौर पर गाऊसी रूप से वितरित शोर माना जाता है; हालांकि, बाइनरीकृत MNIST जैसे कार्यों के लिए बर्नौली शोर की आवश्यकता होती है। मुक्त ऊर्जा अभिव्यक्ति से KL-D q-वितरण की संभावना द्रव्यमान को अधिकतम करता है जो p-वितरण के साथ ओवरलैप होता है, जो दुर्भाग्य से मोड-खोज व्यवहार का परिणाम हो सकता है। "पुनर्निर्माण" शब्द मुक्त ऊर्जा अभिव्यक्ति का शेष है, और इसके अपेक्षा मूल्य की गणना करने के लिए एक नमूनाकरण सन्निकटन की आवश्यकता होती है।

हाल के दृष्टिकोण कुलबैक-लीब्लर विचलन (KL-D) को विभिन्न सांख्यिकीय दूरियों के साथ बदलते हैं, नीचे "सांख्यिकीय दूरी VAE प्रकार" देखें।

सूत्रीकरण

संभाव्य मॉडलिंग के दृष्टिकोण से, कोई अपने चुने हुए पैरामीटरयुक्त संभाव्यता वितरण \(p_\theta(x)=p(x|\theta)\) द्वारा डेटा \(x\) की संभावना को अधिकतम करना चाहता है। यह वितरण आमतौर पर एक गाऊसी \(N(x|\mu,\sigma)\) चुना जाता है जो क्रमशः \(\mu\) और \(\sigma\) द्वारा पैरामीटरयुक्त होता है, और घातीय परिवार के सदस्य के रूप में शोर वितरण के रूप में काम करना आसान होता है। सरल वितरण अधिकतम करने के लिए पर्याप्त आसान होते हैं, हालांकि जहां अव्यक्त \(z\) पर एक पूर्व माना जाता है, वहां वितरण दुर्गम इंटीग्रल में परिणाम देते हैं। आइए \(z\) पर मार्जिनलाइज़ करके \(p_\theta(x)\) खोजें।

\(p_\theta(x) = \int_z p_\theta({x,z}) \, dz,\)

जहां \(p_\theta({x,z})\) \(p_\theta\) के तहत अवलोकनीय डेटा \(x\) और इसके अव्यक्त प्रतिनिधित्व या एन्कोडिंग \(z\) के संयुक्त वितरण का प्रतिनिधित्व करता है। श्रृंखला नियम के अनुसार, समीकरण को फिर से लिखा जा सकता है

\(p_\theta(x) = \int_z p_\theta({x|z}) p_\theta(z) \, dz.\)

व्यवहार में, \(z\) पर इंटीग्रल दुर्गम है क्योंकि अव्यक्त स्थान उच्च-आयामी है और सच्चा पोस्टीरियर \(p_\theta(z|x)\) अज्ञात है। VAE सच्चे पोस्टीरियर का अनुमान लगाने के लिए एक एनकोडर नेटवर्क \(q_\phi(z|x)\) पेश करता है, और डेटा का पुनर्निर्माण करने के लिए एक डिकोडर नेटवर्क \(p_\theta(x|z)\) पेश करता है। प्रशिक्षण उद्देश्य साक्ष्य निचली सीमा (ELBO) है, जो पुनर्निर्माण शब्द और KL विचलन शब्द का योग है। रिपैरामीटराइज़ेशन ट्रिक \(z\) को \(z = \mu + \sigma \odot \epsilon\) के रूप में व्यक्त करके नमूनाकरण प्रक्रिया के माध्यम से बैकप्रोपेगेशन की अनुमति देता है, जहां \(\epsilon\) एक मानक सामान्य वितरण से नमूना लिया जाता है।

प्रशिक्षण और अनुकूलन

VAE को पैरामीटर \(\theta\) और \(\phi\) के संबंध में ELBO को अधिकतम करके प्रशिक्षित किया जाता है। पुनर्निर्माण शब्द डिकोडर को इनपुट डेटा को सटीक रूप से पुनर्निर्माण करने के लिए प्रोत्साहित करता है, जबकि KL विचलन शब्द अव्यक्त स्थान को पूर्व (आमतौर पर एक मानक सामान्य वितरण) के करीब होने के लिए नियमित करता है। यह संतुलन ओवरफिटिंग को रोकने में मदद करता है और पूर्व से नमूनाकरण और डिकोडिंग द्वारा नए डेटा बिंदुओं के निर्माण को सक्षम बनाता है।

स्टोकेस्टिक ग्रेडिएंट डिसेंट का उपयोग करके कुशल प्रशिक्षण के लिए रिपैरामीटराइज़ेशन ट्रिक महत्वपूर्ण है। स्टोकेस्टिकता को शोर चर \(\epsilon\) में स्थानांतरित करके, ग्रेडिएंट नेटवर्क के नियतात्मक भागों के माध्यम से प्रवाहित हो सकते हैं। शोर मॉडल के विचरण को अलग से सीखा जा सकता है, और पुनर्निर्माण त्रुटि की गणना अक्सर निरंतर डेटा के लिए माध्य वर्ग त्रुटि या बाइनरी डेटा के लिए बाइनरी क्रॉस-एन्ट्रॉपी का उपयोग करके की जाती है।

अनुप्रयोग और प्रभाव

VAE Generative AI में एक आधारभूत मॉडल बन गया है, जो छवि निर्माण, विसंगति का पता लगाने और प्रतिनिधित्व शिक्षण जैसे कार्यों को सक्षम बनाता है। इसे Deep learning और Machine learning सहित विभिन्न डोमेन में विस्तारित किया गया है, और Large language model जैसे अन्य जनरेटिव मॉडल के विकास को प्रभावित किया है, हालांकि वे आमतौर पर विभिन्न वास्तुकला का उपयोग करते हैं। VAEs का उपयोग अर्ध-पर्यवेक्षित और पर्यवेक्षित शिक्षण सेटिंग्स में भी किया जाता है, जो अनुपरीक्षित शिक्षण से परे उनकी बहुमुखी प्रतिभा को प्रदर्शित करता है।

किंगमा और वेलिंग का मूल पेपर अत्यधिक प्रभावशाली रहा है, और VAE ढांचे को कई तरीकों से अनुकूलित किया गया है, जैसे कि मोड पतन को संबोधित करने के लिए KL विचलन के बजाय विभिन्न सांख्यिकीय दूरियों का उपयोग करना। मॉडल की चिकनी अव्यक्त स्थान सीखने की क्षमता ने इसे डेटा विशेषताओं के प्रक्षेप और हेरफेर के लिए उपयोगी बना दिया है।

प्रकार और विस्तार

VAEs के कई प्रकार उनके प्रदर्शन को बेहतर बनाने के लिए प्रस्तावित किए गए हैं। उदाहरण के लिए, बीटा-VAE अधिक अलग-अलग प्रतिनिधित्व को प्रोत्साहित करने के लिए KL विचलन शब्द पर एक भार कारक पेश करता है। अन्य प्रकार विभिन्न पूर्व का उपयोग करते हैं, जैसे गाऊसी मिश्रण मॉडल, या उत्पन्न नमूनों की यथार्थता में सुधार के लिए प्रतिकूल प्रशिक्षण नियोजित करते हैं। रिपैरामीटराइज़ेशन ट्रिक को गम्बेल-सॉफ्टमैक्स सन्निकटन का उपयोग करके श्रेणीबद्ध चर जैसे अन्य वितरणों के लिए भी सामान्यीकृत किया गया है।

Artificial intelligence के संदर्भ में, VAEs की तुलना अक्सर जनरेटिव एडवरसैरियल नेटवर्क (GANs) से की जाती है, जो जनरेटिव मॉडल का एक और वर्ग है। जबकि GANs तेज छवियां उत्पन्न कर सकते हैं, VAEs प्रशिक्षित करने के लिए अधिक स्थिर होते हैं और एक संभाव्य ढांचा प्रदान करते हैं जो अनिश्चितता अनुमान के लिए उपयोगी है। 2020 के दशक की शुरुआत तक, VAEs अनुसंधान का एक सक्रिय क्षेत्र बना हुआ है, जिसमें Neural network में अनुप्रयोग हैं।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:variational-autoencoder·generative-model·machine-learning·deep-learning
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास