अंग्रेज़ी से अनुवादित

एक variational autoencoder (VAE) एक जनरेटिव न्यूरल नेटवर्क आर्किटेक्चर है, जिसे 2013 में Diederik P. Kingma और Max Welling द्वारा प्रस्तुत किया गया था, जो डेटा के अव्यक्त प्रतिनिधित्व सीखने के लिए संभाव्य ग्राफिकल मॉडल को variational Bayesian विधियों के साथ जोड़ता है।

एक वैरिएशनल ऑटोएनकोडर (VAE) एक कृत्रिम तंत्रिका नेटवर्क वास्तुकला है जिसे डिडिएरिक पी. किंगमा और मैक्स वेलिंग ने 2013 में प्रस्तुत किया था। यह संभाव्य चित्रात्मक मॉडल और वैरिएशनल बायेसियन विधियों के परिवारों से संबंधित है। VAE जनरेटिव मॉडल हैं जो इनपुट डेटा को संभाव्य अव्यक्त स्थान में एनकोड करना और उस स्थान से नमूनों को मूल डेटा डोमेन में वापस डिकोड करना सीखते हैं, जिससे डेटा जनरेशन, डीनॉइज़िंग और प्रतिनिधित्व अध्ययन जैसे कार्य संभव होते हैं।

वास्तुकला में दो तंत्रिका नेटवर्क शामिल हैं: एक एनकोडर और एक डिकोडर। एनकोडर प्रत्येक डेटा बिंदु (जैसे एक छवि) को एक बड़े जटिल डेटासेट से अव्यक्त स्थान में एक वितरण के रूप में मैप करता है, न कि एकल बिंदु के रूप में। यह वितरण आमतौर पर एक बहुचर गाऊसी होता है, जो माध्य और भिन्नता द्वारा पैरामीटराइज़ किया जाता है। डिकोडर विपरीत कार्य करता है, अव्यक्त स्थान से इनपुट स्थान पर वापस मैप करता है, फिर से एक वितरण के अनुसार, हालांकि व्यवहार में डिकोडिंग के दौरान शोर शायद ही कभी जोड़ा जाता है। एकल बिंदु के बजाय वितरण में मैप करके, नेटवर्क प्रशिक्षण डेटा पर अति-अनुकूलन से बचता है। दोनों नेटवर्क आमतौर पर पुनर्पैरामीटराइज़ेशन ट्रिक का उपयोग करके एक साथ प्रशिक्षित किए जाते हैं, हालांकि शोर मॉडल की भिन्नता को अलग से सीखा जा सकता है।

वास्तुकला और संचालन का अवलोकन

एक वैरिएशनल ऑटोएनकोडर एक जनरेटिव मॉडल है जिसमें एक पूर्व और शोर वितरण होता है। इस प्रकार के पारंपरिक मॉडल को अपेक्षा-अधिकतमीकरण मेटा-एल्गोरिदम का उपयोग करके प्रशिक्षित किया जाता है, जैसे संभाव्य PCA या विरल कोडिंग। ये योजनाएं डेटा संभावना की एक निचली सीमा को अनुकूलित करती हैं, जो आमतौर पर कम्प्यूटेशनल रूप से कठिन होती है, और q-वितरण या वैरिएशनल पोस्टीरियर की खोज की आवश्यकता होती है। ये q-वितरण सामान्यतः प्रत्येक व्यक्तिगत डेटा बिंदु के लिए एक अलग अनुकूलन प्रक्रिया में पैरामीटराइज़ किए जाते हैं।

VAE इसके बजाय एक तंत्रिका नेटवर्क का उपयोग एक परिशोधित दृष्टिकोण के रूप में करते हैं ताकि डेटा बिंदुओं पर संयुक्त रूप से अनुकूलन किया जा सके। समान पैरामीटर कई डेटा बिंदुओं के लिए पुनः उपयोग किए जाते हैं, जिसके परिणामस्वरूप बड़ी मेमोरी बचत होती है। पहला तंत्रिका नेटवर्क डेटा बिंदुओं को इनपुट लेता है और वैरिएशनल वितरण के लिए पैरामीटर उत्पन्न करता है। चूंकि यह एक ज्ञात इनपुट स्थान से निम्न-आयामी अव्यक्त स्थान में मैप करता है, इसे एनकोडर कहा जाता है। डिकोडर दूसरा तंत्रिका नेटवर्क है, जो अव्यक्त स्थान से इनपुट स्थान में मैप करता है, उदाहरण के लिए शोर वितरण के माध्य के रूप में। भिन्नता के लिए मैप करने के लिए एक और तंत्रिका नेटवर्क का उपयोग करना संभव है, लेकिन सरलता के लिए इसे छोड़ा जा सकता है, भिन्नता को ग्रेडिएंट डीसेंट के माध्यम से अनुकूलित किया जाता है।

मॉडल को अनुकूलित करने के लिए दो शब्दों की आवश्यकता होती है: पुनर्निर्माण त्रुटि और कुल्बैक-लीब्लर विचलन (KL-D)। दोनों संभाव्य मॉडल की मुक्त ऊर्जा अभिव्यक्ति से प्राप्त होते हैं और शोर वितरण और डेटा के माने गए पूर्व के आधार पर भिन्न होते हैं। उदाहरण के लिए, एक मानक VAE कार्य जैसे IMAGENET आमतौर पर गाऊसी शोर मानता है, जबकि बाइनरीकृत MNIST जैसे कार्यों में बर्नौली शोर की आवश्यकता होती है। KL-D शब्द q-वितरण के संभाव्य द्रव्यमान को अधिकतम करता है जो p-वितरण के साथ ओवरलैप करता है, जिसके परिणामस्वरूप मोड-खोज व्यवहार हो सकता है। पुनर्निर्माण शब्द मुक्त ऊर्जा अभिव्यक्ति का शेष है और इसकी अपेक्षा मूल्य की गणना करने के लिए नमूनाकरण सन्निकटन की आवश्यकता होती है। हाल के दृष्टिकोण KL-D को विभिन्न सांख्यिकीय दूरियों के साथ प्रतिस्थापित करते हैं।

सूत्रीकरण

संभाव्य मॉडलिंग के दृष्टिकोण से, लक्ष्य एक चुने हुए पैरामीटराइज़्ड संभाव्य वितरण p_θ(x) = p(x|θ) के तहत डेटा x की संभावना को अधिकतम करना है। यह वितरण आमतौर पर एक गाऊसी N(x|μ, σ) के रूप में चुना जाता है, जो μ और σ द्वारा पैरामीटराइज़ होता है, और घातीय परिवार के सदस्य के रूप में काम करना आसान होता है। सरल वितरण को अधिकतम करना आसान होता है, लेकिन अव्यक्त z पर पूर्व वाले वितरण कठिन इंटीग्रल में परिणामित होते हैं। संभावना p_θ(x) z पर मार्जिनलाइज़ करके पाई जाती है:

p_θ(x) = ∫ p_θ(x, z) dz,

जहां p_θ(x, z) अवलोकनीय डेटा x और अव्यक्त एनकोडिंग z का संयुक्त वितरण है। श्रृंखला नियम से, यह बन जाता है:

p_θ(x) = ∫ p_θ(x|z) p_θ(z) dz।

यह इंटीग्रल आमतौर पर कठिन होता है, इसलिए वैरिएशनल इंफेरेंस का उपयोग किया जाता है। एनकोडर नेटवर्क वास्तविक पोस्टीरियर p_θ(z|x) का अनुमान एक वैरिएशनल वितरण q_φ(z|x) के साथ लगाता है, जो आमतौर पर एक गाऊसी होता है। डिकोडर p_θ(x|z) को मॉडल करता है। प्रशिक्षण साक्ष्य निचली सीमा (ELBO) को अनुकूलित करता है, जो पुनर्निर्माण सटीकता और पूर्व की ओर नियमितीकरण को संतुलित करता है।

पुनर्पैरामीटराइज़ेशन ट्रिक

पुनर्पैरामीटराइज़ेशन ट्रिक बैकप्रोपेगेशन के साथ VAE को प्रशिक्षित करने के लिए एक महत्वपूर्ण तकनीक है। एनकोडर के आउटपुट वितरण q_φ(z|x) से नमूनाकरण अवकलनीय नहीं है, जो ग्रेडिएंट प्रवाह को रोकता है। यह ट्रिक अव्यक्त चर को z = μ + σ ⊙ ε के रूप में व्यक्त करती है, जहां ε एक मानक सामान्य वितरण N(0, I) से नमूना लिया जाता है। यह स्टोकेस्टिक भाग (ε) को निर्धारक पैरामीटर (μ और σ) से अलग करता है, जिससे ग्रेडिएंट नेटवर्क के माध्यम से प्रवाहित हो सकते हैं। यह ट्रिक 2013 में VAE के साथ पेश की गई थी और वैरिएशनल डीप लर्निंग में मानक बन गई है।

ELBO और हानि फलन

प्रशिक्षण उद्देश्य साक्ष्य निचली सीमा (ELBO) है, जो मुक्त ऊर्जा अभिव्यक्ति से प्राप्त होता है। ELBO में दो शब्द होते हैं: पुनर्निर्माण शब्द और KL विचलन शब्द। पुनर्निर्माण शब्द, E_{q_φ(z|x)}[log p_θ(x|z)], मापता है कि डिकोडर अव्यक्त नमूने से इनपुट को कितनी अच्छी तरह पुनर्निर्माण करता है। KL शब्द, D_KL(q_φ(z|x) || p(z)), एनकोडर को नियमित करता है, पूर्व p(z) से विचलन को दंडित करके, जो आमतौर पर एक मानक गाऊसी होता है। कुल हानि नकारात्मक ELBO है, जिसे ग्रेडिएंट डीसेंट के माध्यम से न्यूनतम किया जाता है। KL शब्द अव्यक्त स्थान को चिकनी और सतत बनाने के लिए प्रोत्साहित करता है, जबकि पुनर्निर्माण शब्द डेटा के प्रति निष्ठा सुनिश्चित करता है।

अनुप्रयोग और विस्तार

हालांकि शुरुआत में अनुपरिचालित अध्ययन के लिए डिज़ाइन किया गया था, VAE अर्ध-परिचालित और परिचालित अध्ययन के लिए प्रभावी साबित हुए हैं। इनका उपयोग छवि जनरेशन, विसंगति का पता लगाने, दवा खोज और प्रतिनिधित्व अध्ययन में किया जाता है। विविधताओं में सशर्त VAE (CVAE) शामिल हैं, जो अतिरिक्त इनपुट पर सशर्त होते हैं, और बीटा-VAE, जो अलग-अलग प्रतिनिधित्व के लिए KL शब्द को भारित करते हैं। हाल के कार्यों ने मोड पतन को संबोधित करने और नमूना गुणवत्ता में सुधार के लिए KL-D को अन्य सांख्यिकीय दूरियों के साथ प्रतिस्थापित किया है। VAE Generative AI में Large language model जैसे अन्य मॉडलों के साथ मौलिक हैं, हालांकि वे वास्तुकला और अनुप्रयोग में भिन्न हैं।

अन्य मॉडलों से संबंध

VAE व्यापक Deep learning परिदृश्य का हिस्सा हैं, जो Neural network वास्तुकलाओं जैसे Residual Network (ResNet) और U-Net से संबंधित हैं। वे Encoder-Decoder Architecture मॉडलों और Sequence-to-Sequence (Seq2Seq) ढांचे के साथ अवधारणात्मक संबंध साझा करते हैं, हालांकि VAE संभाव्य अव्यक्त स्थानों पर ध्यान केंद्रित करते हैं। Transformer (architecture)-आधारित मॉडलों के विपरीत जो Artificial intelligence प्रणालियों जैसे OpenAI के GPT श्रृंखला में उपयोग किए जाते हैं, VAE आमतौर पर छोटे होते हैं और सतत डेटा के लिए उपयोग किए जाते हैं। MIT CSAIL और Stanford AI Lab जैसे संस्थानों में अनुसंधान ने VAE सिद्धांत को आगे बढ़ाया है, जबकि Google DeepMind और Amazon Web Services जैसी कंपनियों ने उत्पादन प्रणालियों में इन्हें लागू किया है।

सीमाएं और भविष्य की दिशाएं

VAE अक्सर जनरेटिव एडवर्सेरियल नेटवर्क (GAN) की तुलना में धुंधले नमूने उत्पन्न करते हैं, जो गाऊसी शोर धारणा और KL नियमितीकरण के कारण होता है। मोड पतन तब हो सकता है जब मॉडल डेटा वितरण के कुछ मोड पर ध्यान केंद्रित करता है। हाल की प्रगति पदानुक्रमित VAE, सामान्यीकरण प्रवाह और वैकल्पिक विचलन माप के माध्यम से इन मुद्दों को संबोधित करती है। 2020 के दशक के मध्य तक, VAE एक सक्रिय अनुसंधान क्षेत्र बना हुआ है, जिसमें Machine learning और Generative AI में नमूना गुणवत्ता और मापनीयता में सुधार के लिए निरंतर कार्य चल रहा है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:generative-models·variational-bayesian-methods·neural-network-architectures·unsupervised-learning
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास