"Auto-Encoding Variational Bayes" नामक शोधपत्र, जो 2013 में डिडेरिक पी. किंगमा और मैक्स वेलिंग द्वारा प्रकाशित किया गया था, ने वैरिएशनल ऑटोएनकोडर (VAE) को प्रस्तुत किया, जो एक कृत्रिम तंत्रिका नेटवर्क वास्तुकला है और जनरेटिव मॉडलिंग की आधारशिला बन गई। इस कार्य ने Deep learning और संभाव्य ग्राफिकल मॉडल के बीच सेतु का काम किया, जो एक अव्यक्त स्थान के माध्यम से जटिल डेटा वितरण सीखने के लिए एक स्केलेबल विधि प्रदान करता है। इसे Generative AI में एक मौलिक योगदान के रूप में मान्यता प्राप्त है और इसने Machine learning और Artificial intelligence में बाद के विकास को प्रभावित किया।
एक वैरिएशनल ऑटोएनकोडर में दो तंत्रिका नेटवर्क होते हैं: एक एनकोडर और एक डिकोडर। एनकोडर प्रत्येक इनपुट डेटा बिंदु, जैसे कि एक छवि, को एकल बिंदु के बजाय एक निम्न-आयामी अव्यक्त स्थान में संभाव्यता वितरण में मैप करता है। यह वितरण आमतौर पर एक बहुचर गाऊसी होता है, जो माध्य और विचरण वैक्टर द्वारा पैरामीटराइज़ किया जाता है। डिकोडर उलटा मैपिंग करता है, अव्यक्त स्थान से वापस इनपुट स्थान तक, फिर से एक वितरण का पालन करते हुए, हालांकि व्यवहार में डिकोडिंग के दौरान शोर शायद ही कभी जोड़ा जाता है। इनपुट को वितरण के रूप में प्रस्तुत करके, मॉडल प्रशिक्षण डेटा को ओवरफिट करने से बचता है। दोनों नेटवर्क को रिपैरामीटराइज़ेशन ट्रिक का उपयोग करके संयुक्त रूप से प्रशिक्षित किया जाता है, जो स्टोकेस्टिक नमूने के माध्यम से ग्रेडिएंट-आधारित अनुकूलन की अनुमति देता है।
पृष्ठभूमि और प्रेरणा
VAE से पहले, जनरेटिव मॉडल अक्सर अपेक्षा-अधिकतमीकरण एल्गोरिथ्म पर निर्भर करते थे, जैसा कि संभाव्य PCA या स्पार्स कोडिंग जैसी विधियों में देखा गया था। ये दृष्टिकोण डेटा संभावना पर एक निचली सीमा को अनुकूलित करते थे, लेकिन आवश्यक वैरिएशनल पोस्टीरियर की गणना आमतौर पर प्रत्येक डेटा बिंदु के लिए अलग से की जाती थी, जिससे उच्च कम्प्यूटेशनल लागत होती थी। किंगमा और वेलिंग ने एक परिशोधित अनुमान दृष्टिकोण प्रस्तावित किया, जहां एक एकल तंत्रिका नेटवर्क सभी डेटा बिंदुओं में वैरिएशनल पैरामीटर आउटपुट करना सीखता है। पैरामीटर का यह पुन: उपयोग महत्वपूर्ण मेमोरी बचत प्रदान करता है और बड़े डेटासेट पर प्रशिक्षण सक्षम करता है। एनकोडर नेटवर्क वैरिएशनल वितरण के पैरामीटर आउटपुट करता है, जबकि डिकोडर अव्यक्त चर को वापस इनपुट स्थान में मैप करता है, अक्सर शोर वितरण के माध्य के रूप में।
मॉडल को एक मुक्त ऊर्जा अभिव्यक्ति को अनुकूलित करके प्रशिक्षित किया जाता है जिसमें दो शब्द शामिल हैं: पुनर्निर्माण त्रुटि और वैरिएशनल पोस्टीरियर और पूर्व के बीच कुल्बैक-लिबलर विचलन (KL-D)। पुनर्निर्माण शब्द मापता है कि डिकोडर अव्यक्त नमूने से इनपुट को कितनी अच्छी तरह पुन: उत्पन्न करता है, जबकि KL-D शब्द अव्यक्त वितरण को एक पूर्व, आमतौर पर एक मानक गाऊसी, के साथ संरेखित करने के लिए प्रोत्साहित करता है। इन शब्दों का सटीक रूप मानी गई शोर वितरण पर निर्भर करता है, जैसे कि ImageNet जैसे निरंतर डेटा के लिए गाऊसी या बाइनरी MNIST जैसे बाइनरी डेटा के लिए बर्नौली।
सूत्रीकरण और प्रशिक्षण
उद्देश्य पैरामीटराइज़्ड वितरण \(p_\theta(x)\) के तहत देखे गए डेटा \(x\) की संभावना को अधिकतम करना है, जिसे अक्सर गाऊसी के रूप में चुना जाता है। इस संभावना को सीधे अधिकतम करने के लिए अव्यक्त चर \(z\) पर मार्जिनलाइज़ेशन की आवश्यकता होती है, जो असंभव इंटीग्रल की ओर ले जाता है। VAE इसके बजाय एक वैरिएशनल निचली सीमा को अनुकूलित करता है, जिसे एविडेंस लोअर बाउंड (ELBO) के रूप में जाना जाता है, जो कम्प्यूटेशनल रूप से संभव है। ELBO को एनकोडर नेटवर्क द्वारा पैरामीटराइज़ किए गए एक अनुमानित पोस्टीरियर \(q_\phi(z|x)\) को पेश करके प्राप्त किया जाता है, और इसे पुनर्निर्माण शब्द और नकारात्मक KL-D के योग के रूप में लिखा जा सकता है।
प्रशिक्षण स्टोकेस्टिक ग्रेडिएंट डिसेंट द्वारा आगे बढ़ता है, अव्यक्त वितरण से एक विभेदक तरीके से नमूना लेने के लिए रिपैरामीटराइज़ेशन ट्रिक का उपयोग करते हुए। यह ट्रिक एक नमूना \(z\) को \(\mu + \sigma \odot \epsilon\) के रूप में व्यक्त करती है, जहां \(\epsilon\) एक मानक सामान्य वितरण से खींचा जाता है, जिससे ग्रेडिएंट नमूना संचालन के माध्यम से प्रवाहित हो सकते हैं। शोर मॉडल का विचरण कार्यान्वयन के आधार पर अलग से सीखा या तय किया जा सकता है। यह दृष्टिकोण न केवल अनुपयोगी शिक्षण के लिए बल्कि अर्ध-पर्यवेक्षित और पर्यवेक्षित कार्यों के लिए भी प्रभावी साबित हुआ, जिससे इसकी प्रयोज्यता का विस्तार हुआ।
प्रभाव और विरासत
VAE शोधपत्र ने गहरे जनरेटिव मॉडल के लिए एक नया प्रतिमान स्थापित किया, जो ऑटोएनकोडर और प्रतिबंधित बोल्ट्ज़मैन मशीन जैसे पहले के दृष्टिकोणों से अलग था। इसने संभाव्य गारंटी के साथ अव्यक्त प्रतिनिधित्व सीखने का एक सैद्धांतिक तरीका प्रदान किया, जिसने कंप्यूटर विज़न, प्राकृतिक भाषा प्रसंस्करण और दवा खोज जैसे क्षेत्रों को प्रभावित किया। यह वास्तुकला अधिक उन्नत मॉडल के लिए एक निर्माण खंड बन गई, जिसमें सशर्त VAE और पदानुक्रमित वेरिएंट शामिल हैं। इसके विचारों ने अन्य जनरेटिव ढांचे के विकास को भी सूचित किया, जैसे कि जनरेटिव एडवर्सेरियल नेटवर्क और डिफ्यूज़न मॉडल, जो बाद में उभरे।
Deep learning के व्यापक संदर्भ में, VAE ने तंत्रिका नेटवर्क को बायेसियन अनुमान के साथ संयोजित करने की शक्ति का प्रदर्शन किया, एक विषय जो AI अनुसंधान समुदाय में गूंजता रहा। शोधपत्र के लेखक, किंगमा और वेलिंग, उस समय University of Toronto और अन्य संस्थानों से संबद्ध थे, और उनके काम को बाद के साहित्य में व्यापक रूप से उद्धृत किया गया है। VAE Machine learning टूलकिट में एक मानक उपकरण बना हुआ है, जिसे स्नातक पाठ्यक्रमों में पढ़ाया जाता है और उद्योग अनुप्रयोगों में उपयोग किया जाता है, विसंगति का पता लगाने से लेकर डेटा संपीड़न तक।
वेरिएंट और विस्तार
बाद के शोध ने मूल मॉडल की सीमाओं को संबोधित करने के लिए कई VAE वेरिएंट पेश किए। एक सामान्य मुद्दा KL-D शब्द की मोड-खोज व्यवहार को प्रोत्साहित करने की प्रवृत्ति है, जो उत्पन्न नमूनों में खराब विविधता का कारण बन सकता है। इसे कम करने के लिए, शोधकर्ताओं ने KL-D को वैकल्पिक सांख्यिकीय दूरी, जैसे कि वासेरस्टीन दूरी या अधिकतम माध्य विचलन, के साथ बदल दिया, जिससे वासेरस्टीन ऑटोएनकोडर जैसे मॉडल बने। अन्य विस्तारों में बीटा-VAE शामिल है, जो अव्यवस्थित प्रतिनिधित्व को प्रोत्साहित करने के लिए KL-D शब्द के वजन को समायोजित करता है, और वेक्टर-क्वांटाइज़्ड VAE, जो उच्च-निष्ठा पीढ़ी के लिए असतत अव्यक्त स्थान का उपयोग करते हैं।
ये वेरिएंट विविध डोमेन में लागू किए गए हैं, जिनमें Neural network अनुसंधान, Large language model विकास और मल्टीमॉडल शिक्षण शामिल हैं। VAE की चिकनी अव्यक्त स्थान सीखने की क्षमता ने इसे डेटा विशेषताओं के प्रक्षेप और हेरफेर के लिए भी उपयोगी बनाया, जैसे कि एक छवि में चेहरे की मुद्रा या अभिव्यक्ति को बदलना। 2020 के दशक की शुरुआत तक, VAE-आधारित विधियां अनुसंधान के सक्रिय क्षेत्र बने हुए हैं, जिसमें प्रशिक्षण स्थिरता और स्केलेबिलिटी में सुधार पर चल रहे काम शामिल हैं।
निष्कर्ष
किंगमा और वेलिंग का 2013 का VAE शोधपत्र मशीन लर्निंग में एक ऐतिहासिक योगदान था, जिसने एक ऐसी वास्तुकला पेश की जो तंत्रिका नेटवर्क को वैरिएशनल अनुमान के साथ सुंदर ढंग से जोड़ती है। इसकी रिपैरामीटराइज़ेशन ट्रिक और परिशोधित अनुमान ढांचे ने गहरे जनरेटिव मॉडल के स्केलेबल प्रशिक्षण को सक्षम किया, जिससे कई बाद की प्रगति का मार्ग प्रशस्त हुआ। VAE का प्रभाव शैक्षणिक अनुसंधान और व्यावहारिक अनुप्रयोगों दोनों में बना हुआ है, जो क्षेत्र में एक मौलिक तकनीक के रूप में इसकी जगह को मजबूत करता है।