अंग्रेज़ी से अनुवादित

अवशिष्ट कनेक्शन एक तंत्रिका नेटवर्क पैटर्न है जो एक परत के इनपुट को उसके आउटपुट में जोड़ता है, जिससे बहुत गहरे नेटवर्क का स्थिर प्रशिक्षण संभव होता है। इसे 2015 में ResNet आर्किटेक्चर द्वारा लोकप्रिय बनाया गया था और अब यह [[transformer|ट्रांसफॉर्मर]] जैसे मॉडलों में एक मानक घटक है।

अवशेष कनेक्शन डीप लर्निंग में एक मूलभूत वास्तुशिल्प रूपांकन है, जहाँ एक परत का इनपुट सीधे उसके आउटपुट में जोड़ा जाता है, जिससे नेटवर्क को पूर्ण परिवर्तन के बजाय अवशेष फ़ंक्शन सीखने की अनुमति मिलती है। औपचारिक रूप से, इनपुट \(x\) और एक सबनेटवर्क \(f\) के लिए, अवशेष कनेक्शन \(f(x) + x\) की गणना करता है। यह सरल जोड़ प्रशिक्षण को स्थिर करता है और सैकड़ों या यहाँ तक कि हजारों परतों वाले तंत्रिका नेटवर्क के निर्माण को सक्षम बनाता है, जो अन्यथा गिरावट और लुप्त ग्रेडिएंट से ग्रस्त होते। यह अवधारणा 2015 में अवशेष नेटवर्क (ResNet) वास्तुकला द्वारा लोकप्रिय हुई, जिसने उस वर्ष इमेजनेट लार्ज स्केल विज़ुअल रिकग्निशन चैलेंज (ILSVRC) जीता, और तब से यह आधुनिक Deep learning प्रणालियों, जिसमें Transformer (architecture) मॉडल और Large language model शामिल हैं, में एक सर्वव्यापी घटक बन गया है।

"अवशेष कनेक्शन" शब्द विशेष रूप से मैपिंग \(x \mapsto f(x) + x\) को संदर्भित करता है, जहाँ \(f\) एक मनमाना तंत्रिका नेटवर्क मॉड्यूल है। जबकि यह रूपांकन पहले के कार्यों में उपयोग किया गया था, जैसे कि लॉन्ग शॉर्ट-टर्म मेमोरी (LSTM) नेटवर्क में, ResNet के प्रकाशन ने इसे फीडफॉरवर्ड नेटवर्क के लिए व्यापक रूप से अपनाया। आज, अवशेष कनेक्शन ऐसी वास्तुकलाओं में दिखाई देते हैं जो प्रतीत होता है कि ResNet से असंबंधित हैं, जिनमें Generative AI मॉडल, छवि पहचान के लिए Neural network प्रणालियाँ, और विभिन्न डोमेन में Machine learning अनुप्रयोग शामिल हैं।

अवशेष कनेक्शन का गणित

एक बहु-परत तंत्रिका नेटवर्क में, एक सबनेटवर्क पर विचार करें जिसमें स्टैक की गई परतें (जैसे, 2 या 3 परतें) हों, जो इनपुट \(x\) को आउटपुट \(H(x; \alpha)\) में मैप करता है, जहाँ \(\alpha\) पैरामीटर का प्रतिनिधित्व करता है। अवशेष कनेक्शन के बिना, सबनेटवर्क को वांछित इष्टतम आउटपुट \(H^\) सीधे सीखना होगा। अवशेष कनेक्शन के साथ, सबनेटवर्क अवशेष \(H^ - x\) सीखता है, और अंतिम आउटपुट \(F(x; \alpha) = H(x; \alpha) + x\) होता है। यह पुनःपैरामीटरीकरण नेटवर्क के लिए पहचान मैपिंग सीखना आसान बनाता है, क्योंकि सबनेटवर्क को केवल इनपुट से विचलन को समायोजित करने की आवश्यकता होती है।

ऑपरेशन एक "स्किप कनेक्शन" के माध्यम से कार्यान्वित किया जाता है जो एक पहचान मैपिंग करता है, सबनेटवर्क के इनपुट को सीधे उसके आउटपुट से जोड़ता है। यह स्किप कनेक्शन ही है जिसे अवशेष कनेक्शन कहा जाता है। फ़ंक्शन \(F\) आमतौर पर सक्रियण फ़ंक्शन और सामान्यीकरण ऑपरेशनों, जैसे Batch Normalization या Layer Normalization, के साथ अंतर्ग्रथित मैट्रिक्स गुणन द्वारा दर्शाया जाता है। एक अवशेष ब्लॉक अपने स्किप कनेक्शन के साथ ऐसा एक सबनेटवर्क है, और एक गहरे अवशेष नेटवर्क का निर्माण इन ब्लॉकों को स्टैक करके किया जाता है।

प्रोजेक्शन कनेक्शन

जब सबनेटवर्क \(F\) इनपुट की आयामीता बदलता है, जैसे कि \(F: \mathbb{R}^n \to \mathbb{R}^m\) जिसमें \(n \neq m\), तो जोड़ \(F(x) + x\) अपरिभाषित है। इस मामले में, एक प्रोजेक्शन कनेक्शन का उपयोग किया जाता है: \(y = F(x) + P(x)\), जहाँ \(P\) आमतौर पर \(P(x) = Mx\) द्वारा परिभाषित एक रैखिक प्रोजेक्शन है, जिसमें \(M\) एक \(m \times n\) मैट्रिक्स है। यह प्रोजेक्शन मैट्रिक्स बैकप्रोपेगेशन के माध्यम से प्रशिक्षित किया जाता है, मॉडल में किसी भी अन्य पैरामीटर की तरह। प्रोजेक्शन कनेक्शन अवशेष वास्तुकलाओं को विभिन्न चौड़ाई या चैनल गणना वाली परतों में लागू करने की अनुमति देते हैं, जो चरणों के बीच संक्रमण करते समय ResNet जैसे कनवल्शनल नेटवर्क में सामान्य है।

सिग्नल प्रसार

अवशेष कनेक्शन में पहचान मैपिंग का परिचय आगे और पीछे दोनों पथों में सिग्नल प्रसार की सुविधा देता है, जो गहरे नेटवर्क के प्रशिक्षण में उनकी प्रभावशीलता की कुंजी है।

फॉरवर्ड प्रसार

यदि \(\ell\)-वें अवशेष ब्लॉक का आउटपुट \((\ell+1)\)-वें अवशेष ब्लॉक का इनपुट है (ब्लॉकों के बीच कोई सक्रियण फ़ंक्शन नहीं मानते हुए), तो अगले ब्लॉक का इनपुट \(x_{\ell+1} = F(x_\ell) + x_\ell\) है। यह पुनरावर्ती संबंध का अर्थ है कि पहले की परतों से सिग्नल पहचान मैपिंग के माध्यम से बाद की परतों तक सीधे प्रवाहित हो सकता है, जिससे गैर-अवशेष नेटवर्क में होने वाली जानकारी की गिरावट से बचा जा सकता है। \(L\) ब्लॉकों पर, आउटपुट को \(x_L = x_0 + \sum_{i=0}^{L-1} F(x_i)\) के रूप में व्यक्त किया जा सकता है, जो दर्शाता है कि प्रारंभिक इनपुट हमेशा अंतिम आउटपुट में मौजूद होता है।

बैकवर्ड प्रसार

बैकप्रोपेगेशन के दौरान, एक अवशेष ब्लॉक के इनपुट के संबंध में हानि का ग्रेडिएंट \(\frac{\partial \mathcal{L}}{\partial x_\ell} = \frac{\partial \mathcal{L}}{\partial x_{\ell+1}} \left(1 + \frac{\partial F}{\partial x_\ell}\right)\) है। पद \(1\) यह सुनिश्चित करता है कि ग्रेडिएंट पहचान मैपिंग के माध्यम से बिना लुप्त हुए पीछे प्रवाहित हो सकता है, भले ही सबनेटवर्क \(F\) में छोटे या शून्य ग्रेडिएंट हों। यह लुप्त ग्रेडिएंट समस्या को रोकता है जो बहुत गहरे गैर-अवशेष नेटवर्क को प्रभावित करती है, जिससे सैकड़ों परतों वाली वास्तुकलाओं का प्रभावी प्रशिक्षण संभव होता है।

ऐतिहासिक विकास

अवशेष कनेक्शन रूपांकन ResNet से पहले का है। LSTM, जो 1997 में पेश किया गया था, में एक मेमोरी सेल तंत्र है जो एक अवशेष कनेक्शन के रूप में कार्य करता है: एक इनपुट \(x_t\) को फ़ंक्शन \(F\) द्वारा संसाधित किया जाता है और मेमोरी सेल \(c_t\) में जोड़ा जाता है, जिसके परिणामस्वरूप \(c_{t+1} = c_t + F(x_t)\) होता है। फ़ॉरगेट गेट वाला एक LSTM अनिवार्य रूप से एक हाईवे नेटवर्क के रूप में कार्य करता है, जो गेटेड अवशेष कनेक्शन का एक और प्रारंभिक संस्करण है। हालाँकि, यह 2015 का ResNet पेपर Microsoft (AI) के शोधकर्ताओं (कैमिंग हे, ज़ियांगयू झांग, शाओकिंग रेन और जियान सन सहित) द्वारा था जिसने बहुत गहरे फीडफॉरवर्ड नेटवर्क के लिए अवशेष कनेक्शन की शक्ति का प्रदर्शन किया। ResNet ने ILSVRC 2015 को इमेजनेट डेटासेट पर 3.57% की त्रुटि दर के साथ जीता, जिसने पहली बार मानव-स्तरीय प्रदर्शन को पार किया।

डीप लर्निंग पर प्रभाव

अवशेष कनेक्शनों का Artificial intelligence और Deep learning पर परिवर्तनकारी प्रभाव पड़ा है। उन्होंने अभूतपूर्व गहराई वाले नेटवर्क के विकास को सक्षम किया, जैसे कि 152 परतों वाला ResNet-152, जिसे पहले प्रभावी ढंग से प्रशिक्षित करना असंभव था। छवि पहचान में ResNet की सफलता ने अन्य डोमेन, जिनमें प्राकृतिक भाषा प्रसंस्करण और Reinforcement learning शामिल हैं, में अवशेष कनेक्शन को तेजी से अपनाने को जन्म दिया।

Transformer (architecture) मॉडल में, अवशेष कनेक्शन एक मुख्य घटक हैं। मूल ट्रांसफॉर्मर वास्तुकला, जो 2017 में पेश की गई थी, प्रत्येक सबलेयर (जैसे, मल्टी-हेड अटेंशन और फीडफॉरवर्ड नेटवर्क) के चारों ओर अवशेष कनेक्शन का उपयोग करती है, जिसके बाद लेयर नॉर्मलाइज़ेशन होता है। यह डिज़ाइन BERT और GPT श्रृंखला जैसे मॉडलों में उपयोग किया जाता है, जिसमें OpenAI द्वारा विकसित मॉडल शामिल हैं। अवशेष कनेक्शन द्वारा प्रदान की गई स्थिरता इन मॉडलों को प्रशिक्षित करने के लिए आवश्यक है, जिनमें सैकड़ों परतें और अरबों पैरामीटर हो सकते हैं।

अवशेष कनेक्शन अन्य उल्लेखनीय प्रणालियों में भी दिखाई देते हैं। Google DeepMind द्वारा विकसित AlphaGo Zero प्रणाली, गो के खेल में महारत हासिल करने के लिए अपने तंत्रिका नेटवर्क में अवशेष नेटवर्क का उपयोग करती है। AlphaStar, जिसने StarCraft II में ग्रैंडमास्टर स्तर हासिल किया, और AlphaFold, जो प्रोटीन संरचनाओं की भविष्यवाणी करता है, भी अवशेष कनेक्शन शामिल करते हैं। ये अनुप्रयोग विभिन्न प्रकार की तंत्रिका नेटवर्क वास्तुकलाओं में रूपांकन की बहुमुखी प्रतिभा को प्रदर्शित करते हैं।

विविधताएँ और सुधार

प्रशिक्षण स्थिरता और प्रदर्शन को और बेहतर बनाने के लिए अवशेष कनेक्शन के कई विविधताएँ प्रस्तावित की गई हैं। एक अनुशंसा है अवशेष कनेक्शन \(x + f(x)\) को \(x/L + f(x)\) से बदलना, जहाँ \(L\) अवशेष परतों की कुल संख्या है। यह स्केलिंग परत इनपुट के विचरण को स्थिर करने में मदद करती है, जो विशेष रूप से बहुत गहरे नेटवर्क में महत्वपूर्ण है। यह तकनीक कुछ आधुनिक ट्रांसफॉर्मर कार्यान्वयनों में उपयोग की जाती है, जैसे GPT-2, जहाँ अवशेष स्ट्रीम को \(1/\sqrt{L}\) से स्केल किया जाता है।

एक और विविधता प्री-एक्टिवेशन अवशेष ब्लॉक है, जहाँ सक्रियण फ़ंक्शन (जैसे, ReLU) वज़न परतों के बाद के बजाय पहले लागू किया जाता है। यह संशोधन, जो 2016 में पेश किया गया था, ग्रेडिएंट प्रवाह में सुधार करता है और और भी गहरे नेटवर्क को प्रशिक्षित करना आसान बनाता है। इसके अतिरिक्त, कुछ वास्तुकलाएँ गेटेड अवशेष कनेक्शन का उपयोग करती हैं, जहाँ एक सीखा हुआ गेट अवशेष पथ के योगदान को नियंत्रित करता है, जैसा कि हाईवे नेटवर्क में देखा गया है।

व्यावहारिक विचार

अवशेष कनेक्शन लागू करते समय, कई व्यावहारिक विचार उत्पन्न होते हैं। सामान्यीकरण कहाँ रखा जाए (जोड़ से पहले या बाद) का चुनाव प्रशिक्षण गतिशीलता को महत्वपूर्ण रूप से प्रभावित कर सकता है। ट्रांसफॉर्मर में, "पोस्ट-नॉर्म" (जोड़ के बाद सामान्यीकरण) मूल पेपर में उपयोग किया गया था, लेकिन "प्री-नॉर्म" (सबलेयर से पहले सामान्यीकरण) बाद के मॉडलों में बेहतर स्थिरता के कारण अधिक सामान्य हो गया है। अवशेष शाखा के लिए स्केलिंग कारक एक और हाइपरपैरामीटर है जिसे ट्यून किया जा सकता है।

अवशेष कनेक्शन Dropout और Weight Initialization जैसी अन्य तकनीकों के साथ भी बातचीत करते हैं। व्यवहार में, अवशेष कनेक्शन अक्सर Gradient Clipping और सावधानीपूर्वक Learning Rate Scheduling प्रबंधन के साथ संयोजन में उपयोग किए जाते हैं ताकि बहुत गहरे मॉडल को प्रशिक्षित किया जा सके। इन तकनीकों के संयोजन ने खरबों पैरामीटर वाले मॉडल के प्रशिक्षण को सक्षम किया है, जैसे कि आधुनिक Large language model में उपयोग किए जाने वाले।

निष्कर्ष

अवशेष कनेक्शन एक सरल फिर भी शक्तिशाली विचार है जिसने डीप लर्निंग में क्रांति ला दी है। सबनेटवर्क के आउटपुट में इनपुट जोड़कर, वे ग्रेडिएंट को गहरे नेटवर्क के माध्यम से प्रवाहित करने की अनुमति देते हैं, गिरावट को रोकते हैं और सैकड़ों परतों वाली वास्तुकलाओं के प्रशिक्षण को सक्षम करते हैं। 2015 के ResNet पेपर में उनकी उत्पत्ति से लेकर ट्रांसफॉर्मर और अन्य आधुनिक मॉडलों में उनकी सर्वव्यापी उपस्थिति तक, अवशेष कनेक्शन क्षेत्र में एक मूलभूत उपकरण बन गए हैं। उनका प्रभाव छवि पहचान, प्राकृतिक भाषा प्रसंस्करण और उससे परे फैला हुआ है, जिससे वे Machine learning के इतिहास में सबसे महत्वपूर्ण वास्तुशिल्प नवाचारों में से एक हैं।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:deep-learning·neural-network·architecture·machine-learning
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास