अंग्रेज़ी से अनुवादित

एक अवशिष्ट तंत्रिका नेटवर्क (ResNet) एक गहन शिक्षण वास्तुकला है जिसमें परतें स्किप कनेक्शन के माध्यम से अवशिष्ट फलन सीखती हैं, जिसे 2015 में छवि पहचान के लिए पेश किया गया था और आधुनिक तंत्रिका नेटवर्क में व्यापक रूप से अपनाया गया है।

अवशिष्ट तंत्रिका नेटवर्क, जिसे अवशिष्ट नेटवर्क या ResNet के रूप में भी जाना जाता है, एक गहन शिक्षण वास्तुकला है जिसमें परतें अपने इनपुट के सापेक्ष अवशिष्ट फलन सीखती हैं। 2015 में छवि पहचान के लिए विकसित, इसने उस वर्ष की ImageNet लार्ज स्केल विज़ुअल रिकग्निशन चैलेंज (ILSVRC) जीती। मुख्य नवाचार अवशिष्ट कनेक्शन है, एक वास्तुशिल्प रूपांकन जो उपनेटवर्क के इनपुट को उसके आउटपुट में जोड़ता है, जिससे सैकड़ों परतों वाले नेटवर्क का प्रशिक्षण संभव होता है।

अवशिष्ट कनेक्शन गहन तंत्रिका नेटवर्क में प्रशिक्षण और अभिसरण को स्थिर करता है, जिससे यह आधुनिक वास्तुकलाओं जैसे ट्रांसफॉर्मर मॉडल (उदाहरण के लिए, BERT और GPT मॉडल जैसे ChatGPT), साथ ही AlphaGo Zero, AlphaStar, और AlphaFold जैसी प्रणालियों में एक सामान्य रूपांकन बन जाता है। इसका प्रभाव छवि पहचान से परे है, जो विभिन्न डोमेन में गहन शिक्षण को प्रभावित करता है।

अवशिष्ट कनेक्शन का गणित

एक बहुपरत तंत्रिका नेटवर्क में, स्टैक्ड परतों (जैसे, 2 या 3) के साथ एक उपनेटवर्क पर विचार करें। मान लें \(H(x; \alpha)\) उपनेटवर्क को दर्शाता है, जहाँ \(x\) इनपुट है और \(\alpha\) पैरामीटर सेट है। यदि \(H^\) वांछित इष्टतम आउटपुट है, तो अवशिष्ट शिक्षण \(x\) को सीधे आउटपुट में जोड़ता है, इसलिए सीखा गया इष्टतम आउटपुट \(H^ - x\) बन जाता है, जिसे \(x\) के सापेक्ष "अवशिष्ट" के रूप में व्याख्या किया जाता है। \(x\) जोड़ने का संचालन एक स्किप कनेक्शन के माध्यम से लागू किया जाता है जो एक पहचान मैपिंग करता है, उपनेटवर्क के इनपुट को उसके आउटपुट से जोड़ता है। इस कनेक्शन को बाद में "अवशिष्ट कनेक्शन" कहा जाता है।

फलन \(F(x; \alpha) = H(x; \alpha) + x\) को अक्सर सक्रियण फलनों और सामान्यीकरण संचालनों (जैसे, बैच सामान्यीकरण या परत सामान्यीकरण) के साथ मैट्रिक्स गुणन द्वारा दर्शाया जाता है। ऐसे उपनेटवर्क को "अवशिष्ट ब्लॉक" कहा जाता है, और एक गहन अवशिष्ट नेटवर्क इन ब्लॉकों को स्टैक करता है।

लॉन्ग शॉर्ट-टर्म मेमोरी (LSTM) नेटवर्क में एक मेमोरी तंत्र होता है जो अवशिष्ट कनेक्शन के रूप में कार्य करता है। बिना फॉरगेट गेट के LSTM में, एक इनपुट \(x_t\) को \(F\) द्वारा संसाधित किया जाता है और एक मेमोरी सेल \(c_t\) में जोड़ा जाता है, जिससे \(c_{t+1} = c_t + F(x_t)\) प्राप्त होता है। फॉरगेट गेट वाला LSTM अनिवार्य रूप से एक हाईवे नेटवर्क के रूप में कार्य करता है।

परत इनपुट के विचरण को स्थिर करने के लिए, अवशिष्ट कनेक्शन \(x + f(x)\) को \(x/L + f(x)\) से बदलने की सिफारिश की जाती है, जहाँ \(L\) अवशिष्ट परतों की कुल संख्या है।

प्रोजेक्शन कनेक्शन

यदि फलन \(F\) \(\mathbb{R}^n\) से \(\mathbb{R}^m\) में मैप करता है जिसमें \(n \neq m\) है, तो अभिव्यक्ति \(F(x) + x\) अपरिभाषित है। इसे संभालने के लिए, एक प्रोजेक्शन कनेक्शन का उपयोग किया जाता है: \(y = F(x) + P(x)\), जहाँ \(P\) आमतौर पर \(P(x) = Mx\) द्वारा परिभाषित एक रैखिक प्रोजेक्शन है, जिसमें \(M\) एक \(m \times n\) मैट्रिक्स है। मैट्रिक्स को किसी अन्य पैरामीटर की तरह बैकप्रोपेगेशन के माध्यम से प्रशिक्षित किया जाता है।

सिग्नल प्रसार

पहचान मैपिंग का परिचय आगे और पीछे दोनों पथों में सिग्नल प्रसार की सुविधा प्रदान करता है। फॉरवर्ड प्रसार में, यदि \(\ell\)-वें अवशिष्ट ब्लॉक का आउटपुट \((\ell+1)\)-वें ब्लॉक का इनपुट है (ब्लॉकों के बीच कोई सक्रियण नहीं मानते हुए), तो अगला इनपुट \(x_{\ell+1} = F(x_\ell) + x_\ell\) है। यह योगात्मक संरचना ग्रेडिएंट्स को सीधे नेटवर्क के माध्यम से प्रवाहित करने की अनुमति देती है, जिससे लुप्त ग्रेडिएंट समस्या कम होती है जो पहले के गहन नेटवर्क को प्रभावित करती थी।

ऐतिहासिक संदर्भ और विकास

अवशिष्ट कनेक्शन रूपांकन का उपयोग ResNet से पहले किया गया था, उदाहरण के लिए LSTM नेटवर्क और हाईवे नेटवर्क में। हालाँकि, 2015 में ResNet के प्रकाशन ने इसे फीडफॉरवर्ड नेटवर्क के लिए व्यापक रूप से लोकप्रिय बना दिया, जो छवि पहचान से असंबंधित प्रतीत होने वाली वास्तुकलाओं में दिखाई दिया। मूल ResNet पेपर, जिसे काइमिंग हे, जियांगयु झांग, शाओकिंग रेन, और जियान सन द्वारा लिखा गया था, ने छवि पहचान के लिए गहन अवशिष्ट शिक्षण पेश किया और ILSVRC 2015 पर अत्याधुनिक परिणाम प्राप्त किए।

गहन शिक्षण पर प्रभाव

ResNet की सफलता ने प्रदर्शित किया कि बहुत गहन नेटवर्क को प्रभावी ढंग से प्रशिक्षित किया जा सकता है, जिससे तंत्रिका नेटवर्क डिज़ाइन में बदलाव आया। अवशिष्ट कनेक्शन बाद की वास्तुकलाओं में एक मानक घटक बन गया, जिसमें बड़े भाषा मॉडल में उपयोग किए जाने वाले ट्रांसफॉर्मर मॉडल शामिल हैं। उदाहरण के लिए, BERT और GPT मॉडल गहन ट्रांसफॉर्मर को प्रशिक्षित करने के लिए अवशिष्ट कनेक्शन पर निर्भर करते हैं। AlphaGo Zero और AlphaFold जैसी प्रणालियाँ भी अवशिष्ट ब्लॉकों को शामिल करती हैं, जो रूपांकन की बहुमुखी प्रतिभा को दर्शाती हैं।

विविधताएँ और विस्तार

अवशिष्ट नेटवर्क के कई विविधताएँ प्रस्तावित की गई हैं। प्री-एक्टिवेशन ResNets बैच सामान्यीकरण और सक्रियण को वेट परतों से पहले स्थानांतरित करते हैं, जिससे प्रशिक्षण में सुधार होता है। वाइड ResNets गहराई के बजाय चौड़ाई बढ़ाते हैं, कम परतों के साथ बेहतर प्रदर्शन प्राप्त करते हैं। DenseNet प्रत्येक परत को हर बाद की परत से जोड़ता है, अवशिष्ट विचार पर निर्माण करते हुए। ResNeXt कार्डिनैलिटी पेश करता है, कनवल्शन को समानांतर पथों में विभाजित करता है। ये विविधताएँ अवशिष्ट अवधारणा की लचीलापन को उजागर करती हैं।

व्यावहारिक विचार

व्यवहार में, अवशिष्ट कनेक्शन स्किप कनेक्शन के साथ लागू किए जाते हैं जिनमें आयाम बदलने पर प्रोजेक्शन मैट्रिक्स शामिल हो सकते हैं। बैच सामान्यीकरण जैसी सामान्यीकरण तकनीकें अक्सर अवशिष्ट ब्लॉकों के भीतर लागू की जाती हैं। सक्रियण फलनों की पसंद, जैसे ReLU, प्रशिक्षण गतिशीलता को प्रभावित करती है। अवशिष्ट कनेक्शन उच्च शिक्षण दरों के उपयोग को भी सक्षम करते हैं और आरंभीकरण के प्रति संवेदनशीलता को कम करते हैं, क्योंकि वे सिग्नल विचरण को स्थिर रखते हैं।

विरासत और भविष्य की दिशाएँ

अवशिष्ट नेटवर्क गहन शिक्षण में एक मौलिक अवधारणा बन गया है, जो शैक्षणिक अनुसंधान और औद्योगिक अनुप्रयोगों दोनों को प्रभावित करता है। इसके सिद्धांत आधुनिक फ्रेमवर्क और हार्डवेयर अनुकूलन में अंतर्निहित हैं। 2020 के दशक की शुरुआत तक, अवशिष्ट कनेक्शन कई वास्तुकलाओं में एक डिफ़ॉल्ट विकल्प बने हुए हैं, जिनमें जनरेटिव एआई और कृत्रिम बुद्धिमत्ता प्रणालियाँ शामिल हैं। अवशिष्ट सीखने के विचार ने अन्य क्षेत्रों, जैसे मशीन लर्निंग सिद्धांत और अनुकूलन को भी प्रेरित किया है।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:deep-learning·neural-network·computer-vision·machine-learning
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास