ResNet, जिसे अवशिष्ट तंत्रिका नेटवर्क (residual neural network) के रूप में भी जाना जाता है, एक गहन शिक्षण (deep learning) वास्तुकला है जिसमें परतें अपने इनपुट के संदर्भ में अवशिष्ट फलन (residual functions) सीखती हैं। 2015 में छवि पहचान के लिए विकसित, इसने उस वर्ष की ImageNet Large Scale Visual Recognition Challenge (ILSVRC) जीती। वास्तुकला की परिभाषित विशेषता अवशिष्ट कनेक्शन (residual connection) है, एक रूपांकन जो उपनेटवर्क के इनपुट को उसके आउटपुट में जोड़ता है, जिससे सैकड़ों परतों वाले नेटवर्क का प्रशिक्षण संभव होता है। यह डिज़ाइन आधुनिक Deep learning मॉडलों में एक मौलिक निर्माण खंड बन गया है, जिसमें Transformer (architecture) वास्तुकलाएँ और AlphaGo Zero तथा AlphaFold जैसी प्रणालियाँ शामिल हैं।
अवशिष्ट कनेक्शन गहन तंत्रिका नेटवर्क में प्रशिक्षण और अभिसरण को स्थिर करता है, जो लुप्त होते ग्रेडिएंट (vanishing gradient) समस्या को संबोधित करता है जो पहले नेटवर्क की गहराई को सीमित करती थी। इसका प्रभाव छवि पहचान से कहीं आगे तक फैला हुआ है, जो तंत्रिका नेटवर्क में विभिन्न क्षेत्रों में दिखाई देता है, बड़े भाषा मॉडल से लेकर सुदृढीकरण शिक्षण प्रणालियों तक।
गणित
ResNet का मूल विचार सीखने के लक्ष्य को पुनः सूत्रबद्ध करना है। एक बहुपरत नेटवर्क में, स्टैक की गई परतों वाले एक उपनेटवर्क पर विचार करें जो एक फलन \(H(x;\alpha)\) की गणना करता है, जहाँ \(x\) इनपुट है और \(\alpha\) पैरामीटर हैं। \(H\) को सीधे सीखने के बजाय, अवशिष्ट शिक्षण उपनेटवर्क को \(F(x;\alpha) = H(x;\alpha) + x\) सीखने में सक्षम बनाता है। इष्टतम आउटपुट \(H^\) तब अवशिष्ट \(H^ - x\) सीखकर प्राप्त किया जाता है, जिसे अनुकूलित करना अक्सर आसान होता है।
\(x\) का जोड़ एक स्किप कनेक्शन (skip connection) के माध्यम से कार्यान्वित किया जाता है जो एक पहचान मानचित्रण (identity mapping) करता है, जो उपनेटवर्क के इनपुट को सीधे उसके आउटपुट से जोड़ता है। यह स्किप कनेक्शन ही "अवशिष्ट कनेक्शन" है। इस कनेक्शन वाले उपनेटवर्क को अवशिष्ट ब्लॉक (residual block) कहा जाता है, और एक गहन अवशिष्ट नेटवर्क ऐसे ब्लॉकों को स्टैक करके बनाया जाता है।
अवशिष्ट कनेक्शन
एक अवशिष्ट ब्लॉक में, फलन \(F\) में आमतौर पर सक्रियण फलनों और बैच सामान्यीकरण या परत सामान्यीकरण जैसे सामान्यीकरण संचालनों के साथ अंतःस्थापित मैट्रिक्स गुणन शामिल होते हैं। अवशिष्ट कनेक्शन \(x + F(x)\) बैकप्रोपेगेशन के दौरान ग्रेडिएंट्स को सीधे नेटवर्क के माध्यम से प्रवाहित करने की अनुमति देता है, जो गिरावट की समस्या (degradation problem) को कम करता है जहाँ गहरे नेटवर्क प्रशिक्षित करना कठिन हो जाता है।
अवशिष्ट कनेक्शन की अवधारणा के पूर्ववर्ती उदाहरण हैं। लॉन्ग शॉर्ट-टर्म मेमोरी (LSTM) नेटवर्क, उदाहरण के लिए, एक मेमोरी सेल रखते हैं जो अवशिष्ट कनेक्शन के रूप में कार्य करता है: \(c_{t+1} = c_t + F(x_t)\), जहाँ \(c_t\) सेल अवस्था है और \(F\) इनपुट \(x_t\) को संसाधित करता है। फॉरगेट गेट वाला एक LSTM अनिवार्य रूप से एक हाईवे नेटवर्क (highway network) के रूप में कार्य करता है, जो एक संबंधित वास्तुकला है जो गेटेड स्किप कनेक्शन का भी उपयोग करती है।
बहुत गहरे नेटवर्क में परत इनपुट के विचरण को स्थिर करने के लिए, अवशिष्ट कनेक्शन को परतों की कुल संख्या \(L\) द्वारा स्केल करने की अनुशंसा की जाती है, \(x + f(x)\) को \(x/L + f(x)\) से प्रतिस्थापित करते हुए। यह सामान्यीकरण सैकड़ों परतों में सुसंगत सिग्नल परिमाण बनाए रखने में मदद करता है।
प्रोजेक्शन कनेक्शन
जब फलन \(F\) इनपुट की आयामीता को बदलता है, जैसे \(F: \mathbb{R}^n \to \mathbb{R}^m\) जिसमें \(n \neq m\), तो योग \(F(x) + x\) अपरिभाषित है। इस मामले में, एक प्रोजेक्शन कनेक्शन का उपयोग किया जाता है: \(y = F(x) + P(x)\), जहाँ \(P\) आमतौर पर एक रैखिक प्रक्षेपण \(P(x) = Mx\) है जिसमें एक \(m \times n\) मैट्रिक्स \(M\) होता है। यह मैट्रिक्स अन्य मॉडल पैरामीटरों के साथ बैकप्रोपेगेशन के माध्यम से प्रशिक्षित किया जाता है, जिससे नेटवर्क स्किप कनेक्शन को नई आयामीता के अनुकूल बना सकता है।
सिग्नल प्रसार
पहचान मानचित्रण की शुरूआत आगे और पीछे दोनों पथों में सिग्नल प्रसार की सुविधा प्रदान करती है। फॉरवर्ड पास में, यदि \(\ell\)-वें अवशिष्ट ब्लॉक का आउटपुट \((\ell+1)\)-वें ब्लॉक का इनपुट है (ब्लॉकों के बीच कोई सक्रियण नहीं मानते हुए), तो \(x_{\ell+1} = F(x_\ell) + x_\ell\)। यह पुनरावृत्ति सूचना को सीधे नेटवर्क के माध्यम से प्रवाहित करने की अनुमति देती है, इनपुट सिग्नल को संरक्षित करती है भले ही \(F\) छोटे मान उत्पन्न करे।
बैकवर्ड पास में, ब्लॉक के इनपुट के संबंध में हानि का ग्रेडिएंट एक पद शामिल करता है जो पहचान मानचित्रण के माध्यम से पारित आउटपुट के संबंध में ग्रेडिएंट है। यह सुनिश्चित करता है कि कई परतों के माध्यम से प्रसारित होने पर ग्रेडिएंट लुप्त न हों, जो सैकड़ों परतों वाले नेटवर्क के प्रशिक्षण को सक्षम करने में एक प्रमुख कारक है।
इतिहास और प्रभाव
अवशिष्ट कनेक्शन रूपांकन का उपयोग पहले के कार्यों में किया गया था, लेकिन 2015 में ResNet के प्रकाशन ने इसे फीडफॉरवर्ड नेटवर्क के लिए व्यापक रूप से लोकप्रिय बना दिया। वास्तुकला माइक्रोसॉफ्ट के शोधकर्ताओं द्वारा विकसित की गई थी, जिनमें काइमिंग हे, जियांग्यु झांग, शाओकिंग रेन और जियान सन शामिल थे। उनके पेपर, "Deep Residual Learning for Image Recognition," ने प्रदर्शित किया कि अवशिष्ट नेटवर्क को 152 परतों या उससे अधिक की गहराई के साथ प्रशिक्षित किया जा सकता है, जो ImageNet बेंचमार्क पर अत्याधुनिक परिणाम प्राप्त करते हैं।
ILSVRC 2015 में ResNet की सफलता ने मशीन लर्निंग में एक महत्वपूर्ण मोड़ चिह्नित किया। इसने दिखाया कि बहुत गहरे नेटवर्क न केवल व्यवहार्य थे बल्कि प्रदर्शन में भी बेहतर थे, जिससे गहन वास्तुकलाओं पर शोध में वृद्धि हुई। अवशिष्ट कनेक्शन बाद के मॉडलों में एक मानक घटक बन गया, जिसमें प्राकृतिक भाषा प्रसंस्करण में उपयोग किए जाने वाले ट्रांसफॉर्मर शामिल हैं, जैसे BERT और GPT मॉडल, और AlphaGo Zero, AlphaStar, और AlphaFold जैसी प्रणालियों में।
विविधताएँ और विस्तार
प्रदर्शन या दक्षता में सुधार के लिए ResNet की कई विविधताएँ विकसित की गई हैं। प्री-एक्टिवेशन ResNet सक्रियण फलनों को भार परतों से पहले स्थानांतरित करता है, जो नियमितीकरण में सुधार करता है और और भी गहरे नेटवर्क की अनुमति देता है। वाइड ResNet प्रत्येक ब्लॉक में चैनलों की संख्या बढ़ाता है, कम परतों के साथ बेहतर सटीकता प्राप्त करने के लिए गहराई को चौड़ाई के साथ व्यापार करता है। ResNeXt एक कार्डिनैलिटी आयाम पेश करता है, जो प्रतिनिधित्वात्मक शक्ति बढ़ाने के लिए प्रत्येक ब्लॉक के भीतर समानांतर शाखाओं का उपयोग करता है, बिना गहराई बढ़ाए।
अन्य विस्तारों में DenseNet शामिल है, जो प्रत्येक परत को फीडफॉरवर्ड तरीके से हर दूसरी परत से जोड़ता है, और स्टोकेस्टिक गहराई वाला ResNet, जो नेटवर्क को नियमित करने के लिए प्रशिक्षण के दौरान यादृच्छिक रूप से परतों को हटाता है। इन विविधताओं ने गहन अवशिष्ट शिक्षण के साथ संभव की सीमाओं को और आगे बढ़ाया है।
अनुप्रयोग
ResNet को छवि पहचान से परे कार्यों की एक विस्तृत श्रृंखला पर लागू किया गया है, जिसमें वस्तु पहचान, सिमेंटिक विभाजन और वीडियो विश्लेषण शामिल हैं। इसका उपयोग चिकित्सा इमेजिंग, स्वायत्त ड्राइविंग और चेहरे की पहचान प्रणालियों में भी किया जाता है। वास्तुकला की बहुमुखी प्रतिभा और मजबूती ने इसे कई कंप्यूटर विज़न अनुप्रयोगों के लिए एक डिफ़ॉल्ट विकल्प बना दिया है।
इसके अलावा, अवशिष्ट कनेक्शन सिद्धांत को अन्य क्षेत्रों में भी अपनाया गया है, जैसे प्राकृतिक भाषा प्रसंस्करण और सुदृढीकरण शिक्षण। उदाहरण के लिए, ट्रांसफॉर्मर मॉडल भाषा समझ और उत्पादन के लिए गहरे नेटवर्क प्रशिक्षित करने के लिए अवशिष्ट कनेक्शन पर निर्भर करते हैं, जैसा कि OpenAI की GPT श्रृंखला और Anthropic के मॉडलों में देखा गया है। ResNet का प्रभाव इस प्रकार कृत्रिम बुद्धिमत्ता के क्षेत्र में व्यापक है।