अंग्रेज़ी से अनुवादित

हाईवे नेटवर्क एक गहरी फीडफॉरवर्ड तंत्रिका नेटवर्क वास्तुकला है जो सैकड़ों परतों में सूचना प्रवाह को विनियमित करने के लिए सीखे गए गेटिंग तंत्र का उपयोग करती है, जिससे लुप्त ग्रेडिएंट समस्या कम होती है। मई 2015 में पेश किया गया, यह पहला कार्यशील बहुत गहरा फीडफॉरवर्ड नेटवर्क था और इसने बाद की वास्तुकलाओं जैसे [[resnet|ResNet]] को प्रभावित किया।

मशीन लर्निंग में, हाईवे नेटवर्क एक गहरी फीडफॉरवर्ड तंत्रिका नेटवर्क वास्तुकला है जो सैकड़ों परतों वाले नेटवर्क को सफलतापूर्वक प्रशिक्षित करने वाली पहली थी, जो 2014 में अत्याधुनिक मॉडलों की विशिष्ट 20 से 30 परतों से कहीं अधिक थी। इसे मई 2015 में शोधकर्ताओं द्वारा पेश किया गया था, जो "डिग्रेडेशन" समस्या को दूर करना चाहते थे, जहां बहुत अधिक परतों को जोड़ने से प्रशिक्षण सटीकता में तेज कमी आती थी। यह वास्तुकला परतों के बीच सूचना प्रवाह को विनियमित करने के लिए सीखे गए गेटिंग तंत्र का उपयोग करती है, जो लॉन्ग शॉर्ट-टर्म मेमोरी (LSTM) आवर्तक तंत्रिका नेटवर्क से प्रेरित है। ये गेट "सूचना राजमार्ग" बनाते हैं जो ग्रेडिएंट्स को अधिक आसानी से प्रसारित करने की अनुमति देते हैं, जिससे लुप्त होने वाली ग्रेडिएंट समस्या कम होती है और अनुकूलन में सुधार होता है।

हाईवे नेटवर्क को दिसंबर 2015 में प्रकाशित अवशिष्ट तंत्रिका नेटवर्क (ResNet) के साथ समवर्ती रूप से विकसित किया गया था। ResNet को हाईवे नेटवर्क का एक विशेष मामला माना जा सकता है जहां गेट हमेशा खुले होते हैं (सक्रियण 1.0)। हाईवे नेटवर्क ने पाठ अनुक्रम लेबलिंग और भाषण पहचान कार्यों में व्यावहारिक अनुप्रयोग पाए हैं।

मॉडल और गेटिंग तंत्र

हाईवे नेटवर्क मुख्य परिवर्तन फ़ंक्शन \(H(W_H, x)\) के साथ दो गेट जोड़कर एक मानक फीडफॉरवर्ड परत का विस्तार करता है: एक ट्रांसफॉर्म गेट \(T(W_T, x)\) और एक कैरी गेट \(C(W_C, x)\)। दोनों गेट आमतौर पर सिग्मॉइड फ़ंक्शन होते हैं, जो 0 और 1 के बीच मान आउटपुट करते हैं। कैरी गेट को \(C(W_C, x) = 1 - T(W_T, x)\) के रूप में परिभाषित किया गया है, जो सुनिश्चित करता है कि ट्रांसफॉर्म और कैरी पथों का योग एक हो।

हाईवे परत का आउटपुट इस प्रकार गणना किया जाता है:

\(y = H(x, W_H) \cdot T(x, W_T) + x \cdot C(x, W_C)\)

या समकक्ष रूप से:

\(y = H(x, W_H) \cdot T(x, W_T) + x \cdot (1 - T(x, W_T))\)

यह सूत्रीकरण परत को इनपुट को अपरिवर्तित पारित करने (जब ट्रांसफॉर्म गेट लगभग 0 हो) या एक गैर-रैखिक परिवर्तन लागू करने (जब गेट लगभग 1 हो) की अनुमति देता है। गेटिंग प्रशिक्षण के दौरान सीखी जाती है, जिससे नेटवर्क गतिशील रूप से नियंत्रित कर सकता है कि प्रत्येक परत के माध्यम से कितनी जानकारी प्रवाहित होती है।

LSTM और ResNet से संबंध

हाईवे नेटवर्क सीधे LSTM आवर्तक तंत्रिका नेटवर्क से प्रेरणा लेता है। सेप होचरेइटर ने 1991 में लुप्त होने वाली ग्रेडिएंट समस्या का विश्लेषण किया, इसे गहरे नेटवर्क को प्रशिक्षित करने की कठिनाई के लिए जिम्मेदार ठहराया। मूल LSTM (1997) ने एक स्थिर त्रुटि कैरोसेल पेश किया, जो 1.0 के निश्चित वजन के साथ एक अवशिष्ट कनेक्शन था, जो लंबे समय के चरणों में ग्रेडिएंट्स को प्रवाहित करने की अनुमति देता था। बाद के LSTM संस्करण (2000) ने सीखने योग्य "भूल गेट" जोड़े जो इन पहचान कनेक्शनों को संशोधित करते हैं, लुप्त होने वाली ग्रेडिएंट समस्या को अधिक लचीले ढंग से संबोधित करते हैं।

हाईवे नेटवर्क इन सिद्धांतों को फीडफॉरवर्ड नेटवर्क पर लागू करता है। यह समय में खोले गए भूल गेट वाले LSTM के अनुरूप है, जहां गेट सीखे जाते हैं। इसके विपरीत, दिसंबर 2015 में बाद में प्रकाशित ResNet में भूल गेट के समकक्ष नहीं है; इसके स्किप कनेक्शन हमेशा खुले होते हैं, जो मूल 1997 LSTM के समान हैं। यदि हाईवे नेटवर्क में गेट खुले रखे जाते हैं (सक्रियण 1.0), तो यह ResNet बन जाता है।

अवशिष्ट कनेक्शन व्यापक "शॉर्ट-कट कनेक्शन" या "स्किप कनेक्शन" अवधारणा का एक विशेष मामला है, जो रोसेनब्लैट (1961) और लैंग और विटब्रॉक (1988) से जुड़ा है। ये कनेक्शन \(x \mapsto F(x) + Ax\) का रूप लेते हैं, जहां \(A\) एक वजन मैट्रिक्स है। अवशिष्ट कनेक्शन में, \(A\) पहचान मैट्रिक्स है, लेकिन सामान्य स्किप कनेक्शन में, \(A\) मनमाना हो सकता है। इस प्रकार, हर अवशिष्ट कनेक्शन एक स्किप कनेक्शन है, लेकिन सभी स्किप कनेक्शन अवशिष्ट नहीं हैं।

प्रशिक्षण और प्रदर्शन

मूल हाईवे नेटवर्क पेपर ने 20, 50, और 100 परतों वाले नेटवर्क के साथ प्रयोगों की सूचना दी, और 900 परतों तक के चल रहे कार्य का उल्लेख किया। गेटिंग तंत्र ने इन बहुत गहरे नेटवर्क को प्रभावी ढंग से प्रशिक्षित करने की अनुमति दी, जिससे सादे गहरे नेटवर्क की तुलना में बेहतर अनुकूलन प्राप्त हुआ। सूचना प्रवाह को विनियमित करके, गेट लुप्त होने वाली ग्रेडिएंट समस्या को रोकने में मदद करते हैं, जहां ग्रेडिएंट्स पहले की परतों में वजन अपडेट करने के लिए बहुत छोटे हो जाते हैं।

अन्य गहरे शिक्षण वास्तुकलाओं की तुलना में, हाईवे नेटवर्क बहुत गहरे मॉडल के लिए बेहतर प्रशिक्षण क्षमता का लाभ प्रदान करते हैं। हालांकि, उन्हें गेट के लिए अतिरिक्त मापदंडों की आवश्यकता होती है, जिससे कम्प्यूटेशनल लागत बढ़ जाती है। हाईवे नेटवर्क और ResNet की सफलता ने प्रदर्शित किया कि बहुत गहरी वास्तुकलाओं को प्रभावी ढंग से प्रशिक्षित किया जा सकता है, जिससे गहरे शिक्षण में बाद की प्रगति का मार्ग प्रशस्त हुआ।

अनुप्रयोग और विरासत

हाईवे नेटवर्क को पाठ अनुक्रम लेबलिंग और भाषण पहचान पर लागू किया गया है, जहां जटिल पैटर्न को पकड़ने के लिए गहरी वास्तुकलाएं लाभकारी होती हैं। उन्होंने बाद की वास्तुकलाओं के विकास को भी प्रभावित किया, जैसे कि ResNet, जो कंप्यूटर विज़न में एक मौलिक निर्माण खंड बन गया। गेटेड स्किप कनेक्शन की अवधारणा को आधुनिक गहरे शिक्षण में विभिन्न रूपों में अपनाया गया है, जिसमें ट्रांसफॉर्मर और बड़े भाषा मॉडल शामिल हैं।

हाईवे नेटवर्क के पीछे के विचार गहरे शिक्षण के व्यापक विकास का हिस्सा हैं, जो टोरंटो विश्वविद्यालय जैसे संस्थानों और सेप होचरेइटर और जुर्गन श्मिधुबर जैसे शोधकर्ताओं के योगदान से प्रेरित है। जबकि हाईवे नेटवर्क स्वयं आज कम आमतौर पर उपयोग किए जाते हैं, उनके सिद्धांत बहुत गहरे तंत्रिका नेटवर्क को प्रशिक्षित करने के तरीके को समझने में प्रासंगिक बने हुए हैं।

बाहरी लिंक

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:deep-learning·neural-network-architectures·machine-learning
इस पृष्ठ को अंतिम बार संपादित किया गया 14 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास