अंग्रेज़ी से अनुवादित

भार आरंभीकरण रणनीतियाँ प्रशिक्षण से पहले तंत्रिका नेटवर्क मापदंडों को प्रारंभिक मान निर्दिष्ट करती हैं, जिसका उद्देश्य लुप्त होते या विस्फोटित ग्रेडिएंट्स को रोकना और अभिसरण में सुधार करना है। विधियों में शून्य, यादृच्छिक, ज़ेवियर, और हे आरंभीकरण शामिल हैं।

भार आरंभीकरण, जिसे पैरामीटर आरंभीकरण भी कहा जाता है, तंत्रिका नेटवर्क के प्रशिक्षण योग्य पैरामीटरों को प्रारंभिक मान निर्दिष्ट करने का पूर्व-प्रशिक्षण चरण है। डीप लर्निंग में, एक तंत्रिका नेटवर्क में भार और पूर्वाग्रह होते हैं जिन्हें प्रशिक्षण के दौरान संशोधित किया जाता है; प्रारंभिक मानों का चुनाव अभिसरण की गति, सक्रियणों के पैमाने, बैकप्रोपेगेशन के दौरान ग्रेडिएंट संकेतों के पैमाने और अंतिम मॉडल की गुणवत्ता को प्रभावित करता है। लुप्त होते और विस्फोटित होते ग्रेडिएंट तथा सक्रियण फलन संतृप्ति जैसी समस्याओं से बचने के लिए उचित आरंभीकरण आवश्यक है। हालाँकि लेख का शीर्षक "भार आरंभीकरण" है, भार और पूर्वाग्रह दोनों प्रशिक्षण योग्य पैरामीटर हैं, और वही सिद्धांत संवेगात्मक तंत्रिका नेटवर्क (सीएनएन) में संवेगात्मक कर्नेल और पूर्वाग्रहों पर लागू होते हैं।

स्थिर आरंभीकरण

आरंभीकरण का सबसे सरल रूप शून्य आरंभीकरण है, जहाँ सभी भार और पूर्वाग्रह शून्य पर सेट किए जाते हैं। यह आमतौर पर पूर्वाग्रहों के लिए उपयोग किया जाता है लेकिन भारों के लिए नहीं, क्योंकि यह समरूपता की ओर ले जाता है: एक परत के सभी न्यूरॉन्स समान ग्रेडिएंट प्राप्त करते हैं और इस प्रकार समान विशेषताएँ सीखते हैं, जो नेटवर्क की क्षमता को गंभीर रूप से सीमित करता है। अधिकांश मामलों में, पूर्वाग्रह शून्य पर आरंभ किए जाते हैं, लेकिन कुछ स्थितियों में गैर-शून्य मानों की आवश्यकता होती है। उदाहरण के लिए, एलएसटीएम के भूलने के द्वार जैसी गुणक इकाइयों में, पूर्वाग्रह को 1 पर आरंभ किया जा सकता है ताकि द्वार के माध्यम से अच्छा ग्रेडिएंट संकेत प्रवाहित हो सके। रेलु सक्रियण वाले न्यूरॉन्स के लिए, पूर्वाग्रह को 0.1 जैसे छोटे सकारात्मक मान पर आरंभ करने से मृत रेलु समस्या से बचने में मदद मिल सकती है, जहाँ न्यूरॉन्स निष्क्रिय हो जाते हैं और सीखना बंद कर देते हैं।

आवर्तक तंत्रिका नेटवर्क (आरएनएन) के लिए, सीमित सीमा वाले सक्रियण फलन (जैसे सिग्मॉइड या तनह) आमतौर पर उपयोग किए जाते हैं, क्योंकि असीमित सक्रियण विस्फोटित मानों का कारण बन सकते हैं। ले, जेटली और हिंटन (2015) ने नेटवर्क के आवर्तक भागों में भारों को पहचान मैट्रिक्स और पूर्वाग्रहों को शून्य पर आरंभ करने का सुझाव दिया, जो अवशिष्ट कनेक्शन और बिना भूलने के द्वार वाले एलएसटीएम के विचार के समान है।

यादृच्छिक आरंभीकरण

यादृच्छिक आरंभीकरण में भारों को सामान्य या समान वितरण से नमूना लेना शामिल है, आमतौर पर प्रत्येक भार के लिए स्वतंत्र रूप से। यह समरूपता को तोड़ता है और विभिन्न न्यूरॉन्स को विभिन्न विशेषताएँ सीखने की अनुमति देता है। वितरण का पैमाना महत्वपूर्ण है: बहुत बड़े मान विस्फोटित सक्रियण या ग्रेडिएंट का कारण बन सकते हैं, जबकि बहुत छोटे मान लुप्त संकेतों का कारण बन सकते हैं। उपयुक्त पैमाने चुनने के लिए कई विधियाँ विकसित की गई हैं।

लेकुन आरंभीकरण

लेकुन आरंभीकरण, जिसे 1998 में यान लेकुन और सहकर्मियों द्वारा लोकप्रिय बनाया गया, आगे के पास के दौरान सक्रियणों के विचरण को संरक्षित करने के लिए डिज़ाइन किया गया है। यह प्रत्येक भार को माध्य 0 और विचरण 1/n_in के साथ एक वितरण से स्वतंत्र रूप से नमूना लेता है, जहाँ n_in परत में इनपुट की संख्या (फैन-इन) है। एक समान वितरण के लिए, यह U(±√(3/n_in)) से नमूना लेने के अनुरूप है। यह विधि उन सक्रियण फलनों के साथ अच्छी तरह से काम करती है जो शून्य के पास लगभग रैखिक हैं, जैसे तनह, लेकिन रेलु के लिए उप-इष्टतम हो सकती है।

ग्लोरोट आरंभीकरण

ग्लोरोट आरंभीकरण, जिसे ज़ेवियर आरंभीकरण के रूप में भी जाना जाता है, 2010 में ज़ेवियर ग्लोरोट और योशुआ बेंजियो द्वारा प्रस्तावित किया गया था। इसे दो लक्ष्यों के बीच एक समझौते के रूप में डिज़ाइन किया गया था: आगे के पास के दौरान सक्रियण विचरण को संरक्षित करना और पीछे के पास के दौरान ग्रेडिएंट विचरण को संरक्षित करना। समान आरंभीकरण के लिए, प्रत्येक भार U(±√(6/(n_in + n_out))) से नमूना लिया जाता है, जहाँ n_in फैन-इन है और n_out फैन-आउट (अगली परत में न्यूरॉन्स की संख्या) है। यह विधि सिग्मॉइड या तनह सक्रियण वाले नेटवर्कों के लिए व्यापक रूप से उपयोग की जाती है, लेकिन सुधारात्मक अरैखिकता के कारण रेलु के लिए कम प्रभावी हो सकती है।

हे आरंभीकरण

हे आरंभीकरण, जो 2015 में कैमिंग हे और सहकर्मियों द्वारा प्रस्तावित किया गया, विशेष रूप से रेलु सक्रियणों के लिए डिज़ाइन किया गया है। यह भारों को माध्य 0 और विचरण 2/n_in के साथ एक वितरण से नमूना लेता है, जहाँ n_in फैन-इन है। एक सामान्य वितरण के लिए, यह N(0, 2/n_in) है; एक समान वितरण के लिए, यह U(±√(6/n_in)) है। कारक 2 इस तथ्य को ध्यान में रखता है कि रेलु आधे सक्रियणों को शून्य कर देता है, प्रभावी रूप से विचरण को आधा कर देता है। हे आरंभीकरण कई गहरे नेटवर्कों के लिए डिफ़ॉल्ट विकल्प बन गया है, जिसमें अवशिष्ट नेटवर्क और सीएनएन शामिल हैं।

ऑर्थोगोनल आरंभीकरण

ऑर्थोगोनल आरंभीकरण भार मैट्रिक्स को एक यादृच्छिक ऑर्थोगोनल मैट्रिक्स पर सेट करता है, जिसका अर्थ है कि पंक्तियाँ और स्तंभ ऑर्थोनॉर्मल हैं। यह आगे और पीछे के पास के दौरान सक्रियणों और ग्रेडिएंटों के मानक को संरक्षित करता है, जो आवर्तक तंत्रिका नेटवर्क और गहरे नेटवर्कों के लिए फायदेमंद है। यह अक्सर आरएनएन और एलएसटीएम में लुप्त ग्रेडिएंट को कम करने के लिए उपयोग किया जाता है। यह विधि आमतौर पर आवर्तक भार मैट्रिक्स पर लागू की जाती है, जबकि अन्य भार यादृच्छिक आरंभीकरण का उपयोग कर सकते हैं।

डेटा-निर्भर आरंभीकरण

कुछ मामलों में, आरंभीकरण प्रशिक्षण डेटा से ही प्राप्त किया जा सकता है। उदाहरण के लिए, अनुपर्यवेक्षित पूर्व-प्रशिक्षण में, ऑटोएनकोडर को परत-वार लालची प्रशिक्षण का उपयोग करके आरंभ किया जा सकता है। हाल ही में, परत-वार अनुक्रमिक आरंभीकरण जैसी डेटा-निर्भर विधियों का पता लगाया गया है। हालाँकि, कम्प्यूटेशनल लागत और जटिलता के कारण ये निश्चित यादृच्छिक विधियों की तुलना में कम सामान्य हैं।

प्रशिक्षण गतिशीलता पर प्रभाव

आरंभीकरण का चुनाव प्रशिक्षण के कई पहलुओं को प्रभावित करता है। उचित आरंभीकरण अभिसरण को तेज कर सकता है, लुप्त या विस्फोटित ग्रेडिएंट के जोखिम को कम कर सकता है, और अंतिम मॉडल की गुणवत्ता में सुधार कर सकता है। इसके विपरीत, खराब आरंभीकरण धीमे प्रशिक्षण, संतृप्त सक्रियण, या अभिसरण में विफलता का कारण बन सकता है। गहरे नेटवर्कों में, आरंभीकरण और सक्रियण फलनों के बीच परस्पर क्रिया महत्वपूर्ण है; उदाहरण के लिए, रेलु नेटवर्कों को संकेत प्रसार बनाए रखने के लिए तनह नेटवर्कों की तुलना में बड़े प्रारंभिक भार की आवश्यकता होती है।

व्यावहारिक विचार

आधुनिक डीप लर्निंग फ्रेमवर्क में, आरंभीकरण विधियाँ अंतर्निहित हैं और एक पैरामीटर के माध्यम से चुनी जा सकती हैं। उदाहरण के लिए, पायटॉर्च और टेन्सरफ्लो ज़ेवियर और हे आरंभीकरण के लिए फ़ंक्शन प्रदान करते हैं। ट्रांसफॉर्मर जैसे बड़े मॉडलों को प्रशिक्षित करते समय, सावधानीपूर्वक आरंभीकरण आवश्यक है; उदाहरण के लिए, ट्रांसफॉर्मर में अवशिष्ट शाखाओं को अक्सर शून्य पर आरंभ किया जाता है ताकि शुरुआत में स्थिर प्रशिक्षण सुनिश्चित हो सके। यह नेटवर्क के विशिष्ट भागों के लिए शून्य आरंभीकरण का एक रूप है।

संबंधित तकनीकें

भार आरंभीकरण ग्रेडिएंट मुद्दों को संबोधित करने वाली अन्य तकनीकों से निकटता से संबंधित है, जैसे Batch Normalization, Layer Normalization, और Gradient Clipping। ये विधियाँ खराब आरंभीकरण के प्रभावों को कम कर सकती हैं लेकिन एक उचित प्रारंभिक बिंदु की आवश्यकता को प्रतिस्थापित नहीं करती हैं। व्यवहार में, बहुत गहरे नेटवर्कों को प्रशिक्षित करने के लिए अच्छे आरंभीकरण और सामान्यीकरण का संयोजन अक्सर उपयोग किया जाता है।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:deep-learning·neural-network·initialization·training
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास