भार आरंभीकरण, जिसे पैरामीटर आरंभीकरण भी कहा जाता है, गहन शिक्षण में पूर्व-प्रशिक्षण चरण है जो तंत्रिका नेटवर्क के प्रशिक्षण योग्य मापदंडों, जैसे भार और पूर्वाग्रह, को प्रारंभिक मान प्रदान करता है। ये मापदंड प्रशिक्षण के दौरान संशोधित होते हैं, और आरंभीकरण विधि का चुनाव अभिसरण गति, सक्रियणों के पैमाने, बैकप्रोपेगेशन के दौरान ग्रेडिएंट संकेतों के पैमाने, और अंतिम मॉडल गुणवत्ता को प्रभावित करता है। लुप्त या विस्फोटक ग्रेडिएंट और सक्रियण फलन संतृप्ति जैसी समस्याओं से बचने के लिए उचित आरंभीकरण आवश्यक है।
एक बहुपरत परसेप्ट्रॉन (MLP) में, प्रत्येक परत में एक भार मैट्रिक्स और एक पूर्वाग्रह वेक्टर होता है। आरंभीकरण विधि इन मापदंडों के लिए प्रारंभिक मान निर्धारित करती है। जबकि लेख भार पर केंद्रित है, पूर्वाग्रह भी प्रशिक्षण योग्य हैं और आमतौर पर अलग से आरंभ किए जाते हैं। संवेगी तंत्रिका नेटवर्क (CNN) के लिए, वही सिद्धांत कर्नेल और पूर्वाग्रह पर लागू होते हैं।
स्थिर आरंभीकरण
सबसे सरल रूप शून्य आरंभीकरण है, जहाँ सभी भार और पूर्वाग्रह शून्य पर सेट होते हैं। यह भार के लिए शायद ही उपयोग किया जाता है क्योंकि यह समरूपता की ओर ले जाता है: एक परत के सभी न्यूरॉन समान आउटपुट और ग्रेडिएंट की गणना करते हैं, इसलिए वे समान विशेषताएँ सीखते हैं। शून्य आरंभीकरण आमतौर पर पूर्वाग्रह के लिए उपयोग किया जाता है, लेकिन भार को समरूपता तोड़ने के लिए यादृच्छिक मानों की आवश्यकता होती है।
पूर्वाग्रह आमतौर पर शून्य पर आरंभ किए जाते हैं, लेकिन अपवाद हैं। LSTM के भूलने वाले द्वार जैसी गुणक इकाइयों में, पूर्वाग्रह को 1 पर सेट करने से द्वार के माध्यम से ग्रेडिएंट प्रवाह में सुधार हो सकता है। ReLU न्यूरॉन के लिए, एक छोटा सकारात्मक पूर्वाग्रह (जैसे, 0.1) आरंभीकरण पर गैर-शून्य ग्रेडिएंट सुनिश्चित करके मरते हुए ReLU समस्या को रोक सकता है।
आवर्ती तंत्रिका नेटवर्क (RNN) अक्सर विस्फोटक मानों से बचने के लिए सिग्मॉइड या tanh जैसे बाउंडेड सक्रियण फलनों का उपयोग करते हैं। 2015 में Le, Jaitly, और Hinton द्वारा किए गए कुछ शोध ने आवर्ती भार को पहचान मैट्रिक्स और पूर्वाग्रह को शून्य पर आरंभ करने का सुझाव दिया, जो अवशिष्ट कनेक्शन और बिना भूलने वाले द्वार के LSTM जैसा दिखता है।
यादृच्छिक आरंभीकरण
यादृच्छिक आरंभीकरण भार को सामान्य या समान वितरण से नमूना करता है, आमतौर पर स्वतंत्र रूप से। वितरण और उसके विचरण का चुनाव नेटवर्क के माध्यम से संकेत प्रसार बनाए रखने के लिए महत्वपूर्ण है।
LeCun आरंभीकरण
LeCun आरंभीकरण, जिसे Yann LeCun और सहकर्मियों ने 1998 में लोकप्रिय बनाया, का उद्देश्य फॉरवर्ड पास के दौरान सक्रियण विचरण को संरक्षित करना है। यह प्रत्येक भार को माध्य शून्य और विचरण 1/n_in के साथ एक वितरण से नमूना करता है, जहाँ n_in परत में इनपुट की संख्या (फैन-इन) है। एक समान वितरण के लिए, यह U(±√(3/n_in)) से मेल खाता है। यह विधि tanh जैसे सक्रियण फलनों के साथ अच्छी तरह से काम करती है लेकिन ReLU के लिए उप-इष्टतम हो सकती है।
Glorot आरंभीकरण
Glorot आरंभीकरण, जिसे Xavier आरंभीकरण के रूप में भी जाना जाता है, Xavier Glorot और Yoshua Bengio द्वारा प्रस्तावित किया गया था। यह दो लक्ष्यों को संतुलित करता है: फॉरवर्ड पास में सक्रियण विचरण को संरक्षित करना और बैकवर्ड पास में ग्रेडिएंट विचरण को संरक्षित करना। समान आरंभीकरण के लिए, भार U(±√(6/(n_in + n_out))) से नमूना किए जाते हैं, जहाँ n_out आउटपुट की संख्या (फैन-आउट) है। यह विधि सिग्मॉइड या tanh सक्रियण के लिए प्रभावी है लेकिन इसकी असममित प्रकृति के कारण ReLU के साथ समस्या पैदा कर सकती है।
He आरंभीकरण
He आरंभीकरण, जिसे Kaiming He और सहकर्मियों ने 2015 में पेश किया, ReLU सक्रियण के लिए डिज़ाइन किया गया है। यह विचरण को 2/n_in पर सेट करता है, इस तथ्य के लिए जिम्मेदार है कि ReLU आधे सक्रियणों को शून्य कर देता है। समान वितरण के लिए, भार U(±√(6/n_in)) से नमूना किए जाते हैं। यह विधि ReLU के साथ गहरे नेटवर्क में लुप्त ग्रेडिएंट को रोकने में मदद करती है।
विचरण संरक्षण और ग्रेडिएंट प्रवाह
आरंभीकरण का प्राथमिक लक्ष्य परतों में सक्रियण और ग्रेडिएंट के विचरण को स्थिर रखना है। यदि भार बहुत छोटे हैं, तो सक्रियण सिकुड़ते हैं, जिससे लुप्त ग्रेडिएंट होते हैं। यदि बहुत बड़े हैं, तो सक्रियण बढ़ते हैं, जिससे विस्फोटक ग्रेडिएंट होते हैं। Glorot और He आरंभीकरण फैन-इन और फैन-आउट के आधार पर विचरण सेट करने का एक सैद्धांतिक तरीका प्रदान करते हैं।
गहरे नेटवर्क के लिए, परतों में भार मैट्रिक्स का गुणनफल घातीय वृद्धि या क्षय का कारण बन सकता है। उचित आरंभीकरण सुनिश्चित करता है कि प्रारंभिक संकेत अत्यधिक स्केलिंग के बिना प्रसारित होता है, जिससे शुरुआत से प्रभावी प्रशिक्षण संभव होता है।
प्रशिक्षण गतिशीलता पर प्रभाव
आरंभीकरण न केवल अभिसरण गति को प्रभावित करता है बल्कि अंतिम मॉडल की गुणवत्ता को भी प्रभावित करता है। खराब आरंभीकरण धीमे प्रशिक्षण, स्थानीय न्यूनतम, या अभिसरण में विफलता का कारण बन सकता है। उदाहरण के लिए, शून्य आरंभीकरण समरूपता का कारण बनता है, जबकि अत्यधिक बड़े भार सक्रियण फलनों को संतृप्त कर सकते हैं, जिससे छोटे ग्रेडिएंट होते हैं।
व्यवहार में, आरंभीकरण को अक्सर बैच सामान्यीकरण जैसी अन्य तकनीकों के साथ जोड़ा जाता है, जो आरंभीकरण के प्रति संवेदनशीलता को कम कर सकता है। हालाँकि, अच्छा आरंभीकरण महत्वपूर्ण बना रहता है, विशेष रूप से बहुत गहरे नेटवर्क के लिए या जब सामान्यीकरण का उपयोग नहीं किया जाता है।
विशेष वास्तुकला
विभिन्न वास्तुकला के लिए अनुरूप आरंभीकरण रणनीतियों की आवश्यकता होती है। CNN के लिए, कर्नेल MLP भार के समान आरंभ किए जाते हैं, लेकिन फैन-इन और फैन-आउट की गणना कर्नेल आकार और चैनलों की संख्या के आधार पर की जाती है। ट्रांसफार्मर के लिए, जो लेयर नॉर्मलाइज़ेशन और अवशिष्ट कनेक्शन का उपयोग करते हैं, आरंभीकरण अक्सर छोटे मानक विचलन, जैसे 0.02, का उपयोग करता है, जैसा कि BERT जैसे मॉडलों में देखा गया है।
Large language model के लिए, आरंभीकरण प्रशिक्षण स्थिरता में एक महत्वपूर्ण कारक है। कई आधुनिक मॉडल He या Glorot आरंभीकरण के रूपों का उपयोग करते हैं, कभी-कभी मॉडल गहराई के आधार पर अतिरिक्त स्केलिंग के साथ।
व्यावहारिक विचार
अधिकांश गहन शिक्षण ढांचे में, डिफ़ॉल्ट आरंभीकरण विधियाँ प्रदान की जाती हैं, लेकिन अभ्यासकर्ता उन्हें अनुकूलित कर सकते हैं। उदाहरण के लिए, PyTorch और TensorFlow समान, सामान्य, और ऑर्थोगोनल आरंभीकरण के लिए फलन प्रदान करते हैं। ऑर्थोगोनल आरंभीकरण, जो भार मैट्रिक्स को ऑर्थोगोनल सेट करता है, कभी-कभी RNN के लिए ग्रेडिएंट मानदंडों को संरक्षित करने के लिए उपयोग किया जाता है।
बहुत गहरे नेटवर्क को प्रशिक्षित करते समय, गिरावट से बचने के लिए अवशिष्ट कनेक्शन और सावधानीपूर्वक आरंभीकरण का उपयोग करना आम है। आरंभीकरण का चुनाव सक्रियण फलन और नेटवर्क वास्तुकला के साथ संरेखित होना चाहिए।
ऐतिहासिक संदर्भ
भार आरंभीकरण का अध्ययन तंत्रिका नेटवर्क पर प्रारंभिक कार्य से जुड़ा है। दस्तावेज़ पहचान पर लागू ग्रेडिएंट-आधारित शिक्षण पर LeCun के 1998 के पेपर ने विचरण-संरक्षण आरंभीकरण पेश किया। Glorot और Bengio के 2010 के पेपर "Understanding the difficulty of training deep feedforward neural networks" ने गहरे नेटवर्क के लिए आरंभीकरण के महत्व पर प्रकाश डाला। He et al. के 2015 के पेपर ने गहरे अवशिष्ट शिक्षण पर ReLU नेटवर्क के लिए विधियों को और परिष्कृत किया।
इन मौलिक कार्यों ने आधुनिक अभ्यास को आकार दिया है, और आरंभीकरण अनुसंधान का एक सक्रिय क्षेत्र बना हुआ है, विशेष रूप से अत्यंत गहरे या बड़े पैमाने के मॉडल के लिए।
निष्कर्ष
भार आरंभीकरण तंत्रिका नेटवर्क को प्रशिक्षित करने में एक मौलिक कदम है। शून्य, यादृच्छिक, LeCun, Glorot, और He आरंभीकरण जैसी विधियों में से प्रत्येक के विशिष्ट उपयोग के मामले और व्यापार-बंद हैं। आरंभीकरण का चुनाव प्रशिक्षण गतिशीलता, अभिसरण, और अंतिम प्रदर्शन को महत्वपूर्ण रूप से प्रभावित कर सकता है। इन विधियों को समझना Deep learning मॉडल पर काम करने वाले अभ्यासकर्ताओं के लिए आवश्यक है, सरल MLP से लेकर जटिल Transformer (architecture) वास्तुकला तक।