अंग्रेज़ी से अनुवादित

बैच नॉर्मलाइज़ेशन कृत्रिम तंत्रिका नेटवर्क में एक तकनीक है जो परत इनपुट को सामान्य करती है ताकि प्रशिक्षण को स्थिर और तेज किया जा सके। 2015 में सर्गेई इओफ़े और क्रिश्चियन स्ज़ेगेडी द्वारा प्रस्तुत, यह मिनी-बैच आँकड़ों का उपयोग करके सक्रियणों को पुनः-केंद्रित और पुनः-स्केल करता है, जिससे उच्च सीखने की दरें संभव होती हैं और सामान्यीकरण में सुधार होता है।

बैच नॉर्मलाइज़ेशन (जिसे बैच नॉर्म के रूप में भी जाना जाता है) एक नॉर्मलाइज़ेशन तकनीक है जिसका उपयोग कृत्रिम तंत्रिका नेटवर्क में प्रशिक्षण को तेज़ और अधिक स्थिर बनाने के लिए किया जाता है, प्रत्येक परत के इनपुट को समायोजित करके, उन्हें शून्य के आसपास पुनः-केंद्रित करके और उन्हें एक मानक आकार में पुनः-स्केल करके। इसे 2015 में सर्गेई इओफ़े और क्रिश्चियन स्ज़ेगेडी द्वारा पेश किया गया था। यह विधि कई Deep learning आर्किटेक्चर में एक मानक घटक बन गई है, विशेष रूप से कन्वोल्यूशनल और पूरी तरह से जुड़े नेटवर्क में, और आधुनिक Machine learning प्रणालियों में व्यापक रूप से उपयोग की जाती है, जिसमें Large language model और अन्य Generative AI अनुप्रयोगों को शक्ति देने वाले शामिल हैं।

मुख्य विचार प्रशिक्षण डेटा के एक मिनी-बैच पर प्रत्येक परत के सक्रियणों को नॉर्मलाइज़ करना है, प्रत्येक आयाम के लिए माध्य और प्रसरण की गणना करना और फिर मानों को स्थानांतरित और स्केल करना है। यह प्रक्रिया नेटवर्क की प्रारंभिकीकरण और हाइपरपैरामीटर विकल्पों के प्रति संवेदनशीलता को कम करती है, जिससे चिकित्सकों को उच्च सीखने की दरों का उपयोग करने की अनुमति मिलती है और अक्सर ड्रॉपआउट जैसी अन्य नियमितीकरण तकनीकों की आवश्यकता कम हो जाती है। इसके व्यापक रूप से अपनाने के बावजूद, इसकी प्रभावशीलता के सटीक कारण सक्रिय शोध और बहस का विषय बने हुए हैं।

ऐतिहासिक संदर्भ

बैच नॉर्मलाइज़ेशन बहुत गहरे तंत्रिका नेटवर्क को प्रशिक्षित करने की चुनौतियों का समाधान करने के प्रयासों से उभरा। 2010 के दशक की शुरुआत में, Google DeepMind, OpenAI और अन्य प्रयोगशालाओं के शोधकर्ता अभिसरण गति और स्थिरता में सुधार के तरीकों की खोज कर रहे थे। इओफ़े और स्ज़ेगेडी का 2015 का पेपर, दोनों तब Google में थे, ने एक व्यावहारिक समाधान प्रस्तावित किया जिसे न्यूनतम ओवरहेड के साथ मौजूदा प्रशिक्षण पाइपलाइनों में एकीकृत किया जा सकता था। तकनीक ने जल्दी ही लोकप्रियता हासिल की और TensorFlow और PyTorch सहित कई फ्रेमवर्क में एक डिफ़ॉल्ट विकल्प बन गई।

बैच नॉर्मलाइज़ेशन से पहले, गहरे नेटवर्क को प्रशिक्षित करने के लिए अक्सर लुप्त या विस्फोटक ग्रेडिएंट जैसी समस्याओं से बचने के लिए सीखने की दरों, वजन प्रारंभिकीकरण योजनाओं और सक्रियण कार्यों के सावधानीपूर्वक समायोजन की आवश्यकता होती थी। बैच नॉर्मलाइज़ेशन ने एक अधिक व्यवस्थित दृष्टिकोण प्रदान किया, और इसकी सफलता ने संबंधित नॉर्मलाइज़ेशन तकनीकों के एक परिवार को प्रेरित किया, जैसे कि लेयर नॉर्मलाइज़ेशन और इंस्टेंस नॉर्मलाइज़ेशन, जो विभिन्न संदर्भों में उपयोग किए जाते हैं।

आंतरिक सहप्रसरण बदलाव

तंत्रिका नेटवर्क में प्रत्येक परत के इनपुट एक विशिष्ट वितरण का पालन करते हैं, जो प्रशिक्षण के दौरान दो मुख्य कारकों के कारण बदलता है: नेटवर्क के पैरामीटरों के यादृच्छिक प्रारंभिक मान (पैरामीटर प्रारंभिकीकरण) और इनपुट डेटा में प्राकृतिक भिन्नता। नेटवर्क की आंतरिक परतों के इनपुट को प्रभावित करने वाला यह बदलता पैटर्न आंतरिक सहप्रसरण बदलाव कहलाता है। हालांकि एक सख्त परिभाषा पर पूरी तरह से सहमति नहीं है, प्रयोगों से पता चलता है कि इसमें प्रशिक्षण के दौरान इन इनपुट के माध्य और प्रसरण में परिवर्तन शामिल हैं।

बैच नॉर्मलाइज़ेशन को पहले आंतरिक सहप्रसरण बदलाव को संबोधित करने के लिए विकसित किया गया था। प्रशिक्षण के दौरान, जैसे-जैसे पिछली परतों के पैरामीटर समायोजित होते हैं, वर्तमान परत के इनपुट का वितरण तदनुसार बदलता है, जिससे वर्तमान परत को नए वितरणों के लिए लगातार पुनः समायोजित करना पड़ता है। यह समस्या गहरे नेटवर्क में विशेष रूप से गंभीर है, क्योंकि उथली छिपी परतों में छोटे परिवर्तन नेटवर्क के भीतर प्रसारित होने पर बढ़ जाते हैं, जिसके परिणामस्वरूप गहरी छिपी परतों में महत्वपूर्ण बदलाव होता है। बैच नॉर्मलाइज़ेशन को प्रशिक्षण को तेज़ करने और अधिक विश्वसनीय मॉडल बनाने के लिए इन अवांछित बदलावों को कम करने के लिए प्रस्तावित किया गया था।

आंतरिक सहप्रसरण बदलाव को संभावित रूप से संबोधित करने के अलावा, बैच नॉर्मलाइज़ेशन कई अतिरिक्त लाभ प्रदान करता है। यह नेटवर्क को उच्च सीखने की दर का उपयोग करने की अनुमति देता है, एक सेटिंग जो नियंत्रित करती है कि नेटवर्क कितनी जल्दी सीखता है, बिना लुप्त या विस्फोटक ग्रेडिएंट जैसी समस्याओं के, जहां अद्यतन बहुत छोटे या बहुत बड़े हो जाते हैं। यह एक नियमितीकरण प्रभाव भी प्रतीत होता है, जो नेटवर्क की नए डेटा पर सामान्यीकरण करने की क्षमता में सुधार करता है, ड्रॉपआउट की आवश्यकता को कम करता है, एक तकनीक जो ओवरफिटिंग को रोकने के लिए उपयोग की जाती है (जब एक मॉडल प्रशिक्षण डेटा को बहुत अच्छी तरह से सीखता है और नए डेटा पर विफल हो जाता है)। इसके अतिरिक्त, बैच नॉर्मलाइज़ेशन का उपयोग करने वाले नेटवर्क प्रारंभिक सेटिंग्स या सीखने की दरों की पसंद के प्रति कम संवेदनशील होते हैं, जिससे वे अधिक मजबूत और अनुकूलनीय बन जाते हैं।

प्रक्रिया

परिवर्तन

तंत्रिका नेटवर्क में, बैच नॉर्मलाइज़ेशन एक नॉर्मलाइज़ेशन चरण के माध्यम से प्राप्त किया जाता है जो प्रत्येक परत के इनपुट के माध्य और प्रसरण को स्थिर करता है। आदर्श रूप से, नॉर्मलाइज़ेशन पूरे प्रशिक्षण सेट पर किया जाना चाहिए, लेकिन इस चरण को स्टोकेस्टिक अनुकूलन विधियों के साथ संयुक्त रूप से उपयोग करने के लिए, वैश्विक जानकारी का उपयोग करना अव्यावहारिक है। इस प्रकार, नॉर्मलाइज़ेशन प्रशिक्षण प्रक्रिया में प्रत्येक मिनी-बैच तक सीमित है।

मान लीजिए \(B\) पूरे प्रशिक्षण सेट से आकार \(m\) के एक मिनी-बैच को दर्शाता है। \(B\) के अनुभवजन्य माध्य और प्रसरण की गणना इस प्रकार की जाती है:

\[

\mu_B = \frac{1}{m} \sum_{i=1}^{m} x_i

\]

और

\[

\sigma_B^2 = \frac{1}{m} \sum_{i=1}^{m} (x_i - \mu_B)^2

\]

एक \(d\)-आयामी इनपुट \(x = (x^{(1)}, \ldots, x^{(d)})\) वाली परत के लिए, प्रत्येक आयाम को अलग से नॉर्मलाइज़ किया जाता है। मिनी-बैच में प्रत्येक आयाम \(k\) और प्रत्येक नमूना \(i\) के लिए, नॉर्मलाइज़ किया गया मान है:

\[

\hat{x}_i^{(k)} = \frac{x_i^{(k)} - \mu_B^{(k)}}{\sqrt{(\sigma_B^{(k)})^2 + \epsilon}}

\]

जहां \(\epsilon\) संख्यात्मक स्थिरता के लिए जोड़ा गया एक छोटा स्थिरांक है, आमतौर पर \(10^{-5}\) के क्रम पर। यह सुनिश्चित करता है कि नॉर्मलाइज़ किए गए सक्रियणों का माध्य शून्य और प्रसरण एक हो।

स्केलिंग और शिफ्टिंग

इनपुट को केवल नॉर्मलाइज़ करना परत की प्रतिनिधित्व क्षमता को प्रतिबंधित कर सकता है, इसलिए बैच नॉर्मलाइज़ेशन प्रति आयाम दो सीखने योग्य पैरामीटर पेश करता है: एक स्केल कारक \(\gamma^{(k)}\) और एक शिफ्ट \(\beta^{(k)}\)। बैच नॉर्मलाइज़ेशन परत का अंतिम आउटपुट है:

\[

y_i^{(k)} = \gamma^{(k)} \hat{x}_i^{(k)} + \beta^{(k)}

\]

ये पैरामीटर प्रशिक्षण के दौरान बैकप्रोपेगेशन के माध्यम सीखे जाते हैं, जिसस नेटवर्k को नॉर्मलाइज़ेशन कों पूर्ववत करन की अनुमत देत है यदि यह कार्य के लिए इष्टतम है। व्यवहार में, \(\gamma\) अक्सर 1 और \(\beta\) को 0 से प्रारंभ किया जाता है, इसलिए परत शुरू में मानक नॉर्मलाइज़ेशन करती है और फिर अनुकूलित होती है।

अनुमान

प्रशिक्षण के दौरान, माध्य और प्रसरण की गणना वर्तमान मिनी-बैच सी की जाती है। हालांकि, अनुमान के समय (नए डेटा पर भविष्यवाणीय करत समय), मिनी-बैच क आकर 1 ह सकत ह य फिर उपलब्ध न ह सकत। इसस निपटन क लिए, नेटवर्क प्रशिक्षण के दौरान गणना किए गए माध्य और प्रसरण के चल रहे औसत का उपयोग करता है। ये चल रहे आंकड़े प्रत्येक मिनी-बैच के साथ अद्यतन किए जाते हैं, आमतौर पर एक गत कारक (अकसर 0.99) क साथ एक चलत औसत क उपयग करत ह। अनुमान क समय, नॉर्मलाइज़ेशन इन सथिर आंकड़ो क उपयग करत ह, जिसस संचालन निर्धारित और बैच आकर स सवतंत्र ह जात ह।

सैद्धांतिक स्पष्टीकरण

विशेषज अभी बहस करत ह कि बैच नॉर्मलाइज़ेशन इतन अचछ तरह स कय काम करत ह। शुरुआत में यह सोचा गया था कि यह आंतरिक सहप्रसरण बदलाव को संबोधित करता है, एक समस्या जहां पैरामीटर प्रारंभिकीकरण और प्रत्येक परत के इनपुट के वितरण में परिवर्तन नेटवर्क की सीखने की दर को प्रभावित करते हैं। हालांकि, नए शोध से पता चलता है कि यह इस बदलाव को ठीक नहीं करता है बल्कि उद्देश्य फलन को सुचारू करता है, एक गणितीय मार्गदर्शक जिसक पालन नेटवरक सुधार क लिए करत ह, पर्दशन म सुधार करत ह। बहुत गहरे नेटवर्क में, बैच नॉर्मलाइज़ेशन शुरू में एक गंभीर ग्रेडिएंट विस्फोट का कारण बन सकता है, जहां नेटवर्क में अद्यतन अनियंत्रित रूप से बड़े हो जाते हैं, लेकिन इसका पर्बंधन अवशेष नेटवर्k मे स्किप कनेक्शन नामक शॉर्टकट के साथ किया जाता है। एक और सिद्धांत यह है कि बैच नॉर्मलाइज़ेशन डेटा को उसके आकार और पथ को अलग से संभालकर समायोजित करता है, प्रशिक्षण को तेज करता है।

Aleksander Madry और अन्यों क द्वारा शोध ने दिखाया है कि बैच नॉर्मलाइज़ेशन अनुकूलन परिदृश्य क काफी अधिक सुचारू बनाता है, हानि क नुकसान फलन क लिप्सचित्ज़ स्थिरांक क कम करत है। यह सुचारू करने वाला प्रभाव ग्रेडिएंट डीसेंट को बिना विचलित हुए बड़े कदम उठाने की अनुमति देता है, जो बताता है कि उच्च सीखने की दरें व्यवहार्य क्यों हो जाती हैं। अन्य कार्यों ने बताया है कि बैच नॉर्मलाइज़ेशन प्रशिक्षण प्रक्रिया में शोर जोड़कर अप्रत्यक्ष नियमितीकरण का एक रूप पेश करता है, क्योंकि मिनी-बैच आंकड़े बैच स बैच बदलत रहत हं।

वैरिएंट और विsतार

बैच नॉर्मलाइज़ेशन ने विभिन्न आर्किटेक्चर और सेटिंग क लिए तैलर कए गए कई वैरिएंट क पेरणा कि। लेयर नॉर्मलाइज़ेशन, jimmy-lei-ba और jamie-kiros द्वारा 2016 मे पेश, पर्टेक वयकतिग नमूने क लिए फीचर क पार प नॉर्मलाइज़ करत ह, बैच क पार नहीं, जिसस यह आवरावर्ती नेटवर्k और टरांसफॉर्मर क लिए उपयुकत ह। इंस्टेंस नॉर्मलाइज़ेशन, जो स्टाइल टरांसफर मे उपयोग ह, पर्हेक नमूने क लिए पर्हेक चैनल क नॉर्मलाइज़ करता है। ग्रूप नॉर्मलाइज़ेशन, yuxin-wu और Kaiming He द्वारा 2018 में प्रस्तावित, चैनलों को समूहों में विभाजित करता है और प्रत्येक समूह के भीतर नॉर्मलाइज़ करता है, छोटे बैच आकारों के साथ अच्छा प्रदर्शन करता है।

Transformer (architecture) मॉडल के संदर्भ में, जो कई Large language model को रेखांकित करते हैं, लेयर नॉर्मलाइज़ेशन बैच नॉर्मलाइज़ेशन स अधिक सामान्य ह, लेकिन बैच नॉर्मलाइज़ेशन कन्वोल्यूशनल नेटवर्k मे इमेज वर्गीकरण और ऑबजेकट डिटेक्शन जैस कार्यो क लिए अभी भी उपयोग किया जाता है। कुछ हाइब्रिड दृष्टिकोण, जैसे स्विचेबल नॉर्मलाइज़ेशन, विभिन्न नॉर्मलाइज़ेशन वििधियो क दयनामिक रूप स संयोजित करन सीखत ह।

व्ावहारिक विचार

बैच नॉर्मलाइज़ेशन क लागू करन क लिए पर्शिखण और अनुमान चरणो पर सावधानीपूवक धयान देन क आवशयकत ह। पर्शिखण क दौरान, बैच क आकर पर्ंाप्त रूप स बड़ा होन चाहिए ताकि माध्य और पर्सरण क विश्वसनीय अनुमान पर्दान हो सकें; छोटे बैच अशोर्k आंकड़ो और अस्थिर पर्शिखण क कारण बन सकत ह। वितरित पर्शिखण मे, जहां वैश्विक बैच आकर क कई उपकरणो मे विभाजित किा जाता ह, माध्य और पर्सरण आमतौर पर पर्हत उपकरण पर गणना किए जाते ह, जिसस असंगतियां हो सकत ह। सिंक्रोनाइड बैच नॉर्मलाइज़ेशन जैसी तकनीक, जो उपकरणो क पार आंकड़ो क एकत्र करत ह, इस संबोधन क लिए विकसित की गई ह।

बैच नॉर्मलाइज़ेशन नेटवर्k क अन्य घटको क साथ भी इंटरैक्ट करत ह। उदाहरण क लिए, इसे अकसर रैखिक परिवर्तन के बाद लेकिन सक्रियण फलन से पहले रखा जाता है, हालांकि सटीक स्थान भिन्न हो सकता है। अवशेष नेटवर्k मे, बैच नॉर्मलाइज़ेशन क सकिप कनेक्शन जोड़न स पहल लागू किा जाता ह, जो पहल बताए गए ग्रेडिएंट विस्फोट क कम करन मे मदद करत ह।

पर्भाव और विरासत

बैच नॉर्मलाइज़ेशन क पेश क नेटवर्k क ेत्र Artificial intelligence पर गहरा पर्भाव डाला। इसन 152-परत ResNet जैस गहर नेटवर्k क पर्शिखण सकषम बनाया, जिसन 2015 मे ImageNet पर्िितयोिगता जीती। इसन हाइपरपैरामीटर ट्यूनिंग क कम बोझा दिया, शैक्षाजगत और उद्योग दोनो मे पर्िोग क तेज किया। आज, बैच नॉर्मलाइज़ेशन डीप लरनिंग टूलबॉक्स मे एक मौलिक उपकरण बना हुआ ह, और इसक सिद्धांतो ने कई पर्िवर्ती नॉर्मलाइज़ेशन तकनीकों के डिजाइन को प्रभावित किया है। इसके सैद्धांतिक आधारो क बारे मे चल रही बहस क बावजूद, इसक व्ावहारिक लाभ निर्विवाद ह, और यह कई अति-आधुनिक मॉडलो मे एक मुख्य घटक बना हुआ ह।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:deep-learning·neural-networks·optimization·normalization
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास