अंग्रेज़ी से अनुवादित

वेट डेके एक नियमितीकरण तकनीक है जो लॉस फंक्शन में वेट्स के वर्गित परिमाण के अनुपात में दंड जोड़ती है, जिसका उपयोग आमतौर पर न्यूरल नेटवर्क में ओवरफिटिंग को रोकने के लिए किया जाता है।

वेट डेके (Weight decay) मशीन लर्निंग में उपयोग की जाने वाली एक नियमितीकरण तकनीक है, जो मॉडल के वेट्स के वर्ग परिमाण के अनुपात में लॉस फ़ंक्शन में एक पेनल्टी टर्म जोड़कर ओवरफिटिंग को रोकती है। यह पेनल्टी मॉडल को वेट्स को छोटा रखने के लिए प्रोत्साहित करती है, जो आमतौर पर सरल मॉडल की ओर ले जाती है जो अनदेखे डेटा पर बेहतर सामान्यीकरण करते हैं। वेट डेके को सबसे आम तौर पर L2 नियमितीकरण के रूप में लागू किया जाता है, जहाँ पेनल्टी वेट्स के वर्गों का योग होता है, जिसे एक हाइपरपैरामीटर (अक्सर lambda या weight_decay के रूप में दर्शाया जाता है) से गुणा किया जाता है। यह गहरे तंत्रिका नेटवर्क, जिसमें बड़े भाषा मॉडल शामिल हैं, को प्रशिक्षित करने में एक मानक उपकरण है, और सभी प्रमुख डीप लर्निंग फ्रेमवर्क द्वारा समर्थित है।

इस अवधारणा की जड़ें शास्त्रीय सांख्यिकी में हैं, जहाँ रिज रिग्रेशन (जिसे टिखोनोव नियमितीकरण भी कहा जाता है) रैखिक मॉडल पर समान विचार लागू करता है। तंत्रिका नेटवर्क के संदर्भ में, वेट डेके को 1980 और 1990 के दशक में लोकप्रिय बनाया गया था, विशेष रूप से एंडर्स क्रॉग और जॉन हर्ट्ज जैसे शोधकर्ताओं के काम के माध्यम से, जिन्होंने सामान्यीकरण में सुधार करने में इसकी प्रभावशीलता प्रदर्शित की। आज, वेट डेके डीप लर्निंग अभ्यास में सर्वव्यापी है, जिसे अक्सर ड्रॉपआउट और बैच नॉर्मलाइज़ेशन जैसी अन्य नियमितीकरण विधियों के साथ संयोजन में उपयोग किया जाता है।

तंत्र और गणितीय सूत्रीकरण

मानक प्रशिक्षण में, लॉस फ़ंक्शन मापता है कि मॉडल प्रशिक्षण डेटा को कितनी अच्छी तरह फिट करता है। वेट डेके के साथ, उद्देश्य बन जाता है:

L_total = L_data + (lambda / 2) * sum(w_i^2)

जहाँ L_data मूल लॉस है (जैसे, क्रॉस-एंट्रॉपी), lambda नियमितीकरण गुणांक है, और योग सभी प्रशिक्षण योग्य वेट्स पर चलता है। 1/2 का कारक कभी-कभी गणितीय सुविधा के लिए शामिल किया जाता है, क्योंकि यह व्युत्पन्न को सरल बनाता है। ग्रेडिएंट डिसेंट के दौरान, प्रत्येक वेट के लिए अद्यतन नियम बन जाता है:

w_i <- w_i - learning_rate (dL_data/dw_i + lambda w_i)

यह दर्शाता है कि वेट डेके प्रभावी रूप से प्रत्येक चरण पर वेट्स को (1 - learning_rate * lambda) के कारक से सिकोड़ता है, ग्रेडिएंट अद्यतन के अतिरिक्त। यह सिकुड़न ही है जिसके कारण 'वेट डेके' शब्द का उपयोग किया जाता है।

व्यवहार में, PyTorch और TensorFlow जैसे फ्रेमवर्क वेट डेके को या तो लॉस में जोड़े गए एक अलग पेनल्टी के रूप में या ऑप्टिमाइज़र में एक पैरामीटर के रूप में (जैसे, AdamW) लागू करते हैं। बाद वाला दृष्टिकोण, डिकपल्ड वेट डेके, ग्रेडिएंट के माध्यम से नहीं बल्कि सीधे वेट्स पर डेके लागू करता है, जो प्रशिक्षण गतिशीलता में सुधार कर सकता है, विशेष रूप से अनुकूली ऑप्टिमाइज़र के लिए।

ओवरफिटिंग को रोकने में भूमिका

ओवरफिटिंग तब होती है जब एक मॉडल प्रशिक्षण डेटा को बहुत अच्छी तरह सीखता है, जिसमें शोर भी शामिल है, और नए डेटा पर सामान्यीकरण करने में विफल रहता है। बड़े वेट्स अक्सर संकेत देते हैं कि मॉडल प्रशिक्षण सेट में विशिष्ट पैटर्न में फिट हो रहा है। बड़े वेट्स को दंडित करके, वेट डेके मॉडल को अधिक वितरित और कम चरम समाधान खोजने के लिए मजबूर करता है, जो सामान्यीकरण में सुधार करता है। यह डीप लर्निंग में विशेष रूप से महत्वपूर्ण है, जहाँ मॉडल में लाखों या अरबों पैरामीटर होते हैं और आसानी से प्रशिक्षण डेटा को याद कर सकते हैं।

अनुभवजन्य अध्ययनों ने दिखाया है कि वेट डेके प्रशिक्षण और सत्यापन प्रदर्शन के बीच के अंतर को काफी कम कर सकता है। उदाहरण के लिए, कन्वोल्यूशनल तंत्रिका नेटवर्क का उपयोग करने वाले छवि वर्गीकरण कार्यों में, वेट डेके जोड़ने से अक्सर परीक्षण सटीकता में कुछ प्रतिशत अंकों का सुधार होता है। प्राकृतिक भाषा प्रसंस्करण में, वेट डेके बड़े कोरपोरा पर ओवरफिटिंग को रोकने के लिए ट्रांसफॉर्मर, जिसमें बड़े भाषा मॉडल शामिल हैं, को प्रशिक्षित करने में एक मानक घटक है।

L2 नियमितीकरण और अन्य तकनीकों से संबंध

वेट डेके गणितीय रूप से L2 नियमितीकरण के बराबर है जब लॉस फ़ंक्शन अवकलनीय होता है और ऑप्टिमाइज़र वैनिला स्टोकेस्टिक ग्रेडिएंट डिसेंट का उपयोग करता है। हालाँकि, Adam जैसे अनुकूली ऑप्टिमाइज़र के साथ, समानता टूट जाती है क्योंकि वेट डेके अलग तरीके से लागू किया जाता है। इसके कारण AdamW का विकास हुआ, जो डिकपल्ड वेट डेके लागू करता है, जैसा कि इल्या लोशचिलोव और फ्रैंक हटर ने 2019 में पेश किया था। AdamW कई ट्रांसफॉर्मर-आधारित मॉडलों के लिए डिफ़ॉल्ट ऑप्टिमाइज़र बन गया है, जिसमें OpenAI और Google DeepMind के मॉडल शामिल हैं।

वेट डेके अक्सर अन्य नियमितीकरण विधियों के साथ उपयोग किया जाता है। ड्रॉपआउट प्रशिक्षण के दौरान न्यूरॉन्स को बेतरतीब ढंग से निष्क्रिय करता है, जो नियमितीकरण का एक पूरक रूप प्रदान करता है। बैच नॉर्मलाइज़ेशन, मुख्य रूप से प्रशिक्षण को स्थिर करने के लिए, एक हल्का नियमितीकरण प्रभाव भी रखता है। अर्ली स्टॉपिंग, जो सत्यापन प्रदर्शन स्थिर होने पर प्रशिक्षण रोकता है, एक और सामान्य अभ्यास है। वेट डेके इन विधियों का विकल्प नहीं है, लेकिन संयोजन में अच्छा काम करता है।

व्यावहारिक विचार और हाइपरपैरामीटर ट्यूनिंग

वेट डेके गुणांक (lambda) एक हाइपरपैरामीटर है जिसे ट्यून किया जाना चाहिए। सामान्य मान मॉडल और डेटासेट के आधार पर 1e-4 से 1e-2 तक होते हैं। बहुत छोटा मान ओवरफिटिंग को नहीं रोक सकता है, जबकि बहुत बड़ा मान अंडरफिटिंग का कारण बन सकता है, जहाँ मॉडल अंतर्निहित पैटर्न को पकड़ने के लिए बहुत सरल होता है। व्यवहार में, lambda को अक्सर क्रॉस-वैलिडेशन या समान कार्यों से ह्यूरिस्टिक्स के आधार पर चुना जाता है।

वेट डेके आमतौर पर बायस को छोड़कर सभी वेट्स पर लागू होता है, क्योंकि बायस का ओवरफिटिंग पर कम प्रभाव होता है। कुछ कार्यान्वयन नॉर्मलाइज़ेशन परत मापदंडों (जैसे बैच नॉर्म में) को भी डेके से बाहर करते हैं, क्योंकि वे स्केल-इनवेरिएंट होते हैं। आधुनिक फ्रेमवर्क में, इसे पैरामीटर समूहों द्वारा नियंत्रित किया जाता है।

बड़े पैमाने पर प्रशिक्षण के लिए, जैसे कि बड़े भाषा मॉडल का, वेट डेके अक्सर 0.01 या 0.1 जैसे छोटे मान पर सेट किया जाता है। उदाहरण के लिए, OpenAI के GPT-3 मॉडल ने प्रशिक्षण के दौरान 0.1 का वेट डेके उपयोग किया। इसी तरह, ट्रांसफॉर्मर परिवार के कई मॉडल AdamW का उपयोग वेट डेके के साथ करते हैं।

ऐतिहासिक विकास और प्रमुख योगदान

बड़े वेट्स को दंडित करने का विचार 1970 के दशक में विकसित रिज रिग्रेशन से जुड़ा है। तंत्रिका नेटवर्क में, वेट डेके को 1980 के दशक के अंत में स्पष्ट रूप से पेश किया गया था। एंडर्स क्रॉग और जॉन हर्ट्ज द्वारा 1992 में लिखा गया एक महत्वपूर्ण पेपर, 'ए सिंपल वेट डेके कैन इम्प्रूव जनरलाइज़ेशन', ने प्रदर्शित किया कि वेट डेके तंत्रिका नेटवर्क में सामान्यीकरण में सुधार कर सकता है। इस काम ने इसके व्यापक अपनाने की नींव रखी।

बाद में, 2010 के दशक में, डीप लर्निंग के उदय के साथ, वेट डेके गहरे नेटवर्क को प्रशिक्षित करने में एक मानक घटक बन गया। 2019 में इल्या लोशचिलोव और फ्रैंक हटर द्वारा AdamW की शुरुआत ने वेट डेके और अनुकूली ऑप्टिमाइज़र के बीच की बातचीत को संबोधित किया, जिससे कई कार्यों पर बेहतर प्रदर्शन हुआ। तब से, वेट डेके अधिकांश ट्रांसफॉर्मर-आधारित मॉडलों में डिफ़ॉल्ट रहा है।

आधुनिक AI प्रणालियों में अनुप्रयोग

वेट डेके का उपयोग लगभग हर डीप लर्निंग प्रोजेक्ट में किया जाता है, छोटे मॉडल से लेकर विशाल बड़े भाषा मॉडल तक। कंप्यूटर विज़न में, इसे ResNet और EfficientNet जैसे मॉडलों में लागू किया जाता है। प्राकृतिक भाषा प्रसंस्करण में, इसका उपयोग BERT, GPT और T5 जैसे मॉडलों को प्रशिक्षित करने में किया जाता है। OpenAI, Anthropic, और Google DeepMind जैसी कंपनियाँ अपने प्रशिक्षण पाइपलाइनों में वेट डेके शामिल करती हैं ताकि उनके मॉडल अच्छी तरह सामान्यीकरण करें।

बड़े भाषा मॉडल के संदर्भ में, वेट डेके प्रशिक्षण कोरपस पर ओवरफिटिंग को कम करने में मदद करता है, जो उन मॉडलों के लिए महत्वपूर्ण है जिनसे विविध कार्यों पर प्रदर्शन करने की उम्मीद की जाती है। यह मॉडल को विशिष्ट प्रशिक्षण उदाहरणों पर बहुत अधिक निर्भर होने से रोकने में भी भूमिका निभाता है, जो याद रखने और नए इनपुट पर खराब प्रदर्शन का कारण बन सकता है।

सीमाएँ और विकल्प

जबकि वेट डेके प्रभावी है, यह कोई जादुई समाधान नहीं है। यह कभी-कभी अन्य नियमितीकरण विधियों के साथ खराब बातचीत कर सकता है, और इसकी प्रभावशीलता वास्तुकला और डेटा पर निर्भर करती है। विकल्पों में L1 नियमितीकरण शामिल है, जो स्पार्सिटी को प्रोत्साहित करता है (कई वेट्स शून्य हो जाते हैं), और ड्रॉपआउट, जो पूरी तरह से जुड़ी परतों के लिए विशेष रूप से प्रभावी है। स्टोकेस्टिक डेप्थ और डेटा ऑग्मेंटेशन जैसी अधिक हाल की विधियाँ भी नियमितीकरण प्रदान करती हैं।

कुछ मामलों में, वेट डेके हानिकारक हो सकता है यदि बहुत आक्रामक रूप से लागू किया जाए, जिससे अंडरफिटिंग हो सकती है। यह ट्यून करने के लिए एक अतिरिक्त हाइपरपैरामीटर भी जोड़ता है, जो बड़े पैमाने पर प्रयोगों में चुनौतीपूर्ण हो सकता है। फिर भी, वेट डेके मशीन लर्निंग अभ्यासकर्ता के टूलकिट में एक मौलिक उपकरण बना हुआ है।

निष्कर्ष

वेट डेके एक सरल लेकिन शक्तिशाली नियमितीकरण तकनीक है जिसने समय की कसौटी पर खरा उतरा है। बड़े वेट्स को दंडित करके, यह सरल मॉडल को प्रोत्साहित करता है जो बेहतर सामान्यीकरण करते हैं। L2 नियमितीकरण के साथ इसकी समानता और AdamW जैसे आधुनिक ऑप्टिमाइज़र में इसका एकीकरण इसे डीप लर्निंग में एक डिफ़ॉल्ट विकल्प बना चुका है। जैसे-जैसे मॉडल आकार में बढ़ते रहते हैं, वेट डेके मजबूत और विश्वसनीय AI प्रणालियों को प्रशिक्षित करने में एक आवश्यक घटक बना रहेगा।

आगे पढ़ने के लिए, मशीन लर्निंग, डीप लर्निंग, तंत्रिका नेटवर्क, और ओवरफिटिंग जैसी संबंधित अवधारणाएँ देखें।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:regularization·machine-learning·deep-learning
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास