अधिगम दर अनुसूचन (Learning Rate Scheduling)

अंग्रेज़ी से अनुवादित

लर्निंग रेट शेड्यूलिंग न्यूरल नेटवर्क प्रशिक्षण के दौरान अनुकूलन एल्गोरिदम में चरण आकार को समायोजित करती है, जो अभिसरण गति और स्थिरता के बीच संतुलन बनाती है। सामान्य शेड्यूल में समय-आधारित, चरण-आधारित, घातीय क्षय, और एडम जैसी अनुकूली विधियाँ शामिल हैं।

मशीन लर्निंग और सांख्यिकी में, लर्निंग रेट एक अनुकूलन एल्गोरिदम में एक ट्यूनिंग पैरामीटर है जो लॉस फ़ंक्शन के न्यूनतम की ओर बढ़ते समय प्रत्येक पुनरावृत्ति पर चरण आकार निर्धारित करता है। चूंकि यह प्रभावित करता है कि नई प्राप्त जानकारी पुरानी जानकारी को किस हद तक ओवरराइड करती है, यह रूपक रूप से उस गति का प्रतिनिधित्व करता है जिस पर एक मशीन लर्निंग मॉडल "सीखता है"। अनुकूली नियंत्रण साहित्य में, लर्निंग रेट को आमतौर पर गेन के रूप में संदर्भित किया जाता है।

लर्निंग रेट निर्धारित करने में, अभिसरण की दर और ओवरशूटिंग के बीच एक ट्रेड-ऑफ होता है। जबकि अवरोहण दिशा आमतौर पर लॉस फ़ंक्शन के ग्रेडिएंट से निर्धारित होती है, लर्निंग रेट यह निर्धारित करता है कि उस दिशा में कितना बड़ा कदम उठाया जाता है। बहुत अधिक लर्निंग रेट लर्निंग को न्यूनतम से ऊपर कूदने का कारण बनेगा, लेकिन बहुत कम लर्निंग रेट या तो अभिसरण में बहुत अधिक समय लेगा या अवांछनीय स्थानीय न्यूनतम में फंस जाएगा।

तेज़ अभिसरण प्राप्त करने, दोलनों को रोकने और अवांछनीय स्थानीय न्यूनतम में फंसने से बचने के लिए, लर्निंग रेट को अक्सर प्रशिक्षण के दौरान या तो लर्निंग रेट शेड्यूल के अनुसार या अनुकूली लर्निंग रेट का उपयोग करके भिन्न किया जाता है। लर्निंग रेट और इसके समायोजन प्रति पैरामीटर भी भिन्न हो सकते हैं, ऐसी स्थिति में यह एक विकर्ण मैट्रिक्स है जिसे न्यूटन की विधि में हेसियन मैट्रिक्स के व्युत्क्रम के सन्निकटन के रूप में व्याख्या किया जा सकता है। लर्निंग रेट अर्ध-न्यूटन विधियों और संबंधित अनुकूलन एल्गोरिदम में अनिश्चित रेखा खोज द्वारा निर्धारित चरण लंबाई से संबंधित है।

लर्निंग रेट शेड्यूल

एक लर्निंग रेट शेड्यूल सीखने के दौरान लर्निंग रेट को बदलता है और अक्सर युगों या पुनरावृत्तियों के बीच बदला जाता है। यह मुख्य रूप से दो मापदंडों के साथ किया जाता है: डेके और मोमेंटम। कई अलग-अलग लर्निंग रेट शेड्यूल हैं, लेकिन सबसे आम समय-आधारित, चरण-आधारित और घातांकीय हैं।

डेके सीखने को एक अच्छी जगह पर स्थिर करने और दोलनों से बचने का कार्य करता है, एक ऐसी स्थिति जो तब उत्पन्न हो सकती है जब बहुत अधिक स्थिर लर्निंग रेट सीखने को न्यूनतम के ऊपर आगे-पीछे कूदने का कारण बनती है। डेके एक हाइपरपैरामीटर द्वारा नियंत्रित होता है।

मोमेंटम एक गेंद के पहाड़ी से लुढ़कने के अनुरूप है; हम चाहते हैं कि गेंद पहाड़ी के सबसे निचले बिंदु पर स्थिर हो (सबसे कम त्रुटि के अनुरूप)। मोमेंटम दोनों सीखने को गति देता है (लर्निंग रेट बढ़ाता है) जब त्रुटि लागत ग्रेडिएंट लंबे समय तक एक ही दिशा में जा रहा हो और छोटे उभारों पर 'लुढ़ककर' स्थानीय न्यूनतम से भी बचता है। मोमेंटम एक हाइपरपैरामीटर द्वारा नियंत्रित होता है जो एक गेंद के द्रव्यमान के अनुरूप होता है जिसे मैन्युअल रूप से चुना जाना चाहिए - बहुत अधिक और गेंद उन न्यूनतमों के ऊपर लुढ़क जाएगी जिन्हें हम खोजना चाहते हैं, बहुत कम और यह अपने उद्देश्य को पूरा नहीं करेगा। मोमेंटम को शामिल करने का सूत्र डेके की तुलना में अधिक जटिल है लेकिन अक्सर Deep learning लाइब्रेरी जैसे कि केरस में निर्मित होता है।

समय-आधारित शेड्यूल

समय-आधारित लर्निंग शेड्यूल पिछले समय पुनरावृत्ति की लर्निंग रेट के आधार पर लर्निंग रेट को बदलते हैं। डेके को शामिल करते हुए, लर्निंग रेट के लिए गणितीय सूत्र है:

η_{n+1} = η₀ / (1 + d n)

जहाँ η लर्निंग रेट है, η₀ मूल लर्निंग रेट है, d एक डेके पैरामीटर है, और n पुनरावृत्ति चरण है।

चरण-आधारित शेड्यूल

चरण-आधारित लर्निंग शेड्यूल कुछ पूर्वनिर्धारित चरणों के अनुसार लर्निंग रेट बदलते हैं। डेके अनुप्रयोग सूत्र यहाँ इस प्रकार परिभाषित है:

η_n = η₀ d^(⌊(1+n)/r⌋)

जहाँ η_n पुनरावृत्ति n पर लर्निंग रेट है, η₀ प्रारंभिक लर्निंग रेट है, d प्रत्येक ड्रॉप पर लर्निंग रेट को कितना बदलना चाहिए (0.5 आधा होने के अनुरूप है), और r ड्रॉप दर से मेल खाता है, या कितनी बार दर को गिराया जाना चाहिए (10 हर 10 पुनरावृत्तियों में एक ड्रॉप के अनुरूप है)। फ्लोर फ़ंक्शन (⌊…⌋) यहाँ 1 से छोटे सभी मानों के लिए अपने इनपुट के मान को 0 पर गिरा देता है।

घातांकीय शेड्यूल

घातांकीय लर्निंग शेड्यूल चरण-आधारित के समान हैं, लेकिन चरणों के बजाय, एक घटता घातांकीय फ़ंक्शन का उपयोग किया जाता है। डेके को शामिल करने का गणितीय सूत्र है:

η_n = η₀ e^(−d n)

जहाँ d एक डेके पैरामीटर है।

अनुकूली लर्निंग रेट

लर्निंग रेट शेड्यूल के साथ समस्या यह है कि वे सभी हाइपरपैरामीटर पर निर्भर करते हैं जिन्हें प्रत्येक दिए गए लर्निंग सत्र के लिए मैन्युअल रूप से चुना जाना चाहिए और समस्या या उपयोग किए गए मॉडल के आधार पर बहुत भिन्न हो सकते हैं। इसका मुकाबला करने के लिए, कई अलग-अलग प्रकार के अनुकूली ग्रेडिएंट डिसेंट एल्गोरिदम हैं जैसे कि Adagrad, Adadelta, RMSprop, और Adam, जो आमतौर पर केरस जैसी डीप लर्निंग लाइब्रेरी में निर्मित होते हैं।

वार्मअप और चक्रीय शेड्यूल

शास्त्रीय डेके शेड्यूल के अलावा, बड़े मॉडलों का आधुनिक प्रशिक्षण अक्सर वार्मअप और चक्रीय शेड्यूल का उपयोग करता है। वार्मअप एक छोटी लर्निंग रेट से शुरू होता है और कुछ युगों में धीरे-धीरे इसे बढ़ाता है, जो प्रारंभिक चरण में प्रशिक्षण को स्थिर करने में मदद करता है, विशेष रूप से Transformer (architecture)-आधारित मॉडलों के लिए। चक्रीय शेड्यूल, जैसे कि कोसाइन एनीलिंग, समय-समय पर लर्निंग रेट को न्यूनतम और अधिकतम मान के बीच बदलते हैं, जो स्थानीय न्यूनतम से बचने और कभी-कभी सामान्यीकरण में सुधार करने में मदद कर सकते हैं।

व्यावहारिक विचार

लर्निंग रेट शेड्यूल का चुनाव Neural network मॉडलों के प्रशिक्षण को महत्वपूर्ण रूप से प्रभावित कर सकता है। उदाहरण के लिए, Large language model को प्रशिक्षित करने में, एक सामान्य अभ्यास रैखिक वार्मअप के बाद कोसाइन डेके का उपयोग करना है। यह दृष्टिकोण OpenAI और Google DeepMind जैसे संगठनों द्वारा उनके बड़े पैमाने पर प्रशिक्षण रन में उपयोग किया जाता है। प्रारंभिक लर्निंग रेट अक्सर अनुभवजन्य नियमों या लर्निंग रेट फाइंडर चलाकर निर्धारित की जाती है, जो कुछ पुनरावृत्तियों में मानों की एक श्रृंखला का परीक्षण करता है।

अनुकूलन एल्गोरिदम से संबंध

लर्निंग रेट शेड्यूलिंग अनुकूलन एल्गोरिदम की पसंद से निकटता से जुड़ी हुई है। Machine learning फ्रेमवर्क जैसे कि TensorFlow और PyTorch अंतर्निहित शेड्यूलर प्रदान करते हैं जिन्हें SGD, Adam, या RMSprop जैसे ऑप्टिमाइज़र के साथ जोड़ा जा सकता है। शेड्यूल और ऑप्टिमाइज़र की आंतरिक स्थिति (जैसे, Adam में मोमेंटम बफर) के बीच परस्पर क्रिया महत्वपूर्ण है; उदाहरण के लिए, लर्निंग रेट को बहुत अचानक कम करने से ऑप्टिमाइज़र ओवरशूट कर सकता है।

इतिहास और विकास

प्रशिक्षण के दौरान लर्निंग रेट को समायोजित करने की अवधारणा Artificial intelligence और Machine learning में प्रारंभिक कार्य से जुड़ी है। Thomas G. Dietterich और Michael I. Jordan जैसे शोधकर्ताओं ने लर्निंग सिस्टम में अनुकूलन की मौलिक समझ में योगदान दिया। 2010 के दशक में, डीप लर्निंग के उदय ने शेड्यूलिंग पर नया ध्यान आकर्षित किया, जिसमें चक्रीय लर्निंग रेट और वार्मअप पर पेपर व्यापक रूप से उद्धृत हुए।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:machine-learning·optimization·deep-learning
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास