अंग्रेज़ी से अनुवादित

लर्निंग रेट शेड्यूलर न्यूरल नेटवर्क प्रशिक्षण के दौरान लर्निंग रेट को समायोजित करता है ताकि अभिसरण में सुधार हो और स्थानीय न्यूनतम से बचा जा सके। सामान्य शेड्यूल में समय-आधारित, चरण-आधारित, और घातीय क्षय शामिल हैं, साथ ही एडम जैसी अनुकूली विधियाँ भी हैं।

मशीन लर्निंग और सांख्यिकी में, लर्निंग रेट एक अनुकूलन एल्गोरिदम में एक ट्यूनिंग पैरामीटर है जो लॉस फंक्शन के न्यूनतम की ओर बढ़ते समय प्रत्येक पुनरावृत्ति पर चरण आकार निर्धारित करता है। चूंकि यह प्रभावित करता है कि नई प्राप्त जानकारी पुरानी जानकारी को किस हद तक ओवरराइड करती है, यह रूपक रूप से उस गति को दर्शाता है जिस पर एक मशीन लर्निंग मॉडल "सीखता है"। अनुकूली नियंत्रण साहित्य में, लर्निंग रेट को आमतौर पर गेन के रूप में संदर्भित किया जाता है।

लर्निंग रेट निर्धारित करने में अभिसरण की दर और ओवरशूटिंग के बीच एक समझौता शामिल होता है। जबकि अवरोहण दिशा आमतौर पर लॉस फंक्शन के ग्रेडिएंट से निर्धारित होती है, लर्निंग रेट यह तय करता है कि उस दिशा में कितना बड़ा कदम उठाया जाता है। बहुत अधिक लर्निंग रेट सीखने को न्यूनतम से आगे कूदने पर मजबूर करेगा, लेकिन बहुत कम लर्निंग रेट या तो अभिसरण में बहुत अधिक समय लेगा या अवांछनीय स्थानीय न्यूनतम में फंस जाएगा। तेज़ अभिसरण प्राप्त करने, दोलनों को रोकने और अवांछनीय स्थानीय न्यूनतम में फंसने से बचने के लिए, लर्निंग रेट को अक्सर प्रशिक्षण के दौरान या तो लर्निंग रेट शेड्यूल के अनुसार या अनुकूली लर्निंग रेट का उपयोग करके बदला जाता है। लर्निंग रेट और इसके समायोजन प्रति पैरामीटर भी भिन्न हो सकते हैं, ऐसी स्थिति में यह एक विकर्ण मैट्रिक्स होता है जिसे न्यूटन की विधि में हेसियन मैट्रिक्स के व्युत्क्रम के सन्निकटन के रूप में व्याख्या किया जा सकता है। लर्निंग रेट क्वासी-न्यूटन विधियों और संबंधित अनुकूलन एल्गोरिदम में अशुद्ध लाइन सर्च द्वारा निर्धारित चरण लंबाई से संबंधित है।

लर्निंग रेट शेड्यूल

प्रारंभिक दर को सिस्टम डिफ़ॉल्ट के रूप में छोड़ा जा सकता है या विभिन्न तकनीकों का उपयोग करके चुना जा सकता है। एक लर्निंग रेट शेड्यूल सीखने के दौरान लर्निंग रेट को बदलता है और अक्सर एपॉक्स या पुनरावृत्तियों के बीच बदला जाता है। यह मुख्य रूप से दो मापदंडों के साथ किया जाता है: डिके और मोमेंटम। कई अलग-अलग लर्निंग रेट शेड्यूल हैं, लेकिन सबसे आम समय-आधारित, चरण-आधारित और घातांकीय हैं।

डिके सीखने को एक अच्छी जगह पर स्थिर करने और दोलनों से बचने का कार्य करता है, एक ऐसी स्थिति जो तब उत्पन्न हो सकती है जब बहुत अधिक स्थिर लर्निंग रेट सीखने को न्यूनतम के ऊपर आगे-पीछे कूदने पर मजबूर करता है। यह एक हाइपरपैरामीटर द्वारा नियंत्रित होता है।

मोमेंटम एक गेंद के पहाड़ी से लुढ़कने के अनुरूप है; लक्ष्य गेंद को पहाड़ी के सबसे निचले बिंदु पर स्थिर करना है (सबसे कम त्रुटि के अनुरूप)। मोमेंटम दोनों सीखने को गति देता है (लर्निंग रेट बढ़ाता है) जब त्रुटि लागत ग्रेडिएंट लंबे समय तक एक ही दिशा में जा रहा होता है और छोटे उभारों पर 'लुढ़ककर' स्थानीय न्यूनतम से भी बचता है। मोमेंटम एक हाइपरपैरामीटर द्वारा नियंत्रित होता है जो एक गेंद के द्रव्यमान के अनुरूप होता है जिसे मैन्युअल रूप से चुना जाना चाहिए - बहुत अधिक और गेंद उन न्यूनतम से लुढ़क जाएगी जिन्हें हम खोजना चाहते हैं, बहुत कम और यह अपने उद्देश्य को पूरा नहीं करेगा। मोमेंटम को शामिल करने का सूत्र डिके की तुलना में अधिक जटिल है लेकिन अक्सर केरास जैसे डीप लर्निंग लाइब्रेरीज़ में निर्मित होता है।

समय-आधारित लर्निंग शेड्यूल पिछले समय पुनरावृत्ति के लर्निंग रेट के आधार पर लर्निंग रेट को बदलते हैं। डिके को शामिल करते हुए, लर्निंग रेट के लिए गणितीय सूत्र है:

η_{n+1} = η₀ / (1 + d n)

जहाँ η लर्निंग रेट है, η₀ मूल लर्निंग रेट है, d एक डिके पैरामीटर है, और n पुनरावृत्ति चरण है।

चरण-आधारित लर्निंग शेड्यूल कुछ पूर्वनिर्धारित चरणों के अनुसार लर्निंग रेट को बदलते हैं। डिके अनुप्रयोग सूत्र इस प्रकार परिभाषित है:

η_n = η₀ d^(⌊(1+n)/r⌋)

जहाँ η_n पुनरावृत्ति n पर लर्निंग रेट है, η₀ प्रारंभिक लर्निंग रेट है, d यह है कि प्रत्येक ड्रॉप पर लर्निंग रेट को कितना बदलना चाहिए (0.5 आधा होने के अनुरूप है), और r ड्रॉप दर से मेल खाता है, या कितनी बार दर को गिराया जाना चाहिए (10 हर 10 पुनरावृत्तियों में एक ड्रॉप के अनुरूप है)। फ्लोर फंक्शन (⌊…⌋) अपने इनपुट के मान को 1 से छोटे सभी मानों के लिए 0 पर गिरा देता है।

घातांकीय लर्निंग शेड्यूल चरण-आधारित के समान हैं, लेकिन चरणों के बजाय, एक घटता हुआ घातांकीय फंक्शन उपयोग किया जाता है। डिके को शामिल करने के लिए गणितीय सूत्र है:

η_n = η₀ e^(−d n)

जहाँ d एक डिके पैरामीटर है।

अनुकूली लर्निंग रेट

लर्निंग रेट शेड्यूल के साथ समस्या यह है कि वे सभी हाइपरपैरामीटर पर निर्भर करते हैं जिन्हें प्रत्येक दिए गए लर्निंग सत्र के लिए मैन्युअल रूप से चुना जाना चाहिए और समस्या या उपयोग किए गए मॉडल के आधार पर बहुत भिन्न हो सकते हैं। इससे निपटने के लिए, कई अलग-अलग प्रकार के अनुकूली ग्रेडिएंट डिसेंट एल्गोरिदम हैं जैसे कि एडाग्रैड, एडाडेल्टा, आरएमएसप्रॉप, और एडम जो आमतौर पर केरास जैसी डीप लर्निंग लाइब्रेरीज़ में निर्मित होते हैं।

डीप लर्निंग में भूमिका

लर्निंग रेट शेड्यूलर आधुनिक न्यूरल नेटवर्क को प्रशिक्षित करने में एक महत्वपूर्ण घटक हैं, जिसमें डीप लर्निंग मॉडल और बड़े भाषा मॉडल शामिल हैं। व्यवहार में, TensorFlow और PyTorch जैसे फ्रेमवर्क निर्मित शेड्यूलर कार्यान्वयन प्रदान करते हैं। उदाहरण के लिए, OpenAI और Anthropic अपने ट्रांसफॉर्मर-आधारित मॉडल को प्रशिक्षित करते समय स्थिर अभिसरण सुनिश्चित करने के लिए परिष्कृत शेड्यूलिंग तकनीकों का उपयोग करते हैं। इसी तरह, Google DeepMind और Meta AI बड़े पैमाने पर प्रशिक्षण रन के लिए कस्टम शेड्यूलर नियोजित करते हैं।

व्यावहारिक विचार

एक उपयुक्त लर्निंग रेट शेड्यूल चुनने में अक्सर प्रयोग शामिल होता है। सामान्य प्रथाओं में एक वार्म-अप चरण का उपयोग शामिल है जहां लर्निंग रेट एक छोटे मान से रैखिक रूप से बढ़ता है, उसके बाद एक डिके चरण होता है। यह दृष्टिकोण प्रारंभिक पुनरावृत्तियों में प्रशिक्षण को स्थिर करने में मदद करता है। इसके अतिरिक्त, कोसाइन एनीलिंग और चक्रीय लर्निंग रेट जैसे कुछ शेड्यूलर तीव्र न्यूनतम से बचने की अपनी क्षमता के लिए लोकप्रियता प्राप्त कर चुके हैं।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:machine-learning·optimization·deep-learning
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास