Machine learning में, लर्निंग रेट एक ऑप्टिमाइज़ेशन एल्गोरिदम में एक ट्यूनिंग पैरामीटर है जो लॉस फ़ंक्शन के न्यूनतम की ओर बढ़ते समय प्रत्येक पुनरावृत्ति पर चरण आकार निर्धारित करता है। यह प्रभावित करता है कि नई प्राप्त जानकारी पुरानी जानकारी को कितना ओवरराइड करती है, जो रूपक रूप से उस गति को दर्शाता है जिस पर एक मॉडल सीखता है। अनुकूली नियंत्रण साहित्य में, इसे अक्सर गेन कहा जाता है। लर्निंग रेट सेट करने में एक ट्रेड-ऑफ शामिल है: बहुत अधिक दर मॉडल को न्यूनतम से आगे निकलने का कारण बनती है, जबकि बहुत कम दर अभिसरण को धीमा कर देती है या अवांछनीय स्थानीय न्यूनतम में फंसने का जोखिम पैदा करती है। लर्निंग रेट शेड्यूलिंग प्रशिक्षण के दौरान दर को बदलकर इसे संबोधित करती है, या तो पूर्वनिर्धारित शेड्यूल या अनुकूली विधियों के माध्यम से।
ऑप्टिमाइज़ेशन में भूमिका
लर्निंग रेट अवरोहण दिशा में उठाए गए चरण के परिमाण को निर्धारित करता है, जो आमतौर पर लॉस फ़ंक्शन के ग्रेडिएंट से प्राप्त होता है। Deep learning में, मॉडल को लॉस फ़ंक्शन को कम करने के लिए वज़न को पुनरावृत्त रूप से समायोजित करके प्रशिक्षित किया जाता है, और लर्निंग रेट नियंत्रित करता है कि ये समायोजन कितने आक्रामक तरीके से किए जाते हैं। एक स्थिर उच्च दर न्यूनतम के आसपास दोलन का कारण बन सकती है, जबकि एक स्थिर कम दर प्रशिक्षण को अव्यावहारिक रूप से धीमा बना सकती है। समय के साथ दर को शेड्यूल करने से तेज़ अभिसरण प्राप्त करने, दोलनों को रोकने और खराब स्थानीय न्यूनतम से बचने में मदद मिलती है। लर्निंग रेट प्रति पैरामीटर भी भिन्न हो सकती है, ऐसी स्थिति में यह हेसियन मैट्रिक्स के व्युत्क्रम का अनुमान लगाने वाला एक विकर्ण मैट्रिक्स बन जाता है, जैसा कि न्यूटन की विधि में होता है। यह अर्ध-न्यूटन विधियों और अपरिष्कृत लाइन सर्च में चरण लंबाई से संबंधित है।
समय-आधारित शेड्यूल
समय-आधारित शेड्यूल पिछली दर और एक क्षय पैरामीटर के आधार पर प्रत्येक पुनरावृत्ति पर लर्निंग रेट को समायोजित करते हैं। सूत्र है \eta_{n+1} = \eta_0 / (1 + d n), जहाँ \eta_0 प्रारंभिक दर है, d क्षय पैरामीटर है, और n पुनरावृत्ति चरण है। यह शेड्यूल दर को धीरे-धीरे कम करता है, जिससे प्रशिक्षण के शुरुआती चरणों में बड़े कदम और बाद में बारीक समायोजन की अनुमति मिलती है। इसे लागू करना सरल है और केवल एक हाइपरपैरामीटर, क्षय d की आवश्यकता होती है। हालाँकि, दर नीरस रूप से घटती है, जो सभी समस्याओं के लिए इष्टतम नहीं हो सकती है।
चरण-आधारित शेड्यूल
चरण-आधारित शेड्यूल पूर्वनिर्धारित अंतराल पर लर्निंग रेट बदलते हैं। पुनरावृत्ति n पर दर है \eta_n = \eta_0 d^{\lfloor (1+n)/r \rfloor}, जहाँ d गुणक कारक है (उदाहरण के लिए, आधा करने के लिए 0.5) और r ड्रॉप दर है (उदाहरण के लिए, हर 10 पुनरावृत्तियों पर)। फ़्लोर फ़ंक्शन यह सुनिश्चित करता है कि ड्रॉप के बीच दर स्थिर रहे। यह शेड्यूल व्यवहार में आम है क्योंकि इसे ट्यून करना आसान है और असतत कटौती प्रदान करता है जो मॉडल को न्यूनतम में स्थिर होने में मदद कर सकता है। d और r का चुनाव डेटासेट और मॉडल आर्किटेक्चर पर निर्भर करता है।
घातीय शेड्यूल
घातीय शेड्यूल एक घटते घातीय फ़ंक्शन का उपयोग करते हैं: \eta_n = \eta_0 e^{-d n}, जहाँ d एक क्षय पैरामीटर है। यह चरण-आधारित शेड्यूल के असतत ड्रॉप के विपरीत, लर्निंग रेट में एक सुचारू, निरंतर कमी प्रदान करता है। घातीय क्षय अक्सर Neural network प्रशिक्षण में उपयोग किया जाता है क्योंकि यह प्रारंभिक अन्वेषण और बाद के परिशोधन को संतुलित करता है। क्षय पैरामीटर d नियंत्रित करता है कि दर कितनी जल्दी गिरती है; एक बड़ा d तेज़ क्षय की ओर ले जाता है, जो समय से पहले अभिसरण का कारण बन सकता है।
वार्मअप और कोसाइन एनीलिंग
आधुनिक प्रशिक्षण, विशेष रूप से Large language model के लिए, अक्सर वार्मअप का उपयोग करता है, जहाँ लर्निंग रेट पहले कुछ हज़ार चरणों में एक छोटे मान से बढ़कर एक शिखर तक पहुँचती है। यह प्रारंभिक प्रशिक्षण में अस्थिरता को रोकता है जब वज़न यादृच्छिक होते हैं और ग्रेडिएंट बड़े हो सकते हैं। वार्मअप के बाद, दर कोसाइन एनीलिंग का उपयोग करके घट सकती है, जो शिखर से लगभग शून्य मान तक एक कोसाइन वक्र का अनुसरण करती है। कोसाइन एनीलिंग को कई Transformer (architecture)-आधारित मॉडलों में अंतिम प्रदर्शन में सुधार करने के लिए दिखाया गया है। कुछ शेड्यूल वार्मअप को चक्रीय पैटर्न के साथ जोड़ते हैं, जहाँ दर सीमाओं के बीच दोलन करती है, जिससे मॉडल स्थानीय न्यूनतम से बच सकता है और लॉस परिदृश्य के विभिन्न क्षेत्रों का अन्वेषण कर सकता है।
मोमेंटम और क्षय
मोमेंटम एक तकनीक है जिसे अक्सर लर्निंग रेट शेड्यूल के साथ जोड़ा जाता है। यह एक पहाड़ी से लुढ़कती गेंद के समान है, जहाँ गेंद का वेग इसे छोटे उभारों के ऊपर ले जाता है और जब ग्रेडिएंट दिशा सुसंगत होती है तो गति बढ़ाता है। मोमेंटम द्रव्यमान के समान एक हाइपरपैरामीटर द्वारा नियंत्रित होता है; बहुत अधिक मान मॉडल को न्यूनतम से आगे निकलने का कारण बनता है, जबकि बहुत कम मान इसके लाभ को कम कर देता है। दूसरी ओर, क्षय, समय के साथ चरण आकार को कम करके सीखने को स्थिर करने और दोलनों से बचने का कार्य करता है। दोनों आमतौर पर केरास जैसी डीप लर्निंग लाइब्रेरीज़ में निर्मित होते हैं, जो डिफ़ॉल्ट कार्यान्वयन और ट्यून करने योग्य पैरामीटर प्रदान करते हैं।
अनुकूली लर्निंग रेट
निश्चित शेड्यूल की एक प्रमुख सीमा मैन्युअल रूप से चुने गए हाइपरपैरामीटर पर उनकी निर्भरता है, जो समस्या और मॉडल के अनुसार भिन्न होते हैं। अनुकूली ग्रेडिएंट डिसेंट एल्गोरिदम ऐतिहासिक ग्रेडिएंट के आधार पर प्रति पैरामीटर लर्निंग रेट को समायोजित करके इसे संबोधित करते हैं। सामान्य विधियों में Adagrad, Adadelta, RMSprop और Adam शामिल हैं। ये एल्गोरिदम आम तौर पर डीप लर्निंग फ्रेमवर्क में निर्मित होते हैं और Artificial intelligence मॉडल को प्रशिक्षित करने के लिए मानक बन गए हैं। 2014 में पेश किया गया Adam, मोमेंटम को प्रति-पैरामीटर स्केलिंग के साथ जोड़ता है और Generative AI और अन्य अनुप्रयोगों में व्यापक रूप से उपयोग किया जाता है। अनुकूली विधियाँ मैन्युअल शेड्यूल ट्यूनिंग की आवश्यकता को कम करती हैं, हालाँकि कई चिकित्सक सर्वोत्तम परिणामों के लिए उनके ऊपर एक शेड्यूल का उपयोग करते हैं।
व्यावहारिक विचार
प्रारंभिक लर्निंग रेट चुनना महत्वपूर्ण है। सामान्य तकनीकों में डिफ़ॉल्ट मान का उपयोग करना शामिल है, जैसे कि 0.01 या 0.001, या लर्निंग रेट रेंज टेस्ट करना, जहाँ उपयुक्त सीमा खोजने के लिए दर को कुछ युगों में रैखिक रूप से बढ़ाया जाता है। इष्टतम शेड्यूल अक्सर मॉडल आकार, डेटासेट और ऑप्टिमाइज़र पर निर्भर करता है। उदाहरण के लिए, OpenAI और Google DeepMind ने बड़े मॉडलों को प्रशिक्षित करने के लिए वार्मअप और कोसाइन क्षय का उपयोग करने की सूचना दी है। व्यवहार में, शेड्यूल को अक्सर प्रारंभिक रोक के साथ जोड़ा जाता है, जहाँ प्रशिक्षण तब रुक जाता है जब सत्यापन प्रदर्शन में सुधार होना बंद हो जाता है। शेड्यूल का चुनाव अंतिम मॉडल गुणवत्ता, प्रशिक्षण समय और स्थिरता को महत्वपूर्ण रूप से प्रभावित कर सकता है, जिससे यह किसी भी प्रशिक्षण पाइपलाइन में एक प्रमुख हाइपरपैरामीटर बन जाता है।