अंग्रेज़ी से अनुवादित

चक्रीय अधिगम दर एक प्रशिक्षण तकनीक है जो अधिगम दर को निचली और ऊपरी सीमा के बीच समय-समय पर बदलती है, जिसका उद्देश्य अभिसरण में सुधार करना और तंत्रिका नेटवर्क अनुकूलन में स्थानीय न्यूनतम से बचना है।

मशीन लर्निंग में, लर्निंग रेट एक अनुकूलन एल्गोरिदम में एक ट्यूनिंग पैरामीटर है जो लॉस फ़ंक्शन के न्यूनतम की ओर बढ़ते समय प्रत्येक पुनरावृत्ति पर चरण आकार निर्धारित करता है। चूंकि यह प्रभावित करता है कि नई प्राप्त जानकारी पुरानी जानकारी को किस हद तक ओवरराइड करती है, यह रूपक रूप से उस गति का प्रतिनिधित्व करता है जिस पर एक मशीन लर्निंग मॉडल "सीखता है"। अनुकूली नियंत्रण साहित्य में, लर्निंग रेट को आमतौर पर गेन के रूप में संदर्भित किया जाता है।

लर्निंग रेट निर्धारित करने में, अभिसरण दर और ओवरशूटिंग के बीच एक व्यापार-बंद होता है। जबकि अवरोहण दिशा आमतौर पर लॉस फ़ंक्शन के ग्रेडिएंट से निर्धारित होती है, लर्निंग रेट यह निर्धारित करता है कि उस दिशा में कितना बड़ा कदम उठाया गया है। बहुत अधिक लर्निंग रेट सीखने को न्यूनतम से कूदने का कारण बनेगा, लेकिन बहुत कम लर्निंग रेट या तो अभिसरण में बहुत लंबा समय लेगा या अवांछनीय स्थानीय न्यूनतम में फंस जाएगा।

चक्रीय लर्निंग रेट (CLR) एक प्रशिक्षण विधि है जो लर्निंग रेट को नीरस रूप से घटाने के बजाय निचली सीमा और ऊपरी सीमा के बीच समय-समय पर बदलकर इस व्यापार-बंद को संबोधित करती है। यह दृष्टिकोण, 2015 में लेस्ली एन. स्मिथ द्वारा पेश किया गया, लर्निंग रेट शेड्यूल के व्यापक मैनुअल ट्यूनिंग की आवश्यकता के बिना अभिसरण गति और मॉडल सटीकता में सुधार करने के लिए डिज़ाइन किया गया है।

प्रेरणा और मुख्य विचार

पारंपरिक लर्निंग रेट शेड्यूल, जैसे कि समय-आधारित, चरण-आधारित, और घातीय क्षय, मॉडल को न्यूनतम में स्थापित करने के लिए युगों में लर्निंग रेट को कम करते हैं। हालांकि, ये शेड्यूल हाइपरपैरामीटर पर निर्भर करते हैं जिन्हें प्रत्येक समस्या के लिए मैन्युअल रूप से चुना जाना चाहिए, और एक खराब चुना गया शेड्यूल धीमी अभिसरण या खराब अंतिम प्रदर्शन का कारण बन सकता है।

चक्रीय लर्निंग रेट इस अवलोकन का लाभ उठाते हैं कि एक मध्यम उच्च लर्निंग रेट एक नियमितीकरणकर्ता के रूप में कार्य कर सकता है, जो मॉडल को तेज स्थानीय न्यूनतम से बचने और फ्लैट, अधिक सामान्यीकरण योग्य न्यूनतम खोजने में मदद करता है। लर्निंग रेट को चक्रित करके, मॉडल समय-समय पर बड़े चरणों के साथ लॉस परिदृश्य के क्षेत्रों की खोज करता है, फिर छोटे चरणों के साथ परिष्कृत करता है। यह दृष्टिकोण व्यापक हाइपरपैरामीटर ट्यूनिंग की आवश्यकता को कम कर सकता है और अक्सर एक निश्चित या नीरस रूप से क्षय होने वाली दर की तुलना में बेहतर सटीकता देता है।

यह विधि विशेष रूप से डीप लर्निंग संदर्भों में प्रभावी है, जहां लॉस परिदृश्य उच्च-आयामी और गैर-उत्तल होते हैं। चक्रीय पैटर्न अनुकूलक को स्थिर दर की तुलना में सैडल बिंदुओं और संकीर्ण घाटियों को अधिक प्रभावी ढंग से पार करने की अनुमति देता है।

त्रिकोणीय और संस्करण शेड्यूल

सबसे बुनियादी CLR शेड्यूल त्रिकोणीय नीति है, जहां लर्निंग रेट रैखिक रूप से निचली सीमा से ऊपरी सीमा तक बढ़ता है, फिर रैखिक रूप से निचली सीमा पर वापस घटता है, इस चक्र को दोहराता है। चक्र लंबाई को एक पूर्ण वृद्धि-कमी अवधि के लिए पुनरावृत्तियों की संख्या के रूप में परिभाषित किया गया है। एक सामान्य संस्करण, त्रिकोणीय2, प्रत्येक चक्र के बाद लर्निंग रेट रेंज के आयाम को आधा कर देता है, समय के साथ खोज सीमा को धीरे-धीरे कम करता है।

एक अन्य संस्करण, घातीय त्रिकोणीय नीति, प्रत्येक चक्र के आयाम पर एक घातीय क्षय लागू करती है, जो चक्रीय खोज के लाभों को क्षय शेड्यूल की स्थिरता के साथ जोड़ती है। ये संस्करण चिकित्सकों को प्रशिक्षण की प्रगति के रूप में खोज और दोहन को संतुलित करने की अनुमति देते हैं।

सीमाओं का चुनाव महत्वपूर्ण है। स्मिथ ने निचली सीमा को एक मान पर सेट करने की सिफारिश की जो सीखने को आगे बढ़ने की अनुमति देता है, और ऊपरी सीमा को एक मान पर जो कुछ दोलन पैदा करने के लिए पर्याप्त उच्च है लेकिन विचलन के लिए इतना अधिक नहीं है। एक व्यावहारिक अनुमानी लर्निंग रेट रेंज परीक्षण चलाना है, जहां लर्निंग रेट को कुछ पुनरावृत्तियों पर रैखिक रूप से बढ़ाया जाता है, और लॉस की निगरानी की जाती है ताकि उस सीमा की पहचान की जा सके जहां लॉस सबसे तेजी से घटता है।

लर्निंग रेट रेंज परीक्षण

लर्निंग रेट रेंज परीक्षण एक तकनीक है जिसका उपयोग CLR के लिए उपयुक्त सीमाओं का चयन करने के लिए किया जाता है। इस परीक्षण में, लर्निंग रेट को कुछ युगों में बहुत छोटे मान से बड़े मान तक रैखिक रूप से बढ़ाया जाता है, और प्रशिक्षण लॉस दर्ज किया जाता है। चिकित्सक फिर लॉस बनाम लर्निंग रेट की साजिश करता है और निचली सीमा को उस बिंदु के रूप में चुनता है जहां लॉस घटने लगता है, और ऊपरी सीमा को उस बिंदु के रूप में जहां लॉस सुधारना बंद कर देता है या बढ़ने लगता है।

यह परीक्षण चक्रीय सीमाओं को निर्धारित करने का एक व्यवस्थित तरीका प्रदान करता है, जिससे हाइपरपैरामीटर चुनने में अनुमान कम हो जाता है। यह विशेष रूप से कृत्रिम बुद्धिमत्ता वर्कफ़्लो में उपयोगी है जहां मॉडल को विभिन्न आर्किटेक्चर या डेटासेट के साथ बार-बार प्रशिक्षित किया जाता है।

अनुकूली विधियों से संबंध

चक्रीय लर्निंग रेट अनुकूली लर्निंग रेट विधियों जैसे Adagrad, Adadelta, RMSprop, और Adam से अलग हैं, जो ग्रेडिएंट इतिहास के आधार पर प्रति पैरामीटर लर्निंग रेट को समायोजित करते हैं। ये अनुकूली विधियां कई डीप लर्निंग पुस्तकालयों, जैसे Keras में निर्मित हैं, और अक्सर CLR के साथ संयोजन में आधार अनुकूलक के रूप में उपयोग की जाती हैं। व्यवहार में, CLR को अनुकूली अनुकूलकों के शीर्ष पर लागू किया जा सकता है, वैश्विक लर्निंग रेट को चक्रित करते हुए जबकि अनुकूलक प्रति-पैरामीटर पैमानों को समायोजित करना जारी रखता है।

कुछ शोध बताते हैं कि CLR अनुकूली विधियों के प्रदर्शन में सुधार कर सकता है, उन्हें तेज न्यूनतम में बहुत जल्दी बसने से रोककर। चक्रीय भिन्नता एनीलिंग के एक रूप के रूप में कार्य करती है जो मॉडल को खराब समाधानों से बचने में मदद कर सकती है।

आधुनिक AI में अनुप्रयोग

चक्रीय लर्निंग रेट को तंत्रिका नेटवर्क मॉडल के प्रशिक्षण में व्यापक रूप से अपनाया गया है, जिसमें बड़े भाषा मॉडल आर्किटेक्चर शामिल हैं। उदाहरण के लिए, ओपनएआई और गूगल-डीपमाइंड जैसे संगठनों के चिकित्सकों ने विशाल डेटासेट पर मॉडल को प्रशिक्षित करने के लिए चक्रीय या समान वार्मअप-और-क्षय शेड्यूल का उपयोग किया है। यह तकनीक कंप्यूटर विज़न और प्राकृतिक भाषा प्रसंस्करण कार्यों में भी आम है, जहां इसे बेंचमार्क डेटासेट पर सटीकता में सुधार करने के लिए दिखाया गया है।

यह विधि विशेष रूप से ट्रांसफर लर्निंग और फाइन-ट्यूनिंग परिदृश्यों में मूल्यवान है, जहां एक पूर्व-प्रशिक्षित मॉडल को एक नए कार्य के लिए अनुकूलित किया जाता है। एक चक्रीय शेड्यूल मॉडल को विनाशकारी भूलने के बिना अनुकूलित करने में मदद कर सकता है, क्योंकि आवधिक उच्च लर्निंग रेट मॉडल को नई फीचर स्पेस का पता लगाने की अनुमति देते हैं जबकि कम दरें पहले से सीखे गए प्रतिनिधित्व को संरक्षित करती हैं।

व्यावहारिक विचार

CLR को लागू करने के लिए चक्र लंबाई और सीमाओं को निर्दिष्ट करने की आवश्यकता होती है। चक्र लंबाई अक्सर प्रति युग पुनरावृत्तियों की संख्या के गुणक पर सेट की जाती है, जैसे कि प्रति चक्र 2 से 10 युग। छोटे चक्र अधिक लगातार खोज की अनुमति देते हैं, जबकि लंबे चक्र प्रत्येक चरण के भीतर अधिक स्थिर प्रशिक्षण प्रदान करते हैं।

एक सामान्य नुकसान ऊपरी सीमा को बहुत अधिक सेट करना है, जो लॉस को विचलन का कारण बन सकता है। लर्निंग रेट रेंज परीक्षण इस जोखिम को कम करता है। इसके अतिरिक्त, CLR सभी समस्याओं के लिए फायदेमंद नहीं हो सकता है; बहुत सरल उत्तल अनुकूलन कार्यों के लिए, एक स्थिर या क्षय दर पर्याप्त हो सकती है।

वितरित प्रशिक्षण वातावरण में, जैसे कि अमेज़न वेब सर्विसेज या गूगल क्लाउड का उपयोग करने वाले, CLR को न्यूनतम ओवरहेड के साथ लागू किया जा सकता है, क्योंकि इसे केवल प्रत्येक पुनरावृत्ति पर लर्निंग रेट को समायोजित करने की आवश्यकता होती है। PyTorch और TensorFlow सहित कई डीप लर्निंग फ्रेमवर्क, चक्रीय शेड्यूल के लिए अंतर्निहित समर्थन प्रदान करते हैं।

यह भी देखें

संदर्भ

  • Smith, Leslie N. (2015). "Cyclical Learning Rates for Training Neural Networks." arXiv:1506.01186.
  • Smith, Leslie N. (2017). "Cyclical Learning Rates for Training Neural Networks." IEEE Winter Conference on Applications of Computer Vision.
  • Géron, Aurélien (2017). "Gradient Descent." Hands-On Machine Learning with Scikit-Learn and TensorFlow. O'Reilly. pp. 113–124. ISBN 978-1-4919-6229-9.
  • Plagianakos, V. P.; Magoulas, G. D.; Vrahatis, M. N. (2001). "Learning Rate Adaptation in Stochastic Gradient Descent." Advances in Convex Analysis and Global Optimization. Kluwer. pp. 433–444. ISBN 0-7923-6942-4.
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:machine-learning·optimization·deep-learning·training-techniques
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास