अंग्रेज़ी से अनुवादित

कोसाइन एनीलिंग मशीन लर्निंग में एक लर्निंग रेट शेड्यूल है जो लर्निंग रेट को कोसाइन वक्र के अनुसार समायोजित करता है, एक चक्र में प्रारंभिक मान से न्यूनतम तक घटता है, जिसका उपयोग अक्सर न्यूरल नेटवर्क प्रशिक्षण में अभिसरण में सुधार के लिए किया जाता है।

कोसाइन एनीलिंग एक लर्निंग रेट शेड्यूल है जिसका उपयोग Machine learning मॉडल, विशेष रूप से Deep learning मॉडल के प्रशिक्षण में किया जाता है। यह अनुकूलन के दौरान लर्निंग रेट को एक कोसाइन वक्र का अनुसरण करते हुए समायोजित करता है, जो एक प्रारंभिक उच्च मान से शुरू होकर निर्दिष्ट संख्या में एपोच या इटरेशन में सुचारू रूप से न्यूनतम तक घटता है। यह दृष्टिकोण अभिसरण गति और स्थिरता के बीच संतुलन बनाने के लिए डिज़ाइन किया गया है, जिससे मॉडल को लॉस फ़ंक्शन के बेहतर मिनिमा में स्थापित होने में मदद मिलती है। यह शेड्यूल आधुनिक प्रशिक्षण पाइपलाइनों में Neural network आर्किटेक्चर, जिसमें Transformer (architecture)-आधारित मॉडल जैसे Large language model शामिल हैं, के लिए व्यापक रूप से अपनाया जाता है, इसकी सरलता और प्रभावशीलता के कारण।

अनुकूलन में, लर्निंग रेट लॉस फ़ंक्शन के न्यूनतम की ओर उठाए गए कदम के आकार को निर्धारित करता है। एक स्थिर लर्निंग रेट धीमी अभिसरण या दोलनों का कारण बन सकती है, क्योंकि बहुत अधिक दर मिनिमा को पार कर सकती है और बहुत कम दर रुक सकती है। कोसाइन एनीलिंग इसे एक क्रमिक क्षय प्रदान करके संबोधित करता है जो लर्निंग रेट को सुचारू रूप से कम करता है, जिससे प्रशिक्षण आगे बढ़ने पर बारीक समायोजन की अनुमति मिलती है। स्टेप-आधारित या एक्सपोनेंशियल शेड्यूल के विपरीत, जो दर को अचानक गिराते हैं, कोसाइन एनीलिंग एक निरंतर, अवकलनीय क्षय प्रदान करता है जो अक्सर अधिक स्थिर प्रशिक्षण गतिशीलता उत्पन्न करता है।

गणितीय सूत्रीकरण

कोसाइन एनीलिंग शेड्यूल निम्नलिखित सूत्र द्वारा परिभाषित है:

\eta_t = \eta_{min} + \frac{1}{2}(\eta_{max} - \eta_{min}) \left(1 + \cos\left(\frac{t \pi}{T}\right)\right)

जहाँ \eta_t इटरेशन या एपोच t पर लर्निंग रेट है, \eta_{max} प्रारंभिक लर्निंग रेट है, \eta_{min} न्यूनतम लर्निंग रेट है (अक्सर 0 पर सेट), और T एक चक्र में कुल प्रशिक्षण चरणों की संख्या है। कोसाइन फ़ंक्शन t के 0 से T तक जाने पर 1 से -1 तक घटता है, जिससे लर्निंग रेट \eta_{max} से \eta_{min} तक एक सुचारू, घुमावदार तरीके से गिरती है। इस सूत्र को गर्म पुनःप्रारंभ के लिए अनुकूलित किया जा सकता है, जहाँ शेड्यूल को समय-समय पर रीसेट किया जाता है, जैसा कि नीचे वर्णित है।

शेड्यूल आमतौर पर प्रति एपोच या प्रति बैच लागू किया जाता है, कार्यान्वयन पर निर्भर करता है। उदाहरण के लिए, PyTorch और TensorFlow जैसे फ्रेमवर्क में, torch.optim.lr_scheduler.CosineAnnealingLR जैसे अंतर्निहित फ़ंक्शन इस शेड्यूल को लागू करते हैं, जिससे अभ्यासकर्ता प्रारंभिक लर्निंग रेट और एपोच की संख्या निर्दिष्ट कर सकते हैं। सुचारू क्षय अचानक परिवर्तनों से बचने में मदद करता है जो प्रशिक्षण को अस्थिर कर सकते हैं।

ऐतिहासिक संदर्भ

कोसाइन एनीलिंग को Deep learning अनुसंधान के संदर्भ में समय-आधारित, स्टेप-आधारित और एक्सपोनेंशियल क्षय जैसे पारंपरिक शेड्यूल के विकल्प के रूप में पेश किया गया था। ये पुराने तरीके, प्रभावी होते हुए भी, अक्सर क्षय मापदंडों के मैनुअल ट्यूनिंग की आवश्यकता होती है और हाइपरपैरामीटर की पसंद के प्रति संवेदनशील हो सकते हैं। कोसाइन शेड्यूल को इल्या लोशचिलोव और फ्रैंक हटर ने अपने 2017 के पेपर "SGDR: स्टोकेस्टिक ग्रेडिएंट डिसेंट विद वार्म रिस्टार्ट्स" में लोकप्रिय बनाया, जिसने अभिसरण में सुधार के लिए आवधिक पुनःप्रारंभ के साथ कोसाइन एनीलिंग का उपयोग प्रस्तावित किया। यह कार्य लर्निंग रेट शेड्यूल पर पहले के शोध पर आधारित था, जैसे कि समय-आधारित क्षय सूत्र \eta_{n+1} = \eta_0 / (1 + dn), जहाँ \eta_0 प्रारंभिक दर है और d एक क्षय पैरामीटर है।

प्रशिक्षण के दौरान लर्निंग रेट को बदलने का विचार अनुकूली-नियंत्रण साहित्य में निहित है, जहाँ लर्निंग रेट को कभी-कभी गेन कहा जाता है। वर्षों से, शोधकर्ताओं ने कई शेड्यूल खोजे हैं, जिनमें एक्सपोनेंशियल क्षय \eta_n = \eta_0 e^{-dn} और स्टेप-आधारित क्षय शामिल हैं, लेकिन कोसाइन एनीलिंग ने कई कार्यों में तेज़ अभिसरण और बेहतर सामान्यीकरण प्राप्त करने की क्षमता के लिए लोकप्रियता हासिल की।

अन्य शेड्यूल से संबंध

कोसाइन एनीलिंग सामान्य शेड्यूल से कई तरीकों से भिन्न है। समय-आधारित शेड्यूल लर्निंग रेट को इटरेशन की संख्या के व्युत्क्रमानुपाती घटाते हैं, जो प्रशिक्षण के अंत में बहुत छोटी दरों का कारण बन सकता है। स्टेप-आधारित शेड्यूल पूर्वनिर्धारित अंतराल पर दर को एक कारक से गिराते हैं, जिससे अचानक परिवर्तन हो सकते हैं। एक्सपोनेंशियल शेड्यूल निरंतर क्षय करते हैं लेकिन अक्सर बहुत तेज़ी से। इसके विपरीत, कोसाइन एनीलिंग एक क्रमिक गिरावट प्रदान करता है जो न तो बहुत तेज़ है और न ही बहुत धीमी, और यह स्वाभाविक रूप से "वार्म-अप" चरण की अनुमति देता है यदि प्रारंभिक लर्निंग रेट उचित रूप से सेट की गई है।

मोमेंटम, अनुकूलन में एक और प्रमुख घटक, अक्सर कोसाइन एनीलिंग के साथ उपयोग किया जाता है। मोमेंटम सीखने को तेज़ करने में मदद करता है जब ग्रेडिएंट एक सुसंगत दिशा में इंगित करते हैं और छोटे उभारों पर लुढ़कती गेंद के समान स्थानीय मिनिमा से बचने में मदद करता है। मोमेंटम और कोसाइन-क्षयकारी लर्निंग रेट का संयोजन Transformer (architecture) मॉडल के प्रशिक्षण में आम है, जहाँ शेड्यूल बड़े पैरामीटर स्थानों के अनुकूलन को स्थिर करने में मदद करता है।

गर्म पुनःप्रारंभ और विविधताएँ

कोसाइन एनीलिंग का एक उल्लेखनीय प्रकार गर्म पुनःप्रारंभ तकनीक है, जहाँ शेड्यूल को एक चक्र के बाद रीसेट किया जाता है, जिससे लर्निंग रेट उच्च मान पर वापस कूद सकती है। यह SGDR विधि में लागू किया गया है, जहाँ लर्निंग रेट लंबाई T के चक्र पर एक कोसाइन वक्र का अनुसरण करती है, फिर एक नए चक्र के साथ पुनःप्रारंभ होती है, अक्सर लंबी अवधि के साथ। यह दृष्टिकोण मॉडल को स्थानीय मिनिमा से बचने और लॉस परिदृश्य के विभिन्न क्षेत्रों का पता लगाने में मदद कर सकता है, जिससे बेहतर प्रदर्शन होता है। गर्म पुनःप्रारंभ प्रकार विशेष रूप से Deep learning कार्यों में उपयोगी है जहाँ लॉस सतह गैर-उत्तल है।

अन्य विविधताओं में रैखिक वार्म-अप चरण के साथ कोसाइन एनीलिंग शामिल है, जहाँ लर्निंग रेट पहले कुछ एपोच में छोटे मान से प्रारंभिक अधिकतम तक बढ़ती है, फिर कोसाइन रूप से घटती है। यह अक्सर प्रशिक्षण की शुरुआत में अस्थिरता से बचने के लिए Large language model के प्रशिक्षण में उपयोग किया जाता है।

आधुनिक AI में अनुप्रयोग

कोसाइन एनीलिंग का व्यापक रूप से विभिन्न डोमेन में अत्याधुनिक मॉडल के प्रशिक्षण में उपयोग किया जाता है। Artificial intelligence अनुसंधान में, यह कई Deep learning फ्रेमवर्क के लिए एक डिफ़ॉल्ट विकल्प है। उदाहरण के लिए, OpenAI और Google DeepMind ने बड़े पैमाने के मॉडल, जिसमें Transformer (architecture)-आधारित आर्किटेक्चर शामिल हैं, के प्रशिक्षण में कोसाइन शेड्यूल का उपयोग किया है। यह शेड्यूल PyTorch और TensorFlow जैसी लोकप्रिय लाइब्रेरी में भी एकीकृत है, जिससे यह अभ्यासकर्ताओं के लिए सुलभ है।

कंप्यूटर विज़न में, कोसाइन एनीलिंग ने CIFAR-10 और ImageNet जैसे बेंचमार्क डेटासेट पर सटीकता में सुधार दिखाया है। प्राकृतिक भाषा प्रसंस्करण में, इसका उपयोग BERT और GPT जैसे मॉडल को प्रशिक्षित करने के लिए किया जाता है, जहाँ शेड्यूल लाखों पैरामीटरों में लर्निंग रेट को प्रबंधित करने में मदद करता है। यह तकनीक Generative AI मॉडल, जिसमें डिफ्यूजन मॉडल और GAN शामिल हैं, में भी प्रशिक्षण को स्थिर करने के लिए लागू की जाती है।

लाभ और सीमाएँ

कोसाइन एनीलिंग का प्राथमिक लाभ इसका सुचारू क्षय है, जो दोलनों के जोखिम को कम करता है और मॉडल को अच्छे न्यूनतम में अभिसरण करने में मदद करता है। इसे कुछ अन्य शेड्यूल की तुलना में कम हाइपरपैरामीटर की आवश्यकता होती है, क्योंकि मुख्य पैरामीटर प्रारंभिक और न्यूनतम लर्निंग रेट और चक्र लंबाई हैं। हालाँकि, शेड्यूल अनुकूली नहीं है; यह लॉस परिदृश्य या ग्रेडिएंट जानकारी पर प्रतिक्रिया नहीं करता है। इसके विपरीत, Adam जैसे अनुकूली तरीके ग्रेडिएंट आँकड़ों के आधार पर प्रति पैरामीटर लर्निंग रेट को समायोजित करते हैं, जो कुछ सेटिंग्स में अधिक मजबूत हो सकते हैं। कोसाइन एनीलिंग अक्सर ऐसे अनुकूलकों के साथ संयोजन में उपयोग किया जाता है, जिसमें शेड्यूल वैश्विक लर्निंग रेट पर लागू होता है।

एक सीमा यह है कि चक्र लंबाई T सेट करने के लिए एपोच की कुल संख्या पहले से ज्ञात होनी चाहिए। यदि प्रशिक्षण बढ़ाया जाता है, तो शेड्यूल को पुनःप्रारंभ या समायोजित करने की आवश्यकता हो सकती है। इसके अतिरिक्त, प्रारंभिक लर्निंग रेट की पसंद महत्वपूर्ण बनी रहती है, क्योंकि बहुत अधिक दर कोसाइन क्षय के साथ भी विचलन का कारण बन सकती है।

व्यवहार में कार्यान्वयन

व्यवहार में, कोसाइन एनीलिंग को लागू करना सीधा है। PyTorch में, कोई torch.optim.lr_scheduler.CosineAnnealingLR(optimizer, T_max, eta_min=0) का उपयोग कर सकता है, जहाँ T_max एपोच की संख्या है। TensorFlow में, tf.keras.optimizers.schedules.CosineDecay वर्ग समान कार्यक्षमता प्रदान करता है। ये कार्यान्वयन स्वचालित रूप से प्रत्येक एपोच या बैच पर लर्निंग रेट को अपडेट करते हैं, जिससे शोधकर्ता मॉडल आर्किटेक्चर और डेटा पर ध्यान केंद्रित कर सकते हैं।

उदाहरण के लिए, एक विशिष्ट प्रशिक्षण लूप 0.1 की प्रारंभिक लर्निंग रेट सेट कर सकता है और कोसाइन एनीलिंग का उपयोग करके इसे 100 एपोच में 0 तक घटा सकता है। यह शेड्यूल अक्सर मोमेंटम के साथ SGD जैसे मोमेंटम-आधारित अनुकूलकों के साथ संयुक्त होता है, जो कंप्यूटर विज़न कार्यों में आम है। Large language model के लिए, एक वार्म-अप चरण अक्सर जोड़ा जाता है, जहाँ लर्निंग रेट पहले कुछ हज़ार चरणों में रैखिक रूप से बढ़ती है, फिर कोसाइन क्षय का अनुसरण करती है।

यह भी देखें

  • learning-rate (यदि उपलब्ध हो)
  • stochastic-gradient-descent (यदि उपलब्ध हो)
  • optimization-algorithms (यदि उपलब्ध हो)
  • Deep learning

संदर्भ

  • Loshchilov, Ilya; Hutter, Frank (2017). "SGDR: स्टोकेस्टिक ग्रेडिएंट डिसेंट विद वार्म रिस्टार्ट्स।" इंटरनेशनल कॉन्फ्रेंस ऑन लर्निंग रिप्रेजेंटेशन।
  • Géron, Aurélien (2017). "ग्रेडिएंट डिसेंट।" हैंड्स-ऑन मशीन लर्निंग विद स्किकिट-लर्न एंड टेन्सरफ्लो। ओ'रेली। पृ. 113–124। ISBN 978-1-4919-6229-9।
  • Plagianakos, V. P.; Magoulas, G. D.; Vrahatis, M. N. (2001). "लर्निंग रेट एडेप्टेशन इन स्टोकेस्टिक ग्रेडिएंट डिसेंट।" एडवांसेज इन कन्वेक्स एनालिसिस एंड ग्लोबल ऑप्टिमाइज़ेशन। क्लूवर। पृ. 433–444। ISBN 0-7923-6942-4।
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:machine-learning·optimization·learning-rate-schedule
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास