अंग्रेज़ी से अनुवादित

वार्मअप अनुसूची एक प्रारंभिक प्रशिक्षण चरण है जिसमें सीखने की दर कम मान से लक्ष्य मान तक बढ़ती है, जिससे प्रारंभिक अनुकूलन स्थिर होता है और गहरे तंत्रिका नेटवर्क में विचलन को रोका जाता है।

एक वार्मअप शेड्यूल एक लर्निंग रेट शेड्यूलिंग तकनीक है जिसका उपयोग डीप लर्निंग में लर्निंग रेट को एक छोटे प्रारंभिक मान से लक्ष्य मान तक सीमित संख्या में प्रशिक्षण चरणों में धीरे-धीरे बढ़ाने के लिए किया जाता है। इसे मॉडल प्रशिक्षण की शुरुआत में, समग्र लर्निंग-रेट शेड्यूल के मुख्य क्षय चरण से पहले लागू किया जाता है। वार्मअप का प्राथमिक उद्देश्य प्रारंभिक युगों के दौरान अनुकूलन प्रक्रिया को स्थिर करना है, जब मॉडल पैरामीटर इष्टतम से दूर होते हैं और ग्रेडिएंट बड़े या शोर वाले हो सकते हैं। कम लर्निंग रेट से शुरू करके, वार्मअप चरण बड़े पैरामीटर अपडेट को रोकता है जो प्रशिक्षण को अस्थिर कर सकते हैं या नुकसान को विचलित कर सकते हैं, और यह मॉडल को हानि परिदृश्य के उस क्षेत्र में जाने की अनुमति देता है जहां बड़े कदम सुरक्षित हैं। वार्मअप शेड्यूल बड़े भाषा मॉडल, ट्रांसफॉर्मर और अन्य गहरी वास्तुकलाओं को प्रशिक्षित करने के लिए विशेष रूप से महत्वपूर्ण हैं जो बैच सामान्यीकरण, लेयर सामान्यीकरण या एडम जैसे अनुकूली अनुकूलकों पर निर्भर करते हैं।

वार्मअप चरण आमतौर पर बाद के क्षय शेड्यूल के साथ संयुक्त होता है, जैसे कि रैखिक क्षय, कोसाइन क्षय, या घातीय क्षय, जो प्रशिक्षण के बाकी हिस्सों में लर्निंग रेट को लगभग शून्य मान तक कम कर देते हैं। एक विशिष्ट शेड्यूल में पहले कुछ सौ या हजार चरणों में एक रैखिक वार्मअप शामिल हो सकता है, जिसके बाद प्रशिक्षण के अंत तक कोसाइन क्षय होता है। वार्मअप अवधि और शीर्ष लर्निंग रेट का चुनाव मॉडल आकार, डेटासेट, बैच आकार और उपयोग किए गए अनुकूलक पर निर्भर करता है, और इसे अक्सर हाइपरपैरामीटर ट्यूनिंग के माध्यम से अनुभवजन्य रूप से चुना जाता है। वार्मअप अब कई प्रमुख मॉडलों के लिए प्रशिक्षण पाइपलाइनों में एक मानक घटक है, जिसमें आवर्ती तंत्रिका नेटवर्क, संवेगी तंत्रिका नेटवर्क और बड़े भाषा मॉडल जैसे जनरेटिव मॉडल शामिल हैं।

इतिहास और उत्पत्ति

लर्निंग-रेट वार्मअप की अवधारणा 2010 के दशक के मध्य में डीप लर्निंग अनुसंधान के संदर्भ में उभरी। सबसे प्रारंभिक प्रलेखित उपयोगों में से एक का श्रेय Google (पूर्व में Google रिसर्च के रूप में जाना जाता था) के शोधकर्ताओं को दिया जाता है, जिन्होंने छवि वर्गीकरण मॉडल को प्रशिक्षित किया और पहचाना कि उच्च लर्निंग रेट से शुरू करने से गंभीर विचलन हो सकता है। 2013 में गहरे नेटवर्क प्रशिक्षण पर एक पेपर में, बर्नार्ड विड्रो और अन्य ने अनुकूली लर्निंग रेट का अध्ययन किया, लेकिन विशिष्ट शब्द "वार्मअप" ने लगभग 2018 में मूल BERT पेपर में एडम-संबंधित प्रशिक्षण तरकीबों के प्रकाशन के साथ लोकप्रियता हासिल की। 2018 में Google द्वारा जारी BERT पेपर ने स्पष्ट रूप से प्रीट्रेनिंग के लिए 10,000-चरणीय वार्मअप का उपयोग किया। यह प्रथा NLP समुदाय में व्यापक रूप से अपनाई गई।

एडम जैसे अनुकूली अनुकूलक और इसके वेरिएंट, जिनमें मोमेंटम के साथ SGD शामिल है, विशेष रूप से तब अस्थिरता के शिकार होते हैं जब शुरुआत में बड़े लर्निंग रेट लागू किए जाते हैं। वार्मअप एक ऐसी घटना को कम करने में मदद करता है जहां पहले कुछ चरणों में बहुत बड़े ग्रेडिएंट उत्पन्न होते हैं, अनुकूली लर्निंग रेट अनुमानों को बढ़ा देते हैं, जिससे खराब अभिसरण होता है। ग्रेडिएंट क्लिपिंग, बैच सामान्यीकरण और ग्रेडिएंट क्लिपिंग जैसी तकनीकें भी समान अस्थिरता को संबोधित करती हैं, लेकिन वार्मअप अक्सर सरल और अधिक सामान्य होता है।

प्रेरणा और सिद्धांत

वार्मअप शेड्यूल के लिए प्राथमिक प्रेरणा अन्वेषण और स्थिरता के बीच व्यापार-बंद में निहित है। आरंभीकरण पर, मॉडल के वजन आमतौर पर शून्य माध्य के साथ एक यादृच्छिक वितरण से खींचे जाते हैं, जो बड़े सक्रियण और ग्रेडिएंट उत्पन्न कर सकते हैं। इस बिंदु पर एक बड़ा लर्निंग रेट निर्धारित करने से वजन ऐसे क्षेत्र में कूद सकते हैं जहां नुकसान बहुत अधिक है या मॉडल केवल शोर पकड़ता है। एक कम लर्निंग रेट मॉडल को प्रारंभिक त्रुटियों को धीरे-धीरे ठीक करने की अनुमति देता है, धीरे-धीरे अधिक स्थिर क्षेत्रों की ओर बढ़ता है।

इसके अतिरिक्त, एडम जैसे अनुकूली अनुकूलक एकत्रित ग्रेडिएंट के दूसरे-क्षण अनुमान बनाए रखते हैं। यदि पहले कुछ चरणों में एक बड़ा ग्रेडिएंट स्पाइक होता है, तो अनुकूलक की चलती औसत बढ़ जाती है, जिससे भविष्य के चरणों के लिए प्रभावी लर्निंग रेट कम हो जाती है और अभिसरण धीमा हो जाता है। वार्मअप अनुकूलक को पूर्ण क्षमता पर सीखने से पहले विश्वसनीय आँकड़े प्राप्त करने का समय देता है।

हाल के सैद्धांतिक कार्य ने वार्मअप और बायेसियन लर्निंग में मोड कवरिंग से मोड सीकिंग व्यवहार में संक्रमण के बीच एक संबंध दिखाया है, लेकिन सबसे व्यावहारिक व्याख्या ग्रेडिएंट शोर पर केंद्रित है। प्रशिक्षण के शुरुआती दौर में, छोटे प्रभावी नमूना आकार और खराब पैमाने पर नेटवर्क आउटपुट के कारण स्टोकेस्टिकता अनुमान शोर वाले होते हैं। एक रैखिक वार्मअप अक्सर प्रक्रिया को सुचारू करने के लिए पर्याप्त होता है।

वार्मअप शेड्यूल के प्रकार

वार्मअप के कई सामान्य कार्यान्वयन हैं:

  • रैखिक वार्मअप: लर्निंग रेट एक निर्दिष्ट संख्या में चरणों (जैसे, 3,000 चरण) में लगभग शून्य से लक्ष्य मान तक रैखिक रूप से बढ़ता है। BERT-शैली प्रशिक्षण और कई ट्रांसफॉर्मर कार्यान्वयन में उपयोग किया जाता है।
  • घातीय वार्मअप: लर्निंग रेट कम मान से घातीय रूप से बढ़ता है। शायद ही कभी उपयोग किया जाता है, अक्सर रैखिक या बहुपद द्वारा प्रतिस्थापित किया जाता है।
  • बहुपद वार्मअप: लर्निंग रेट चरण सूचकांक के बहुपद के रूप में स्केल होता है, अक्सर 2 या 3 जैसे छोटे डिग्री के साथ।
  • स्थिर वार्मअप: लर्निंग रेट एक निश्चित अवधि के लिए कम स्थिर मान पर रखा जाता है, फिर लक्ष्य तक बढ़ाया जाता है।
  • वन-साइकिल नीति और सुपर-अभिसरण: कभी-कभी चक्रीय शेड्यूल के साथ संयुक्त छोटे वार्मअप का उपयोग करता है।

व्यवहार में, रैखिक वार्मअप GPT मॉडल जैसे ट्रांसफॉर्मर पुस्तकालयों में सबसे आम है और इसे अक्सर कॉन्फ़िगरेशन फ़ाइलों में "वार्मअप स्टेप्स" के रूप में संदर्भित किया जाता है। उदाहरण के लिए, एक विशिष्ट प्रशिक्षण रन 0.1 से अधिकतम लर्निंग रेट तक गर्म करने के लिए कुल प्रशिक्षण चरणों का 2% उपयोग कर सकता है।

बड़े भाषा मॉडल में वार्मअप

GPT-3, Llama 2 और BLOOM जैसे बड़े भाषा मॉडल स्थिरता के लिए वार्मअप चरण का उपयोग करते हैं। उदाहरण के लिए, GPT-3 पेपर ने प्रारंभिक दर के 10% तक कोसाइन क्षय के साथ 250,000 चरणों (या कुल चरणों का लगभग 3%) के वार्मअप का उपयोग करने की सूचना दी। LLaMA जैसे अन्य मॉडल 1,000 चरणों तक वार्मअप के साथ कोसाइन शेड्यूल का उपयोग करते हैं। ऐसे मॉडलों का फाइन-ट्यूनिंग या प्रीट्रेनिंग, जिनमें अक्सर अरबों पैरामीटर होते हैं, लर्निंग रेट और वार्मअप अवधि के सावधानीपूर्वक ट्यूनिंग की आवश्यकता होती है, और यह आमतौर पर अनुसंधान पेपरों में दर्ज किया जाता है।

व्यवहार में, वार्मअप प्रशिक्षण लूप की स्थिरता में योगदान देता है और नुकसान विचलन की संभावना को कम करता है, जो संरक्षित कंप्यूट संसाधनों को बर्बाद कर सकता है। कुछ प्रशिक्षण फ्रेमवर्क में, वार्मअप शेड्यूल एक लर्निंग-रेट शेड्यूलिंग कॉन्फ़िगरेशन से पार्स किया जाता है जो वार्मअप चरणों, वार्मअप प्रारंभिक कारक और क्षय के लिए अलग-अलग मानों की अनुमति देता है।

कंप्यूटर विज़न में वार्मअप

वार्मअप का उपयोग कंप्यूटर विज़न कार्यों में भी किया जाता है। 2015 के पेपर में क्लासिक ResNet प्रशिक्षण ने चरण क्षय के साथ एक मोमेंटम अनुकूलक का उपयोग किया, लेकिन बाद के काम जैसे ResNet ने ImageNet पर 0.1 की प्रारंभिक लर्निंग रेट से रैखिक वार्मअप प्राप्त किया, लेकिन इसे अक्सर 5 युगों के लिए लागू किया गया। विज़न ट्रांसफॉर्मर के प्रशिक्षण में, वार्मअप मानक है, ViT ने ImageNet पर 500 चरणों (लगभग 0.5 युग) का वार्मअप उपयोग किया। तंत्रिका नेटवर्क में बैच सामान्यीकरण का उपयोग करने वाले पेपरों ने कभी-कभी पहले कुछ बैचों पर बैच सामान्यीकरण आँकड़ों की अस्थिरता की भरपाई के लिए वार्मअप पर भरोसा किया।

व्यावहारिक विचार और हाइपरपैरामीटर

वार्मअप अवधि एक हाइपरपैरामीटर है, जिसे मॉडल आकार, कुल प्रशिक्षण चरणों, बैच आकार और अनुकूलक के आधार पर चुना जाता है। कई कार्यान्वयन कुल प्रशिक्षण चरणों के लगभग 10 से 20% के लिए रैखिक वार्मअप डिफ़ॉल्ट करते हैं। लंबे रनों के लिए, जैसे कि अरबों टोकन पर ट्रांसफॉर्मर प्रशिक्षण, वार्मअप हजारों चरणों में हो सकता है। अति-आवृत्ति: बहुत लंबा वार्मअप कंप्यूट संसाधनों को बर्बाद करता है, और बहुत छोटा विचलन का कारण बन सकता है।

वार्मअप के बाद लक्ष्य लर्निंग रेट आमतौर पर अधिकतम लर्निंग रेट होता है। यह मान अक्सर एडम अनुकूलक के साथ विशिष्ट ट्रांसफॉर्मर के लिए 1e-4 से 1e-3 के बीच चुना जाता है। कुछ पेपर लर्निंग-रेट फाइंडर या हाइपरपैरामीटर स्वीप द्वारा पाए गए अधिकतम लर्निंग रेट का उपयोग करते हैं। एक अन्य प्रथा वार्मअप के बाद लर्निंग रेट को स्थिर स्तर पर रखना है, फिर घातीय क्षय का उपयोग करना है।

वार्मअप अक्सर लर्निंग रेट शेड्यूलिंग के साथ संयुक्त होता है क्योंकि वार्मअप लर्निंग-रेट शेड्यूल का एक संशोधन है। PyTorch (लर्निंग-रेट शेड्यूलर के साथ) और TensorFlow जैसे पुस्तकालय वार्मअप और क्षय के लिए अंतर्निहित कार्यों का समर्थन करते हैं; नमूना कोड अक्सर प्रशिक्षण स्क्रिप्ट में उपयोग किया जाता है।

अनुभवजन्य परिणाम और अध्ययन

कई अनुसंधान अध्ययनों ने वार्मअप के लाभ को मान्य किया है। 2017 के लंबे प्रशिक्षण युगों पर एक अध्ययन में, 100 से कम चरणों के वार्मअप ने छवि वर्गीकरण के लिए परीक्षण सटीकता में 5% सापेक्ष सुधार किया। बड़े पैमाने के मॉडल के लिए, खरोंच से GPT-जैसे ट्रांसफॉर्मर प्रशिक्षण के लिए एक सामान्य आधार रेखा 1/3 अनुपात के विभिन्न वार्मअप के साथ 1,000 चरणों की रैंप-अप है। डीप लर्निंग में ज्ञात तृतीय-पक्ष प्रीप्रिंट 'ग्रोकिंग' विश्लेषण ने पाया कि वार्मअप वास्तुकला के लिए शुरुआती ध्यान मुद्दों से बचने के लिए महत्वपूर्ण है।

वार्मअप के दौरान हानि परिदृश्य के औपचारिक विश्लेषण भी मौजूद हैं, जो दिखाते हैं कि हानि वक्रता महत्वपूर्ण रूप से बदलती है, और वार्मअप तेज मिनिमा के क्षेत्रों से बचने में मदद कर सकता है। कुछ इसे आकर्षण के बेसिन में वजन को संतुलित करने के लिए एक तंत्र के रूप में देखते हैं।

विकल्प और संबंधित तकनीकें

वार्मअप प्रारंभिक प्रशिक्षण को स्थिर करने का एकमात्र तरीका नहीं है। वैकल्पिक दृष्टिकोणों में शुरुआत से धीमी लक्ष्य लर्निंग रेट, चरण-क्षय या उपयोग-आधारित मात्रा जैसे लर्निंग रेट शेड्यूल का उपयोग करना, या पुनरारंभ के साथ कोसाइन एनीलिंग जैसी गर्म पुनरारंभ तकनीकों का उपयोग करना शामिल है (जिसमें स्वयं वार्मअप का एक रूप शामिल है)। ग्रेडिएंट क्लिपिंग (ग्रेडिएंट क्लिपिंग) अक्सर स्पाइक्स को कम करने के लिए वार्मअप के साथ संयोजन में उपयोग किया जाता है। अनुकूलकों के लिए भी, 0.9 और 0.999 पर सेट बीटा के साथ एडम अनुकूलक को वार्मअप के दौरान समायोजन की आवश्यकता हो सकती है। शेड्यूल-मुक्त अनुकूलकों पर कुछ काम (उदाहरण के लिए, 2024 का पेपर Defazio और Mishchenko द्वारा) ने वार्मअप के बिना एक शेड्यूल-मुक्त विधि पेश की, लेकिन यह कम आम बनी हुई है।

भविष्य की दिशाएं और अनुसंधान

2023-2025 के अनुसंधान ने कई वार्मअप चरणों या ग्रेडिएंट आँकड़ों के आधार पर अनुकूली वार्मअप की खोज की, लेकिन मानक अभ्यास रैखिक वार्मअप बना हुआ है। हाल के ट्रांसफॉर्मर स्केलिंग प्रयासों में, क्लाउड-आधारित प्रशिक्षण में हाइपरपैरामीटर के रूप में वार्मअप अवधि में निरंतर रुचि है। OpenAI अनुसंधान समूह के 2024 के एक पेपर ने कहा कि चरणों के एक अंश के रूप में वार्मअप बड़े मॉडलों से गुजर चुका है। ऐसे मेमोरी-कुशल अनुकूलक भी हैं जो वार्मअप को एडम के पहले मोमेंटम से जोड़ते हैं, लेकिन किसी ने भी इसे प्रतिस्थापित नहीं किया है।

वार्मअप एक बुनियादी लेकिन महत्वपूर्ण घटक बना हुआ है जो प्राकृतिक भाषा प्रसंस्करण, कंप्यूटर विज़न और सुदृढीकरण सीखने के डोमेन में डीप लर्निंग में अभिसरण दर और अंतिम प्रदर्शन को प्रभावित करता है। इसका सरल कार्यान्वयन और सिद्ध प्रभावशीलता यह सुनिश्चित करती है कि यह निकट भविष्य के लिए डीप लर्निंग पाइपलाइनों में मानक बना रहेगा।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:deep-learning·optimization·training-techniques·learning-rate
इस पृष्ठ को अंतिम बार संपादित किया गया 9 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास