वन-साइकिल नीति एक लर्निंग रेट शेड्यूलिंग तकनीक है जिसका उपयोग न्यूरल नेटवर्क के प्रशिक्षण में किया जाता है। इसे लेस्ली एन. स्मिथ द्वारा 2018 में उनके पहले के चक्रीय लर्निंग रेट पर किए गए कार्य के परिशोधन के रूप में पेश किया गया था। यह नीति लर्निंग रेट भिन्नता के एक एकल चक्र को निर्धारित करती है: प्रशिक्षण के पहले भाग में लर्निंग रेट को कम आधार मान से अधिकतम मान तक रैखिक रूप से बढ़ाया जाता है, फिर रैखिक रूप से (या कोसाइन एनीलिंग के माध्यम से) आधार मान से काफी कम मान पर वापस घटाया जाता है। यह शेड्यूल आमतौर पर मोमेंटम के संगत व्युत्क्रम समायोजन के साथ जोड़ा जाता है, जहां वार्मअप चरण के दौरान मोमेंटम घटता है और एनीलिंग चरण के दौरान बढ़ता है। वन-साइकिल नीति को तेज प्रशिक्षण अभिसरण की अनुमति देने के लिए डिज़ाइन किया गया है और यह अक्सर स्थिर या स्टेप-डिके लर्निंग रेट शेड्यूल की तुलना में बेहतर अंतिम सटीकता प्रदान करती है, जबकि कई चक्रों के बजाय केवल एक एकल चक्र का उपयोग करती है।
यह नीति लर्निंग रेट, बैच आकार और सामान्यीकरण के बीच संबंध के बारे में अनुभवजन्य अवलोकनों पर आधारित है। स्मिथ का पहले का काम चक्रीय लर्निंग रेट (2015-2017) पर दिखाया गया था कि लर्निंग रेट को चक्रीय तरीके से बदलने से ऑप्टिमाइज़र को सैडल पॉइंट्स और तेज मिनिमा से बचने में मदद मिल सकती है, जिससे बेहतर सामान्यीकरण होता है। वन-साइकिल नीति इस विचार को एक एकल, अच्छी तरह से परिभाषित शेड्यूल में संक्षेपित करती है जिसे लागू करना और ट्यून करना आसान है। यह डीप लर्निंग चिकित्सक के टूलकिट में एक मानक उपकरण बन गया है, विशेष रूप से कंप्यूटर विज़न मॉडल के प्रशिक्षण के लिए और हाल ही में, बड़े भाषा मॉडल के फाइन-ट्यूनिंग के लिए।
प्रेरणा और पृष्ठभूमि
लर्निंग रेट का चुनाव डीप न्यूरल नेटवर्क के प्रशिक्षण में सबसे महत्वपूर्ण हाइपरपैरामीटर में से एक है। एक लर्निंग रेट जो बहुत अधिक है वह विचलन का कारण बन सकती है, जबकि जो बहुत कम है वह धीमी अभिसरण की ओर ले जाती है और खराब स्थानीय मिनिमा में फंस सकती है। पारंपरिक शेड्यूल, जैसे स्टेप डिके या एक्सपोनेंशियल डिके, के लिए डिके कारकों और स्टेप अंतराल के सावधानीपूर्वक ट्यूनिंग की आवश्यकता होती है। चक्रीय लर्निंग रेट, जिसे स्मिथ द्वारा 2015 में पेश किया गया था, ने लर्निंग रेट को न्यूनतम और अधिकतम सीमा के बीच दोलन करके एक अधिक मजबूत विकल्प की पेशकश की, जिससे ऑप्टिमाइज़र को समय-समय पर तेज मिनिमा से बचने और नुकसान परिदृश्य के सपाट क्षेत्रों का पता लगाने की अनुमति मिलती है।
वन-साइकिल नीति एक विशिष्ट आकार के साथ एक एकल चक्र का उपयोग करके इस विचार का विस्तार करती है। तर्क यह है कि प्रारंभिक वार्मअप चरण नेटवर्क को छोटे लर्निंग रेट के साथ प्रशिक्षण शुरू करने की अनुमति देता है, जिससे प्रारंभिक विचलन को रोका जा सके और ऑप्टिमाइज़र को स्थिर होने दिया जा सके। उसके बाद उच्च लर्निंग रेट में वृद्धि मॉडल को नुकसान परिदृश्य को अधिक साहसपूर्वक पार करने में मदद करती है, संभावित रूप से बेहतर मिनिमा ढूंढती है। अंतिम एनीलिंग चरण, बहुत कम लर्निंग रेट के साथ, मॉडल को एक तेज, अच्छी तरह से सामान्यीकरण करने वाले मिनिमम में बसने की अनुमति देता है। यह एकल-चक्र दृष्टिकोण कम्प्यूटेशनल रूप से कुशल है क्योंकि इसमें कई चक्रों की आवश्यकता नहीं होती है, और यह अक्सर कम युगों में अत्याधुनिक परिणाम प्राप्त करता है।
शेड्यूल
मानक वन-साइकिल नीति में, प्रशिक्षण प्रक्रिया को दो चरणों में विभाजित किया गया है। पहला चरण, जिसे अक्सर वार्मअप चरण कहा जाता है, कुल प्रशिक्षण चरणों का एक अंश घेरता है, आमतौर पर 20% से 30%। इस चरण के दौरान, लर्निंग रेट कम आधार मान (अक्सर शून्य के करीब) से अधिकतम मान तक रैखिक रूप से बढ़ती है। अधिकतम लर्निंग रेट आमतौर पर लर्निंग रेट फाइंडर का उपयोग करके निर्धारित की जाती है, एक तकनीक जिसे स्मिथ द्वारा भी लोकप्रिय बनाया गया था, जिसमें कुछ बैचों पर लर्निंग रेट को धीरे-धीरे बढ़ाना और सबसे तेज ढलान वाले क्षेत्र की पहचान करने के लिए नुकसान को प्लॉट करना शामिल है।
दूसरा चरण, एनीलिंग चरण, प्रशिक्षण के शेष 70% से 80% हिस्से को घेरता है। इस चरण के दौरान, लर्निंग रेट अधिकतम से वापस एक मान तक रैखिक रूप से घटती है जो आमतौर पर आधार मान का 1/10वां से 1/100वां हिस्सा होता है। कुछ कार्यान्वयन रैखिक एनीलिंग के बजाय कोसाइन एनीलिंग का उपयोग करते हैं, जो व्यवहार में अच्छी तरह से काम करता दिखाया गया है। अंतिम लर्निंग रेट अक्सर बहुत छोटे मान पर सेट की जाती है, जैसे 1e-5 या उससे कम, ताकि वजन के फाइन-ट्यूनिंग की अनुमति मिल सके।
मोमेंटम को व्युत्क्रम तरीके से समायोजित किया जाता है। वार्मअप चरण के दौरान, मोमेंटम को उच्च मान (जैसे, 0.95) से कम मान (जैसे, 0.85) तक घटाया जाता है। एनीलिंग चरण के दौरान, मोमेंटम को वापस उच्च मान तक बढ़ाया जाता है। यह व्युत्क्रम संबंध प्रशिक्षण को स्थिर करने में मदद करता है: वार्मअप के दौरान, कम मोमेंटम लर्निंग रेट बढ़ने पर ओवरशूटिंग को रोकता है, और एनीलिंग के दौरान, उच्च मोमेंटम लर्निंग रेट घटने पर ऑप्टिमाइज़र को दिशा बनाए रखने में मदद करता है।
कार्यान्वयन विवरण
वन-साइकिल नीति को लागू करने के लिए प्रत्येक चरण में ऑप्टिमाइज़र के लर्निंग रेट और मोमेंटम मापदंडों तक पहुंच की आवश्यकता होती है। अधिकांश डीप लर्निंग फ्रेमवर्क, जैसे PyTorch और TensorFlow, कॉलबैक या कस्टम प्रशिक्षण लूप के माध्यम से इन मापदंडों के गतिशील समायोजन की अनुमति देते हैं। नीति आमतौर पर कार्यान्वयन के आधार पर प्रति युग या प्रति बैच लागू की जाती है। बैच-स्तरीय शेड्यूलिंग के लिए, लर्निंग रेट को प्रत्येक बैच के बाद अपडेट किया जाता है, जो बेहतर नियंत्रण प्रदान करता है और अनुशंसित दृष्टिकोण है।
अधिकतम लर्निंग रेट एक प्रमुख हाइपरपैरामीटर है। इसका अनुमान लगाने के लिए स्मिथ का लर्निंग रेट फाइंडर आमतौर पर उपयोग किया जाता है। फाइंडर में एक छोटा प्रशिक्षण सत्र (जैसे, एक युग) चलाना शामिल है जहां लर्निंग रेट को बहुत छोटे मान से बड़े मान तक तेजी से बढ़ाया जाता है, और नुकसान दर्ज किया जाता है। अधिकतम लर्निंग रेट को उस मान के रूप में चुना जाता है जो नुकसान के तेजी से बढ़ने से ठीक पहले होता है। यह मान अक्सर नुकसान परिदृश्य में सबसे तेज ढलान बिंदु के पास होता है।
कुल युगों की संख्या भी महत्वपूर्ण है। वन-साइकिल नीति को एक निश्चित संख्या में युगों के लिए उपयोग करने के लिए डिज़ाइन किया गया है, और शेड्यूल की गणना उस कुल के आधार पर की जाती है। यदि युगों की संख्या बदल दी जाती है, तो शेड्यूल की पुनर्गणना की जानी चाहिए। व्यवहार में, नीति मध्यम संख्या में युगों (जैसे, 10-50) के साथ अच्छी तरह से काम करती है और पारंपरिक शेड्यूल के साथ लंबे प्रशिक्षण के बराबर परिणाम प्राप्त कर सकती है।
अन्य शेड्यूल से संबंध
वन-साइकिल नीति लर्निंग रेट शेड्यूल के व्यापक परिवार का हिस्सा है। यह चक्रीय लर्निंग रेट से निकटता से संबंधित है, लेकिन केवल एक चक्र का उपयोग करती है। यह वार्मअप शेड्यूल के साथ भी समानताएं साझा करती है, जो आमतौर पर ट्रांसफॉर्मर जैसे बड़े मॉडल के प्रशिक्षण में उपयोग किए जाते हैं। उदाहरण के लिए, मूल Transformer (architecture) पेपर में उपयोग किया गया Learning Rate Scheduling एक रैखिक वार्मअप के बाद चरण संख्या के व्युत्क्रम वर्गमूल के आनुपातिक क्षय शामिल करता है। वन-साइकिल नीति एक सममित या कोसाइन क्षय का उपयोग करके और मोमेंटम समायोजन को स्पष्ट रूप से जोड़कर भिन्न होती है।
स्थिर लर्निंग रेट शेड्यूल की तुलना में, वन-साइकिल नीति अक्सर तेजी से अभिसरण करती है और बेहतर मिनिमा तक पहुंचती है। स्टेप डिके की तुलना में, यह डिके माइलस्टोन को मैन्युअल रूप से चुनने की आवश्यकता को समाप्त करती है। नीति Batch Normalization, Data Augmentation, और Gradient Clipping जैसी अन्य प्रशिक्षण तकनीकों के साथ भी संगत है। व्यवहार में, इसका उपयोग अक्सर मौजूदा प्रशिक्षण पाइपलाइनों में लर्निंग रेट शेड्यूल के ड्रॉप-इन प्रतिस्थापन के रूप में किया जाता है।
अनुप्रयोग और प्रभाव
वन-साइकिल नीति को कंप्यूटर विज़न कार्यों में व्यापक रूप से अपनाया गया है, जैसे CIFAR-10 और ImageNet जैसे डेटासेट पर छवि वर्गीकरण। fast.ai समुदाय में, यह कन्वोल्यूशनल न्यूरल नेटवर्क के प्रशिक्षण के लिए एक मानक सिफारिश बन गई, और इसे fastai लाइब्रेरी में एकीकृत किया गया है। कई चिकित्सकों ने बताया है कि वन-साइकिल नीति का उपयोग करके वे कम युगों में अत्याधुनिक सटीकता प्राप्त कर सकते हैं, कभी-कभी प्रशिक्षण समय को आधा कर सकते हैं।
नीति ने प्राकृतिक भाषा प्रसंस्करण और Generative AI सहित अन्य डोमेन में भी अनुप्रयोग पाए हैं। उदाहरण के लिए, Large language model को फाइन-ट्यून करते समय, प्रशिक्षण को स्थिर करने के लिए अक्सर वार्मअप चरण का उपयोग किया जाता है, और वन-साइकिल नीति पूरी फाइन-ट्यूनिंग प्रक्रिया को शेड्यूल करने का एक सैद्धांतिक तरीका प्रदान करती है। हालांकि, बहुत बड़े मॉडलों के लिए, लर्निंग रेट फाइंडर चलाने की कम्प्यूटेशनल लागत निषेधात्मक हो सकती है, और सरल शेड्यूल अक्सर पसंद किए जाते हैं।
शोध ने वन-साइकिल नीति की विविधताओं का भी पता लगाया है। कुछ कार्यों ने विभिन्न वार्मअप अंशों, वैकल्पिक क्षय आकृतियों (जैसे, एक्सपोनेंशियल), और बैच आकार के साथ बातचीत की जांच की है। स्मिथ के मूल पेपर ने सुझाव दिया कि नीति बड़े बैच आकारों के साथ सबसे अच्छी तरह से काम करती है, क्योंकि प्रशिक्षण के मध्य में उच्च लर्निंग रेट कम ग्रेडिएंट शोर की भरपाई कर सकती है। इसका वितरित प्रशिक्षण के लिए निहितार्थ है, जहां बड़े बैच आकार आम हैं।
सैद्धांतिक अंतर्दृष्टि
वन-साइकिल नीति की सफलता को अक्सर नुकसान परिदृश्य को नेविगेट करने की इसकी क्षमता के लिए जिम्मेदार ठहराया जाता है। वार्मअप चरण के दौरान, मॉडल को धीरे से नुकसान परिदृश्य के एक ऐसे क्षेत्र की ओर निर्देशित किया जाता है जो अनुकूलन के लिए अनुकूल है। मध्य चरण में उच्च लर्निंग रेट ऑप्टिमाइज़र को बड़े कदम उठाने की अनुमति देती है, संभावित रूप से तेज मिनिमा से बचती है जो खराब सामान्यीकरण करते हैं। अंतिम एनीलिंग चरण मॉडल को एक सपाट मिनिमम में परिवर्तित होने की अनुमति देता है, जो बेहतर सामान्यीकरण से जुड़ा है।
यह व्याख्या Deep learning में नुकसान परिदृश्य ज्यामिति की व्यापक समझ के साथ संरेखित है। सपाट मिनिमा को तेज मिनिमा की तुलना में बेहतर सामान्यीकरण करने के लिए माना जाता है, और चक्रीय लर्निंग रेट को ऑप्टिमाइज़र को सपाट क्षेत्रों की ओर पक्षपाती करने के लिए दिखाया गया है। वन-साइकिल नीति, एक एकल चक्र का उपयोग करके, कम्प्यूटेशनल रूप से कुशल होते हुए इस पूर्वाग्रह को प्राप्त करती है।
हालांकि, सैद्धांतिक समझ अधूरी है। नीति मुख्य रूप से अनुभवजन्य है, और इसकी प्रभावशीलता आर्किटेक्चर और डेटासेट के बीच भिन्न हो सकती है। कुछ अध्ययनों ने सुझाव दिया है कि लाभ छोटे मॉडल और डेटासेट के लिए अधिक स्पष्ट हैं, जबकि बहुत बड़े मॉडलों के लिए, लाभ मामूली हो सकते हैं। 2020 के दशक की शुरुआत तक, वन-साइकिल नीति एक अनुमानी बनी हुई है जो व्यवहार में अच्छी तरह से काम करती है, लेकिन इसकी सैद्धांतिक नींव अभी भी अनुसंधान का एक सक्रिय क्षेत्र है।
व्यावहारिक सिफारिशें
चिकित्सकों के लिए, वन-साइकिल नीति को अपनाना अपेक्षाकृत आसान है। प्रमुख चरण हैं: (1) लर्निंग रेट फाइंडर का उपयोग करके अधिकतम लर्निंग रेट निर्धारित करें; (2) आधार लर्निंग रेट को अधिकतम के एक छोटे अंश (जैसे, 1/10वां) पर सेट करें; (3) एक वार्मअप अंश चुनें (आमतौर पर 20-30%); (4) क्षय आकार (रैखिक या कोसाइन) पर निर्णय लें; (5) अंतिम लर्निंग रेट को बहुत छोटे मान (जैसे, आधार का 1/100वां) पर सेट करें; और (6) मोमेंटम को व्युत्क्रम रूप से समायोजित करें। fastai और PyTorch के लर्निंग रेट शेड्यूलर सहित कई लाइब्रेरी, वन-साइकिल नीति के लिए अंतर्निहित समर्थन प्रदान करती हैं।
प्रशिक्षण प्रगति की निगरानी करना भी महत्वपूर्ण है। नीति मानती है कि कुल युगों की संख्या निश्चित है, इसलिए प्रारंभिक रोक सीधी नहीं हो सकती है। यदि मॉडल ओवरफिट होता है, तो Dropout या Weight Initialization समायोजन जैसी नियमितीकरण तकनीकों की आवश्यकता हो सकती है। नीति ऑप्टिमाइज़र की पसंद के प्रति भी संवेदनशील है; इसका उपयोग आमतौर पर मोमेंटम के साथ स्टोकेस्टिक ग्रेडिएंट डिसेंट (SGD) के साथ किया जाता है, लेकिन इसका उपयोग Adam (Optimizer) और अन्य Stochastic Gradient Descent Variants के साथ भी किया जा सकता है।
निष्कर्ष
वन-साइकिल नीति एक शक्तिशाली और व्यावहारिक लर्निंग रेट शेड्यूलिंग तकनीक है जो डीप लर्निंग में एक मानक उपकरण बन गई है। इसका सरल लेकिन प्रभावी डिज़ाइन, वार्मअप और एनीलिंग को व्युत्क्रम मोमेंटम समायोजन के साथ जोड़ता है, जो तेजी से अभिसरण और बेहतर सामान्यीकरण की अनुमति देता है। हालांकि इसकी सैद्धांतिक नींव पूरी तरह से समझी नहीं गई है, इसकी अनुभवजन्य सफलता ने इसे कई चिकित्सकों के लिए एक पसंदीदा विकल्प बना दिया है। जैसे-जैसे डीप लर्निंग विकसित होती रहती है, वन-साइकिल नीति एक प्रासंगिक और मूल्यवान तकनीक बनी हुई है, विशेष रूप से मध्यम आकार के डेटासेट पर मॉडल के प्रशिक्षण और बड़े भाषा मॉडल के फाइन-ट्यूनिंग के लिए।