RMSProp एक अनुकूली अधिगम दर अनुकूलन एल्गोरिथ्म है जिसका उपयोग आमतौर पर मशीन लर्निंग और डीप लर्निंग में तंत्रिका नेटवर्क को प्रशिक्षित करने के लिए किया जाता है। यह प्रत्येक पैरामीटर के लिए अधिगम दर को व्यक्तिगत रूप से समायोजित करता है, जिसमें ग्रेडिएंट अपडेट को हाल के ग्रेडिएंट परिमाणों के मूल माध्य वर्ग द्वारा विभाजित किया जाता है, जो प्रशिक्षण को स्थिर करने और अभिसरण को तेज करने में मदद करता है, विशेष रूप से गैर-स्थिर उद्देश्यों और विरल डेटा के लिए।
इस विधि को जेफ्री हिंटन ने 2012 में कौरसेरा पाठ्यक्रम "न्यूरल नेटवर्क्स फॉर मशीन लर्निंग" के लिए अपने व्याख्यान नोट्स में पेश किया था, हालांकि इसे कभी औपचारिक रूप से सहकर्मी-समीक्षा नहीं किया गया। इसे rprop और AdaGrad में सुधार के रूप में विकसित किया गया था, जो बाद वाले की नीरस रूप से घटती अधिगम दरों की समस्या को संबोधित करता है। तब से RMSProp कई डीप लर्निंग फ्रेमवर्क में एक मानक अनुकूलक बन गया है और बड़े भाषा मॉडल और अन्य जनरेटिव एआई प्रणालियों जैसे मॉडलों को प्रशिक्षित करने में व्यापक रूप से उपयोग किया जाता है।
पृष्ठभूमि: स्टोकेस्टिक ग्रेडिएंट डिसेंट
RMSProp स्टोकेस्टिक ग्रेडिएंट डिसेंट (SGD) की नींव पर आधारित है, जो एक उद्देश्य फलन को अनुकूलित करने के लिए एक पुनरावृत्त विधि है। मशीन लर्निंग में, लक्ष्य अक्सर Q(w) = (1/n) Σ Q_i(w) के रूप के अनुभवजन्य जोखिम फलन को न्यूनतम करना होता है, जहां प्रत्येक Q_i i-वें प्रशिक्षण उदाहरण के लिए हानि है। मानक ग्रेडिएंट डिसेंट पूरे डेटासेट पर ग्रेडिएंट की गणना करता है, जो बड़े डेटासेट के लिए कम्प्यूटेशनल रूप से महंगा है। इसके बजाय SGD प्रत्येक चरण पर यादृच्छिक रूप से चयनित उपसमुच्चय (या एकल नमूना) का उपयोग करके ग्रेडिएंट का अनुमान लगाता है, जिससे तेज़ पुनरावृत्तियाँ होती हैं लेकिन शोर वाले अपडेट की कीमत पर।
स्टोकेस्टिक सन्निकटन का विचार 1950 के दशक के रॉबिन्स-मोनरो एल्गोरिथ्म से जुड़ा है। आधुनिक अभ्यास में, SGD और इसके प्रकार बड़े पैमाने के मॉडलों को प्रशिक्षित करने के लिए आवश्यक हैं, क्योंकि वे पूर्ण ग्रेडिएंट्स का मूल्यांकन करने की कम्प्यूटेशनल बोझ को कम करते हैं। हालांकि, निश्चित अधिगम दर वाला SGD अधिगम दर की पसंद के प्रति संवेदनशील हो सकता है और धीरे-धीरे अभिसरण या दोलन कर सकता है।
अनुकूली अधिगम दरों की आवश्यकता
SGD में, अधिगम दर η चरण आकार को नियंत्रित करती है। एकल वैश्विक अधिगम दर चुनना चुनौतीपूर्ण है क्योंकि विभिन्न पैरामीटरों को अलग-अलग चरण आकारों की आवश्यकता हो सकती है, विशेष रूप से गहरे नेटवर्क में जहां ग्रेडिएंट पैमाने भिन्न होते हैं। बड़ी अधिगम दर विचलन का कारण बन सकती है, जबकि छोटी अधिगम दर धीमी अभिसरण की ओर ले जाती है। अनुकूली विधियाँ ऐतिहासिक ग्रेडिएंट जानकारी के आधार पर प्रति-पैरामीटर अधिगम दर बनाए रखकर इस समस्या का समाधान करती हैं।
प्रारंभिक अनुकूली विधियों में AdaGrad शामिल है, जो वर्गित ग्रेडिएंट्स के योग के व्युत्क्रम वर्गमूल द्वारा अधिगम दरों को स्केल करता है। हालांकि, Adagrad का वर्गित ग्रेडिएंट्स का संचय नीरस रूप से बढ़ता है, जिससे अधिगम दर समय के साथ शून्य हो जाती है, जो डीप लर्निंग में इसके उपयोग को सीमित करता है। RMSProp वर्गित ग्रेडिएंट्स के चल औसत का उपयोग करके इसे संशोधित करता है, जिससे अधिगम दर बहुत छोटी होने से बचती है।
RMSProp एल्गोरिथ्म
RMSProp प्रत्येक पैरामीटर के लिए वर्गित ग्रेडिएंट्स का चल औसत बनाए रखता है। प्रत्येक पुनरावृत्ति t पर, पैरामीटर w के लिए, एल्गोरिथ्म ग्रेडिएंट g_t (मिनी-बैच से) की गणना करता है और औसत को इस प्रकार अपडेट करता है:
v_t = β v_{t-1} + (1 - β) g_t^2
जहां β एक क्षय दर है, आमतौर पर 0.9 पर सेट किया जाता है। पैरामीटर अपडेट तब होता है:
w_{t+1} = w_t - (η / sqrt(v_t + ε)) * g_t
जहां η वैश्विक अधिगम दर है (अक्सर 0.001) और ε एक छोटा स्थिरांक है (जैसे, 1e-8) जो शून्य से विभाजन से बचने के लिए है। sqrt(v_t) शब्द हाल के ग्रेडिएंट्स का मूल माध्य वर्ग है, इसलिए नाम RMSProp है।
क्षय दर β नियंत्रित करती है कि कितना इतिहास माना जाता है; छोटा β हाल के ग्रेडिएंट्स को अधिक भार देता है, जिससे विधि हानि परिदृश्य में परिवर्तनों के प्रति अधिक अनुकूली हो जाती है। यह विशेष रूप से गैर-स्थिर उद्देश्यों के लिए उपयोगी है, जैसे कि आवर्ती तंत्रिका नेटवर्क और ऑनलाइन लर्निंग में सामने आते हैं।
प्रकार और विस्तार
RMSProp ने कई प्रकारों को प्रेरित किया है। सबसे उल्लेखनीय adam है, जो RMSProp को ग्रेडिएंट्स के चल औसत (पहला क्षण) और वर्गित ग्रेडिएंट्स के चल औसत (दूसरा क्षण) दोनों बनाए रखकर संवेग के साथ जोड़ता है। Adam अपनी मजबूती और तेज़ अभिसरण के कारण कई डीप लर्निंग अनुप्रयोगों में डिफ़ॉल्ट अनुकूलक बन गया है। अन्य प्रकारों में AdaDelta शामिल है, जो RMSProp के समान है लेकिन एक अलग अपडेट नियम का उपयोग करता है, और Nadam, जो नेस्टरोव संवेग को शामिल करता है।
व्यवहार में, RMSProp अक्सर मिनी-बैच प्रशिक्षण के साथ उपयोग किया जाता है, जहां ग्रेडिएंट्स डेटा के छोटे उपसमुच्चय पर गणना किए जाते हैं। यह बैच सामान्यीकरण और प्रशिक्षण को स्थिर करने वाली अन्य तकनीकों के साथ भी अच्छी तरह से काम करता है। कई डीप लर्निंग फ्रेमवर्क, जैसे TensorFlow और PyTorch, RMSProp के अंतर्निहित कार्यान्वयन प्रदान करते हैं, जिससे यह चिकित्सकों के लिए सुलभ हो जाता है।
डीप लर्निंग में अनुप्रयोग
RMSProp का व्यापक रूप से गहरे तंत्रिका नेटवर्कों को प्रशिक्षित करने में उपयोग किया गया है, जिसमें छवि पहचान के लिए संवेगी नेटवर्क और अनुक्रम मॉडलिंग के लिए आवर्ती नेटवर्क शामिल हैं। यह विरल ग्रेडिएंट्स वाले मॉडलों को प्रशिक्षित करने के लिए विशेष रूप से प्रभावी है, जैसे कि प्राकृतिक भाषा प्रसंस्करण में उपयोग किए जाने वाले। उदाहरण के लिए, RMSProp का उपयोग ट्रांसफॉर्मर के प्रारंभिक संस्करणों और डीप क्यू-नेटवर्क जैसे सुदृढीकरण लर्निंग एल्गोरिथ्मों को प्रशिक्षित करने में किया गया है।
बड़े भाषा मॉडल के संदर्भ में, RMSProp और Adam जैसे अनुकूली अनुकूलक उच्च-आयामी पैरामीटर स्थानों और भिन्न ग्रेडिएंट पैमानों को संभालने के लिए महत्वपूर्ण हैं। ओपनएआई, एंथ्रोपिक, और गूगल डीपमाइंड जैसी कंपनियां विशाल डेटासेट पर मॉडलों को प्रशिक्षित करने के लिए ऐसे अनुकूलकों पर निर्भर करती हैं, अक्सर अमेज़न वेब सर्विसेज और गूगल क्लाउड जैसे प्रदाताओं से वितरित कंप्यूटिंग बुनियादी ढांचे का उपयोग करती हैं।
अन्य अनुकूलकों के साथ तुलना
RMSProp संवेग-आधारित विधियों जैसे SGD संवेग के साथ भिन्न है, जो अपडेट को सुचारू करने के लिए एक वेग वेक्टर जमा करते हैं। जबकि संवेग स्थानीय न्यूनतम से बचने और सुसंगत दिशाओं में तेजी लाने में मदद करता है, RMSProp प्रति पैरामीटर चरण आकार को सामान्य करता है, जो तब अधिक स्थिर हो सकता है जब ग्रेडिएंट्स के अलग-अलग पैमाने हों। Adagrad की तुलना में, RMSProp का चल औसत अधिगम दर को बहुत आक्रामक रूप से क्षय होने से रोकता है, जिससे यह लंबे प्रशिक्षण रनों के लिए अधिक उपयुक्त होता है।
हालांकि, RMSProp कभी-कभी β और η की पसंद के प्रति संवेदनशील हो सकता है। व्यवहार में, डिफ़ॉल्ट β 0.9 और η 0.001 कई समस्याओं के लिए अच्छी तरह से काम करते हैं। कुछ कार्यों के लिए, Adam का पूर्वाग्रह सुधार और संवेग तेज़ अभिसरण की ओर ले जा सकता है, लेकिन RMSProp एक ठोस विकल्प बना हुआ है, विशेष रूप से जब मेमोरी चिंता का विषय हो, क्योंकि यह प्रति पैरामीटर केवल एक अतिरिक्त चर संग्रहीत करता है।
व्यावहारिक विचार
RMSProp का उपयोग करते समय, हानि वक्र की निगरानी करना और आवश्यकता होने पर हाइपरपैरामीटर समायोजित करना महत्वपूर्ण है। बहुत अधिक अधिगम दर विचलन का कारण बन सकती है, जबकि बहुत कम अभिसरण को धीमा कर सकती है। ε शब्द आमतौर पर संख्यात्मक समस्याओं से बचने के लिए एक छोटे मान पर सेट किया जाता है। विरल डेटा के लिए, RMSProp को विस्फोटक ग्रेडिएंट्स से बचने के लिए ग्रेडिएंट क्लिपिंग के साथ जोड़ा जा सकता है, जो आवर्ती नेटवर्क में एक सामान्य समस्या है।
RMSProp अधिगम दर अनुसूचियों के साथ भी संगत है, जहां वैश्विक अधिगम दर समय के साथ कम हो जाती है। यह प्रशिक्षण के बाद के चरणों में मॉडल को ठीक करने में मदद कर सकता है। कई चिकित्सक RMSProp को आधार रेखा के रूप में उपयोग करते हैं और अपने विशिष्ट कार्य के लिए सर्वश्रेष्ठ चुनने के लिए इसे Adam या अन्य अनुकूलकों के साथ तुलना करते हैं।
निष्कर्ष
RMSProp एक मौलिक अनुकूली अधिगम दर विधि है जिसने डीप लर्निंग के क्षेत्र को महत्वपूर्ण रूप से प्रभावित किया है। पिछले ग्रेडिएंट्स के मूल माध्य वर्ग का उपयोग करके, यह तंत्रिका नेटवर्कों को प्रशिक्षित करने का एक स्थिर और कुशल तरीका प्रदान करता है, विशेष रूप से गैर-स्थिर उद्देश्यों वाली समस्याओं पर। इसके विचारों को Adam जैसे अधिक उन्नत अनुकूलकों में शामिल किया गया है, लेकिन RMSProp मशीन लर्निंग चिकित्सकों के टूलकिट में एक मूल्यवान उपकरण बना हुआ है। जैसे-जैसे डीप लर्निंग विकसित होती रहती है, RMSProp जैसी अनुकूली अनुकूलन विधियाँ तेजी से जटिल मॉडलों को प्रशिक्षित करने के लिए आवश्यक रहने की संभावना है।