AMSGrad एक अनुकूलन एल्गोरिथ्म है जिसका उपयोग मशीन लर्निंग और डीप लर्निंग में तंत्रिका नेटवर्क को प्रशिक्षित करने के लिए किया जाता है। इसे 2018 में साशांक जे. रेड्डी, सत्येन काले, और संजीव कुमार द्वारा 'ऑन द कन्वर्जेंस ऑफ एडम एंड बियॉन्ड' शीर्षक वाले पेपर में प्रस्तावित किया गया था। AMSGrad लोकप्रिय एडम अनुकूलक का एक प्रकार है, जिसे पिछले ग्रेडिएंट्स को एकत्र करने के तरीके को संशोधित करके एडम में एक सैद्धांतिक अभिसरण समस्या को ठीक करने के लिए डिज़ाइन किया गया है। मुख्य परिवर्तन यह है कि AMSGrad एक घातांकीय चलती औसत के बजाय पिछले वर्गित ग्रेडिएंट्स का एक चलता हुआ अधिकतम रखता है, जो सुनिश्चित करता है कि प्रभावी सीखने की दर समय के साथ न बढ़े। यह समायोजन कुछ स्थितियों में एल्गोरिथ्म की अभिसरण गारंटी में सुधार करता है, विशेष रूप से उत्तल और गैर-उत्तल अनुकूलन समस्याओं के लिए। AMSGrad को अनुसंधान और व्यवहार में व्यापक रूप से अपनाया गया है, हालांकि एडम पर इसके व्यावहारिक लाभ अक्सर मामूली और समस्या-निर्भर होते हैं।
एल्गोरिथ्म प्रत्येक पैरामीटर के लिए दो स्थिति चर बनाए रखता है: एक पहला क्षण अनुमान (ग्रेडिएंट्स का माध्य) और एक दूसरा क्षण अनुमान (वर्गित ग्रेडिएंट्स का अधिकतम)। प्रत्येक पुनरावृत्ति पर, पहले क्षण को एडम के समान ग्रेडिएंट के घातांकीय चलती औसत के रूप में अद्यतन किया जाता है। दूसरे क्षण को वर्तमान वर्गित ग्रेडिएंट और पिछले दूसरे क्षण अनुमान के तत्व-वार अधिकतम लेकर अद्यतन किया जाता है। पैरामीटर अद्यतन तब पहले क्षण को दूसरे क्षण के वर्गमूल से विभाजित करता है, संख्यात्मक स्थिरता के लिए एक छोटे एप्सिलॉन शब्द के साथ। यह डिज़ाइन दूसरे क्षण को घटने से रोकता है, जो बदले में सीखने की दर को बढ़ने से रोकता है, एक व्यवहार जो एडम में तब हो सकता है जब ग्रेडिएंट परिमाण सिकुड़ता है।
AMSGrad की प्रेरणा एक प्रतिउदाहरण से उत्पन्न हुई जो दिखाता है कि एडम कुछ सरल उत्तल समस्याओं में इष्टतम समाधान में परिवर्तित होने में विफल हो सकता है। रेड्डी, काले, और कुमार ने प्रदर्शित किया कि एडम में वर्गित ग्रेडिएंट्स की घातांकीय चलती औसत प्रभावी सीखने की दर को बहुत बड़ा कर सकती है, जिससे दोलन और विचलन हो सकता है। अधिकतम का उपयोग करके, AMSGrad एक नीरस रूप से गैर-बढ़ती सीखने की दर सुनिश्चित करता है, जो अभिसरण गारंटी को बहाल करता है। पेपर ने AMSGrad के लिए पछतावा सीमाएं भी प्रदान कीं, यह दिखाते हुए कि यह स्टोकेस्टिक सेटिंग्स में एडम के समान क्रम का पछतावा प्राप्त करता है।
पृष्ठभूमि और एडम अनुकूलक
एडम (अनुकूली क्षण अनुमान) को 2014 में डीडेरिक किंगमा और जिमी बा द्वारा पेश किया गया था और यह डीप लर्निंग में सबसे व्यापक रूप से उपयोग किए जाने वाले अनुकूलकों में से एक बन गया है। एडम स्टोकेस्टिक ग्रेडिएंट डिसेंट के दो अन्य विस्तारों के फायदों को जोड़ता है: एडाग्रैड, जो वर्गित ग्रेडिएंट्स के योग के आधार पर प्रति पैरामीटर सीखने की दरों को अनुकूलित करता है, और RMSProp, जो वर्गित ग्रेडिएंट्स की घातांकीय चलती औसत का उपयोग करता है। एडम ग्रेडिएंट्स के पहले क्षण (माध्य) और दूसरे क्षण (विचरण) दोनों को बनाए रखता है, और प्रारंभिक शून्य आरंभीकरण के लिए पूर्वाग्रह सुधार लागू करता है। एल्गोरिथ्म हाइपरपैरामीटर विकल्पों के प्रति अपनी मजबूती और विरल ग्रेडिएंट्स और शोर डेटा को संभालने की क्षमता के लिए जाना जाता है।
हालांकि, 2018 में, रेड्डी, काले, और कुमार ने एडम के अभिसरण प्रमाण में एक दोष की पहचान की। उन्होंने एक सरल उत्तल अनुकूलन समस्या का निर्माण किया जहां एडम स्थिर सीखने की दर के साथ भी वैश्विक इष्टतम में परिवर्तित होने में विफल रहता है। समस्या इस तथ्य से उत्पन्न होती है कि एडम का दूसरा क्षण अनुमान समय के साथ घट सकता है, जिससे प्रभावी चरण आकार बढ़ सकता है, संभावित रूप से ओवरशूटिंग हो सकती है। इस सैद्धांतिक प्रतिउदाहरण ने AMSGrad के विकास को प्रेरित किया।
AMSGrad एल्गोरिथ्म
AMSGrad एल्गोरिथ्म औपचारिक रूप से निम्नानुसार परिभाषित है। मान लें \(\theta_t\) पुनरावृत्ति \(t\) पर पैरामीटर वेक्टर को दर्शाता है, और \(g_t\) \(\theta_t\) के संबंध में हानि फ़ंक्शन का ग्रेडिएंट है। एल्गोरिथ्म हाइपरपैरामीटर \(\alpha\) (सीखने की दर), \(\beta_1\), \(\beta_2\) (पहले और दूसरे क्षणों के लिए घातांकीय क्षय दर), और \(\epsilon\) (संख्यात्मक स्थिरता के लिए एक छोटा स्थिरांक) का उपयोग करता है। अद्यतन नियम हैं:
- ग्रेडिएंट \(g_t\) की गणना करें।
- पहले क्षण अनुमान को अद्यतन करें: \(m_t = \beta_1 m_{t-1} + (1 - \beta_1) g_t\)।
- अधिकतम का उपयोग करके दूसरे क्षण अनुमान को अद्यतन करें: \(v_t = \max(v_{t-1}, \beta_2 v_{t-1} + (1 - \beta_2) g_t^2)\)।
- पूर्वाग्रह-सुधारित पहले क्षण की गणना करें: \(\hat{m}_t = m_t / (1 - \beta_1^t)\)।
- पैरामीटर अद्यतन करें: \(\theta_{t+1} = \theta_t - \alpha \hat{m}_t / (\sqrt{v_t} + \epsilon)\)।
एडम से मुख्य अंतर चरण 3 में है, जहां एडम \(v_t = \beta_2 v_{t-1} + (1 - \beta_2) g_t^2\) (एक घातांकीय चलती औसत) का उपयोग करता है, जबकि AMSGrad पिछले \(v_{t-1}\) और वर्तमान चलती औसत का तत्व-वार अधिकतम लेता है। यह सुनिश्चित करता है कि \(v_t\) गैर-घटता है, इसलिए प्रभावी सीखने की दर \(\alpha / (\sqrt{v_t} + \epsilon)\) गैर-बढ़ती है।
सैद्धांतिक गुण
AMSGrad को एडम की तुलना में मजबूत अभिसरण गारंटी प्रदान करने के लिए डिज़ाइन किया गया था। पेपर ने साबित किया कि AMSGrad उत्तल अनुकूलन के लिए \(O(\sqrt{T})\) की पछतावा सीमा प्राप्त करता है, जो ऑनलाइन सीखने के लिए इष्टतम है। इसके विपरीत, एडम को कुछ मामलों में बदतर पछतावा सीमा दिखाई गई थी। गैर-उत्तल समस्याओं के लिए, AMSGrad मानक धारणाओं के तहत एक स्थिर बिंदु पर अभिसरण भी प्रदान करता है। अधिकतम का उपयोग यह सुनिश्चित करता है कि एल्गोरिथ्म एक नीरस रूप से घटते चरण आकार को बनाए रखता है, जो स्टोकेस्टिक अनुकूलन में अभिसरण प्रमाणों में एक सामान्य आवश्यकता है।
हालांकि, कुछ शोधकर्ताओं ने नोट किया है कि AMSGrad के सैद्धांतिक लाभ हमेशा बेहतर व्यावहारिक प्रदर्शन में अनुवादित नहीं होते हैं। कई डीप लर्निंग कार्यों में, एडम और AMSGrad समान रूप से प्रदर्शन करते हैं, और कभी-कभी एडम AMSGrad से बेहतर प्रदर्शन कर सकता है। दोनों के बीच का चुनाव अक्सर विशिष्ट समस्या और हाइपरपैरामीटर ट्यूनिंग पर निर्भर करता है।
व्यावहारिक उपयोग और प्रभाव
AMSGrad को प्रमुख डीप लर्निंग फ्रेमवर्क में लागू किया गया है, जिसमें TensorFlow, PyTorch, और Keras शामिल हैं, अक्सर एडम अनुकूलक के भीतर एक विकल्प के रूप में (उदाहरण के लिए, PyTorch में amsgrad=True)। इसका उपयोग विभिन्न मॉडलों को प्रशिक्षित करने में किया जाता है, ResNet से ट्रांसफार्मर तक, हालांकि यह एडम या मोमेंटम के साथ SGD की तुलना में डिफ़ॉल्ट विकल्प होने की संभावना कम है। व्यवहार में, AMSGrad अक्सर तब आजमाया जाता है जब एडम अस्थिर प्रशिक्षण प्रदर्शित करता है या जब अभिसरण समस्याओं का संदेह होता है।
अनुसंधान ने दिखाया है कि AMSGrad कुछ परिदृश्यों में फायदेमंद हो सकता है, जैसे विरल ग्रेडिएंट्स के साथ प्रशिक्षण या जब हानि परिदृश्य में तेज न्यूनतम होते हैं। हालांकि, लुकास एट अल. द्वारा 2019 का एक अध्ययन पाया गया कि AMSGrad विभिन्न कार्यों में एडम से लगातार बेहतर प्रदर्शन नहीं करता है, और इसके लाभ सीमित हैं। फिर भी, AMSGrad SGD विविधताओं के परिवार में एक महत्वपूर्ण योगदान बना हुआ है और इसने अनुकूली अनुकूलन विधियों में आगे के अनुसंधान को प्रेरित किया है।
अन्य अनुकूलकों से संबंध
AMSGrad अनुकूली सीखने की दर विधियों के व्यापक परिवार का हिस्सा है जिसमें AdaGrad, RMSProp, और एडम शामिल हैं। यह बाद के विकासों जैसे AdamW से भी संबंधित है, जो वजन क्षय को अनुकूली सीखने की दर से अलग करता है, और Nadam, जो नेस्टरोव मोमेंटम को शामिल करता है। पिछले ग्रेडिएंट्स के अधिकतम का उपयोग करने का विचार अन्य संदर्भों में भी खोजा गया है, जैसे RAdam अनुकूलक में, जो अनुकूली सीखने की दर के विचरण को ठीक करता है। AMSGrad का गैर-बढ़ती सीखने की दर सुनिश्चित करने पर ध्यान अधिक स्थिर अनुकूलकों के डिजाइन को प्रभावित किया है।
आलोचनाएं और सीमाएं
अपनी सैद्धांतिक अपील के बावजूद, AMSGrad को आलोचना का सामना करना पड़ा है। कुछ शोधकर्ताओं का तर्क है कि AMSGrad को प्रेरित करने के लिए उपयोग किया जाने वाला प्रतिउदाहरण कृत्रिम है और वास्तविक दुनिया की अनुकूलन समस्याओं को प्रतिबिंबित नहीं करता है। दूसरों ने बताया है कि अधिकतम ऑपरेशन एल्गोरिथ्म को प्रारंभिक ग्रेडिएंट्स के प्रति अधिक संवेदनशील बना सकता है और अत्यधिक रूढ़िवादी अद्यतनों को जन्म दे सकता है, जिससे अभिसरण धीमा हो सकता है। इसके अतिरिक्त, अधिकतम बनाए रखने का मेमोरी और कम्प्यूटेशनल ओवरहेड नगण्य है, लेकिन व्यावहारिक लाभ अक्सर मामूली होते हैं।
एक उल्लेखनीय आलोचना चेन और गु द्वारा 2019 के एक पेपर से आई, जिसने दिखाया कि AMSGrad की अभिसरण गारंटी हाइपरपैरामीटर की एक विशिष्ट पसंद पर निर्भर करती है और व्यवहार में, एल्गोरिथ्म कुछ गैर-उत्तल सेटिंग्स में अभी भी परिवर्तित होने में विफल हो सकता है। इसने एडम और AMSGrad की ताकत को संयोजित करने वाले अनुकूली अनुकूलकों में चल रहे अनुसंधान को जन्म दिया है।
विरासत और प्रभाव
AMSGrad का डीप लर्निंग के लिए अनुकूलन के क्षेत्र पर स्थायी प्रभाव पड़ा है। इसने अनुकूलक व्यवहार को समझने में सैद्धांतिक विश्लेषण के महत्व को उजागर किया और अनुकूली विधियों के अभिसरण गुणों में अनुसंधान की एक लहर को प्रेरित किया। एल्गोरिथ्म अक्सर उन पेपरों में उद्धृत किया जाता है जो नए अनुकूलक प्रस्तावित करते हैं, और यह अनुकूलन अनुसंधान में एक मानक आधार रेखा बना हुआ है। हालांकि यह अधिकांश अनुप्रयोगों में डिफ़ॉल्ट विकल्प नहीं हो सकता है, AMSGrad अनुकूलक टूलबॉक्स में एक मूल्यवान उपकरण है, विशेष रूप से शोधकर्ताओं और चिकित्सकों के लिए जो एडम के साथ अभिसरण समस्याओं का सामना करते हैं।
यह भी देखें
- Adam (Optimizer)
- Stochastic Gradient Descent Variants
- Learning Rate Scheduling
- Gradient Clipping
- Deep learning
संदर्भ
- रेड्डी, एस. जे., काले, एस., और कुमार, एस. (2018)। ऑन द कन्वर्जेंस ऑफ एडम एंड बियॉन्ड। इंटरनेशनल कॉन्फ्रेंस ऑन लर्निंग रिप्रेजेंटेशन (ICLR)।
- किंगमा, डी. पी., और बा, जे. (2015)। एडम: ए मेथड फॉर स्टोकेस्टिक ऑप्टिमाइजेशन। ICLR।
- लोशचिलोव, आई., और हटर, एफ. (2019)। डिकपल्ड वेट डेके रेगुलराइजेशन। ICLR।
- लुकास, जे., एट अल. (2019)। ऑन द कन्वर्जेंस ऑफ एडम एंड बियॉन्ड: ए क्लोजर लुक। arXiv प्रीप्रिंट।
नोट: संदर्भ पूर्णता के लिए प्रदान किए गए हैं, लेकिन लेख में दिशानिर्देशों के अनुसार बाहरी लिंक शामिल नहीं हैं।