AdamW एक अनुकूलन एल्गोरिदम है जिसका उपयोग मशीन लर्निंग और डीप लर्निंग में तंत्रिका नेटवर्क को प्रशिक्षित करने के लिए किया जाता है। यह Adam अनुकूलक का एक प्रकार है जो वेट डेके (weight decay) को अनुकूली सीखने की दर अपडेट से अलग करता है। यह एल्गोरिदम 2017 में इल्या लोशचिलोव और फ्रैंक हटर द्वारा प्रस्तुत किया गया था, और यह बड़े मॉडलों को प्रशिक्षित करने के लिए एक मानक विकल्प बन गया है, जिसमें ट्रांसफॉर्मर और बड़े भाषा मॉडल शामिल हैं। वेट डेके को ग्रेडिएंट-आधारित पैरामीटर अपडेट से अलग करके, AdamW मूल Adam अनुकूलक में एक ज्ञात समस्या को संबोधित करता है, जहां वेट डेके को इस तरह लागू किया गया था जो अनुकूली सीखने की दरों में हस्तक्षेप करता था, जिससे उप-इष्टतम अभिसरण और सामान्यीकरण होता था।
AdamW के लिए प्राथमिक प्रेरणा इस अवलोकन से आई कि Adam में, L2 नियमितीकरण पद (जिसे अक्सर वेट डेके के रूप में उपयोग किया जाता है) को वर्ग ग्रेडिएंट्स के घातीय चल औसत के वर्गमूल से विभाजित किया जाता है। यह युग्मन प्रभावी वेट डेके को पैरामीटरों के बीच और समय के साथ भिन्न बनाता है, जो अनुकूलन में बाधा उत्पन्न कर सकता है। AdamW एक सरल समाधान प्रस्तावित करता है: ग्रेडिएंट अपडेट के बाद वेट डेके को सीधे पैरामीटरों पर लागू करें, जो अनुकूली सीखने की दर स्केलिंग से स्वतंत्र हो। यह पृथक्करण विभिन्न कार्यों पर प्रशिक्षण प्रदर्शन में सुधार करने के लिए दिखाया गया है, जिसमें छवि वर्गीकरण और भाषा मॉडलिंग शामिल हैं।
पृष्ठभूमि: मशीन लर्निंग में अनुकूलन
तंत्रिका नेटवर्क को प्रशिक्षित करने में एक हानि फलन को न्यूनतम करना शामिल है, आमतौर पर स्टोकेस्टिक ग्रेडिएंट डिसेंट (SGD) के प्रकारों का उपयोग करके। SGD में, मॉडल पैरामीटरों को प्रशिक्षण डेटा के एक यादृच्छिक उपसमुच्चय पर गणना की गई हानि के नकारात्मक ग्रेडिएंट की दिशा में आगे बढ़ाकर पुनरावृत्त रूप से अपडेट किया जाता है। चरण आकार, या सीखने की दर, नियंत्रित करती है कि प्रत्येक अपडेट कितना बड़ा है। वर्षों से, अभिसरण को तेज करने और अंतिम प्रदर्शन में सुधार करने के लिए कई सुधार प्रस्तावित किए गए हैं, जैसे कि संवेग (momentum), अनुकूली सीखने की दरें, और वेट डेके।
वेट डेके एक नियमितीकरण तकनीक है जो हानि फलन में वर्ग भारों के योग के अनुपात में एक पद जोड़कर बड़े पैरामीटर मानों को दंडित करती है। मानक SGD में, वेट डेके L2 नियमितीकरण के बराबर है, लेकिन यह समानता Adam जैसे अनुकूली तरीकों में टूट जाती है। AdamW को अनुकूली अनुकूलकों में वेट डेके के इच्छित व्यवहार को बहाल करने के लिए डिज़ाइन किया गया था।
Adam अनुकूलक
Adam (Adaptive Moment Estimation) 2014 में डीडेरिक किंगमा और जिमी बा द्वारा प्रस्तुत किया गया था। यह पिछले ग्रेडिएंट्स (पहला क्षण) और पिछले वर्ग ग्रेडिएंट्स (दूसरा क्षण) का एक घातीय क्षयकारी औसत रखकर प्रति-पैरामीटर सीखने की दरें बनाए रखता है। Adam के लिए अपडेट नियम है:
\[ \theta_{t+1} = \theta_t - \eta \frac{\hat{m}_t}{\sqrt{\hat{v}_t} + \epsilon} \]
जहां \(\hat{m}_t\) और \(\hat{v}_t\) पहले और दूसरे क्षणों के पूर्वाग्रह-सुधारित अनुमान हैं, \(\eta\) सीखने की दर है, और \(\epsilon\) संख्यात्मक स्थिरता के लिए एक छोटा स्थिरांक है। Adam अपने हाइपरपैरामीटरों के प्रति मजबूती और तेज अभिसरण के कारण लोकप्रिय हो गया, विशेष रूप से गहरे नेटवर्क को प्रशिक्षित करने के लिए।
हालांकि, मूल Adam कार्यान्वयन में, वेट डेके को L2 नियमितीकरण के रूप में लागू किया गया था, जो हानि में एक पद \(\frac{\lambda}{2} \|\theta\|^2\) जोड़ता है। यह पद फिर ग्रेडिएंट में शामिल होता है, और क्योंकि Adam ग्रेडिएंट को दूसरे क्षण से सामान्यीकृत करता है, प्रभावी वेट डेके \(\lambda / \sqrt{\hat{v}_t}\) बन जाता है। इसका मतलब है कि बड़े ग्रेडिएंट वाले पैरामीटरों को कम नियमितीकरण मिलता है, जो अति-अनुकूलन और खराब सामान्यीकरण का कारण बन सकता है।
AdamW एल्गोरिदम
AdamW अपडेट नियम को संशोधित करता है, L2 नियमितीकरण पद को ग्रेडिएंट से हटाकर और इसके बजाय अनुकूली अपडेट के बाद वेट डेके को सीधे पैरामीटरों पर लागू करता है। अपडेट नियम बन जाता है:
\[ \theta_{t+1} = \theta_t - \eta \frac{\hat{m}_t}{\sqrt{\hat{v}_t} + \epsilon} - \eta \lambda \theta_t \]
जहां \(\lambda\) वेट डेके गुणांक है। यह पृथक्करण सुनिश्चित करता है कि वेट डेके सभी पैरामीटरों पर समान रूप से लागू हो, चाहे उनके ग्रेडिएंट परिमाण कुछ भी हों। लेखकों ने तर्क दिया कि यह बेहतर सामान्यीकरण और अधिक स्थिर प्रशिक्षण की ओर ले जाता है, विशेष रूप से बड़ी सीखने की दरों का उपयोग करते समय।
अपने पेपर में, लोशचिलोव और हटर ने प्रदर्शित किया कि AdamW कई बेंचमार्क कार्यों पर L2 नियमितीकरण के साथ Adam से बेहतर प्रदर्शन करता है, जिसमें CIFAR-10 पर छवि वर्गीकरण और Penn Treebank पर भाषा मॉडलिंग शामिल है। उन्होंने यह भी दिखाया कि AdamW सीखने की दर और वेट डेके हाइपरपैरामीटरों की पसंद के प्रति अधिक मजबूत है।
डीप लर्निंग पर प्रभाव
AdamW का कृत्रिम बुद्धिमत्ता के क्षेत्र पर महत्वपूर्ण प्रभाव पड़ा है। यह अब PyTorch और TensorFlow जैसे कई लोकप्रिय डीप लर्निंग फ्रेमवर्क में डिफ़ॉल्ट अनुकूलक है, और ट्रांसफॉर्मर और बड़े भाषा मॉडल को प्रशिक्षित करने में व्यापक रूप से उपयोग किया जाता है। उदाहरण के लिए, ओपनएआई, एंथ्रोपिक, और गूगल डीपमाइंड जैसे संगठनों द्वारा विकसित कई मॉडल अपने प्रशिक्षण पाइपलाइनों में AdamW का उपयोग करते हैं।
AdamW में पृथक वेट डेके विशेष रूप से बड़े पैमाने के मॉडलों को प्रशिक्षित करने के लिए फायदेमंद रहा है, जहां विशाल डेटासेट पर अति-अनुकूलन को रोकने के लिए नियमितीकरण महत्वपूर्ण है। यह भी दिखाया गया है कि यह संवेग के साथ SGD या L2 नियमितीकरण के साथ Adam जैसे अन्य अनुकूलकों की तुलना में अभिसरण गति और अंतिम प्रदर्शन में सुधार करता है।
अन्य अनुकूलकों के साथ तुलना
AdamW की तुलना अक्सर AdaGrad, RMSProp, और Adam जैसे अन्य अनुकूली अनुकूलकों से की जाती है। जबकि AdaGrad और RMSProp ऐतिहासिक ग्रेडिएंट्स के आधार पर सीखने की दरों को समायोजित करते हैं, Adam संवेग और अनुकूली सीखने की दरों दोनों को जोड़ता है। AdamW वेट डेके समस्या को ठीक करके Adam में सुधार करता है, जिससे यह कार्यों की एक विस्तृत श्रृंखला के लिए अधिक विश्वसनीय बन जाता है।
एक और संबंधित अनुकूलक संवेग के साथ SGD है, जो सरल है लेकिन अक्सर सीखने की दर अनुसूची के सावधानीपूर्वक ट्यूनिंग की आवश्यकता होती है। AdamW उपयोग में आसानी और प्रदर्शन के बीच एक अच्छा संतुलन प्रदान करता है, यही कारण है कि यह कई चिकित्सकों के लिए एक पसंदीदा विकल्प बन गया है। हालांकि, कुछ अध्ययनों ने दिखाया है कि संवेग के साथ SGD कुछ कार्यों पर बेहतर सामान्यीकरण प्राप्त कर सकता है यदि ठीक से ट्यून किया जाए, लेकिन AdamW प्रतिस्पर्धी बना रहता है और हाइपरपैरामीटर विकल्पों के प्रति अधिक मजबूत है।
व्यावहारिक विचार
AdamW का उपयोग करते समय, कुछ व्यावहारिक विचार हैं। वेट डेके गुणांक \(\lambda\) आमतौर पर एक छोटे मान पर सेट किया जाता है, जैसे 0.01 या 0.1, लेकिन विशिष्ट कार्यों के लिए इसे ट्यून करने की आवश्यकता हो सकती है। सीखने की दर अक्सर ट्रांसफॉर्मर को प्रशिक्षित करने के लिए 1e-4 या 3e-4 जैसे मान पर सेट की जाती है। इसके अतिरिक्त, AdamW अक्सर सीखने की दर वार्मअप अनुसूची से लाभान्वित होता है, जहां सीखने की दर पहले कुछ हज़ार चरणों में एक छोटे मान से धीरे-धीरे लक्ष्य मान तक बढ़ती है।
व्यवहार में, AdamW अधिकांश डीप लर्निंग लाइब्रेरीज़ में लागू किया जाता है, इसलिए उपयोगकर्ता केवल अनुकूलक निर्दिष्ट कर सकते हैं और वेट डेके पैरामीटर सेट कर सकते हैं। उदाहरण के लिए, PyTorch में, कोई torch.optim.AdamW(model.parameters(), lr=1e-4, weight_decay=0.01) का उपयोग कर सकता है। यह सरलता इसके व्यापक रूप से अपनाने में योगदान दी है।
विस्तार और प्रकार
AdamW के कई विस्तार और प्रकार प्रस्तावित किए गए हैं। उदाहरण के लिए, पृथक वेट डेके के साथ AdamW को Lookahead जैसी अन्य तकनीकों के साथ जोड़ा गया है, जो स्मूथ अपडेट के लिए धीमे पैरामीटरों का एक सेट बनाए रखता है। एक और प्रकार कोसाइन एनीलिंग सीखने की दर अनुसूचियों के साथ AdamW है, जिसे छवि वर्गीकरण कार्यों पर प्रदर्शन में सुधार करने के लिए दिखाया गया है।
बड़े भाषा मॉडलों के संदर्भ में, AdamW अक्सर बड़े बैच आकारों को संभालने के लिए मिश्रित परिशुद्धता प्रशिक्षण और ग्रेडिएंट संचय के साथ उपयोग किया जाता है। कुछ फ्रेमवर्क AdamW के फ्यूज्ड कार्यान्वयन भी प्रदान करते हैं जो मेमोरी उपयोग को कम करते हैं और कम्प्यूटेशनल दक्षता में सुधार करते हैं, जो अरबों पैरामीटरों वाले मॉडलों को प्रशिक्षित करते समय महत्वपूर्ण है।
निष्कर्ष
AdamW मशीन लर्निंग टूलकिट में एक मौलिक उपकरण बन गया है। वेट डेके को अनुकूली ग्रेडिएंट अपडेट से अलग करके, यह मूल Adam अनुकूलक में एक सूक्ष्म लेकिन महत्वपूर्ण दोष को संबोधित करता है, जिससे बेहतर सामान्यीकरण और अधिक स्थिर प्रशिक्षण होता है। इसकी सरलता और प्रभावशीलता ने इसे कई डीप लर्निंग अनुप्रयोगों के लिए डिफ़ॉल्ट विकल्प बना दिया है, छवि वर्गीकरण से लेकर प्राकृतिक भाषा प्रसंस्करण तक। जैसे-जैसे क्षेत्र विकसित होता रहता है, AdamW एक विश्वसनीय और व्यापक रूप से उपयोग किया जाने वाला अनुकूलन विधि बना हुआ है।
संदर्भ
- Loshchilov, I., & Hutter, F. (2017). Decoupled Weight Decay Regularization. arXiv:1711.05101.
- Kingma, D. P., & Ba, J. (2014). Adam: A Method for Stochastic Optimization. arXiv:1412.6980.