स्टोकास्टिक ग्रेडिएंट डिसेंट (SGD) एक पुनरावृत्तीय अनुकूलन विधि है जो डेटा के यादृच्छिक रूप से चयनित उपसमुच्चय का उपयोग करके ग्रेडिएंट का अनुमान लगाकर ग्रेडिएंट डिसेंट का अनुमान लगाती है। इसकी सीमाओं, जैसे धीमी अभिसरण और सीखने की दर के प्रति संवेदनशीलता, को संबोधित करने के लिए SGD के विभिन्न रूप विकसित किए गए हैं। इन रूपों में मोमेंटम, नेस्टरोव त्वरित ग्रेडिएंट, AdaGrad, RMSProp, और Adam जैसी आधुनिक अनुकूली विधियाँ शामिल हैं, जो Machine learning और Deep learning में मॉडलों को कुशलतापूर्वक प्रशिक्षित करने के लिए व्यापक रूप से उपयोग की जाती हैं।
SGD का मूल विचार 1950 के दशक के रॉबिंस-मोनरो एल्गोरिदम से जुड़ा है, जिसने मूल-खोज के लिए स्टोकास्टिक अनुमान पेश किया। मशीन लर्निंग में, SGD एक उद्देश्य फलन को न्यूनतम करता है जो आमतौर पर प्रति-उदाहरण हानि फलनों का योग होता है। मूल अद्यतन नियम \( w := w - \eta \nabla Q_i(w) \) है, जहाँ \( \eta \) सीखने की दर है और \( Q_i \) \( i \)-वें नमूने के लिए हानि है। हालांकि सरल, यह अद्यतन धीरे-धीरे अभिसरित हो सकता है और दोलन कर सकता है, विशेष रूप से हानि परिदृश्य की घाटियों में। विभिन्न रूप अद्यतन दिशा, सीखने की दर, या दोनों को संशोधित करके इन मुद्दों का समाधान करते हैं।
Momentum
मोमेंटम एक तकनीक है जो लगातार ग्रेडिएंट्स की दिशा में वेग वेक्टर जमा करके SGD को त्वरित करती है। 1964 में बोरिस पॉलियाक द्वारा पेश किया गया, मोमेंटम भौतिक जड़ता का अनुकरण करता है: चरण \( t \) पर अद्यतन \( v_t = \mu v_{t-1} - \eta \nabla Q_i(w_t) \) और \( w_{t+1} = w_t + v_t \) है, जहाँ \( \mu \) मोमेंटम गुणांक है (अक्सर 0.9)। यह अनुकूलक को सुसंगत दिशाओं में तेजी से आगे बढ़ने में मदद करता है और उच्च-वक्रता क्षेत्रों में दोलनों को कम करता है। मोमेंटम गहरे नेटवर्कों के प्रशिक्षण के लिए विशेष रूप से प्रभावी है, क्योंकि यह शोरग्रस्त ग्रेडिएंट अनुमानों को सुचारू करता है।
Nesterov Accelerated Gradient
नेस्टरोव त्वरित ग्रेडिएंट (NAG) एक रूप है जो एक आगे-देखने वाला चरण जोड़ता है। 1983 में यूरी नेस्टरोव द्वारा प्रस्तावित, NAG वर्तमान स्थिति के बजाय प्रक्षेपित स्थिति \( w_t + \mu v_{t-1} \) पर ग्रेडिएंट की गणना करता है। अद्यतन \( v_t = \mu v_{t-1} - \eta \nabla Q_i(w_t + \mu v_{t-1}) \) और \( w_{t+1} = w_t + v_t \) बन जाता है। यह सुधार अतिशूटिंग को कम करता है और भविष्य के ग्रेडिएंट का अधिक सटीक अनुमान प्रदान करता है, जिससे उत्तल सेटिंग्स में तेजी से अभिसरण होता है। NAG अक्सर तंत्रिका नेटवर्क के प्रशिक्षण में उपयोग किया जाता है और कई पुस्तकालयों में शामिल किया गया है।
AdaGrad
AdaGrad, जिसे 2011 में जॉन डुची, एलाद हज़ान और योरम सिंगर द्वारा पेश किया गया, वर्गित ग्रेडिएंट्स के ऐतिहासिक योग के आधार पर प्रति पैरामीटर सीखने की दर को अनुकूलित करता है। प्रत्येक पैरामीटर \( w_j \) के लिए, अद्यतन \( w_j := w_j - \frac{\eta}{\sqrt{G_{j,j} + \epsilon}} \nabla Q_i(w_j) \) है, जहाँ \( G_{j,j} \) वर्गित ग्रेडिएंट्स को जमा करता है और \( \epsilon \) संख्यात्मक स्थिरता के लिए एक छोटा स्थिरांक है। AdaGrad विरल डेटा के लिए अच्छा काम करता है, क्योंकि यह दुर्लभ विशेषताओं को बड़े अद्यतन देता है। हालांकि, वर्गित ग्रेडिएंट्स का संचय समय के साथ सीखने की दर को सिकोड़ने का कारण बनता है, जो प्रशिक्षण को समय से पहले रोक सकता है।
RMSProp
RMSProp, जिसे 2012 में जेफ्री हिंटन द्वारा अपने व्याख्यान नोट्स में प्रस्तावित किया गया, AdaGrad की घटती सीखने की दर को वर्गित ग्रेडिएंट्स के घातीय रूप से क्षय होने वाले औसत का उपयोग करके संबोधित करता है। अद्यतन एक गतिशील औसत \( E[g^2]_t = \rho E[g^2]_{t-1} + (1-\rho) g_t^2 \) बनाए रखता है, जहाँ \( \rho \) क्षय दर है (आमतौर पर 0.9)। पैरामीटर अद्यतन \( w := w - \frac{\eta}{\sqrt{E[g^2]_t + \epsilon}} g_t \) है। RMSProp गैर-उत्तल सेटिंग्स में प्रभावी है और आवर्ती नेटवर्कों और गहरे शिक्षण मॉडलों के प्रशिक्षण में व्यापक रूप से उपयोग किया गया है।
Adam
Adam (अनुकूली क्षण अनुमान), जिसे 2015 में डिडेरिक किंगमा और जिमी बा द्वारा पेश किया गया, मोमेंटम और RMSProp को जोड़ता है। यह ग्रेडिएंट्स के पहले क्षण (माध्य) और दूसरे क्षण (विचरण) दोनों को बनाए रखता है, जिसमें प्रारंभिक चरणों के लिए पूर्वाग्रह सुधार होता है। अद्यतन \( m_t = \beta_1 m_{t-1} + (1-\beta_1) g_t \), \( v_t = \beta_2 v_{t-1} + (1-\beta_2) g_t^2 \), और \( \hat{m}_t = m_t / (1-\beta_1^t) \), \( \hat{v}_t = v_t / (1-\beta_2^t) \) है। पैरामीटर अद्यतन \( w := w - \eta \frac{\hat{m}_t}{\sqrt{\hat{v}_t} + \epsilon} \) है। Adam अपनी मजबूती और तेज़ अभिसरण के कारण कई Deep learning कार्यों के लिए एक डिफ़ॉल्ट अनुकूलक बन गया है। AdamW जैसे रूप, जो वजन क्षय को अलग करते हैं, और AMSGrad, जो अभिसरण मुद्दों को संबोधित करता है, भी विकसित किए गए हैं।
Modern Adaptive Methods
Adam से परे, कई अनुकूली विधियाँ प्रस्तावित की गई हैं। AdaBelief (2020) वर्तमान ग्रेडिएंट दिशा में विश्वास के आधार पर चरण आकार को समायोजित करता है। RAdam (सुधारित Adam) प्रारंभिक प्रशिक्षण चरण को स्थिर करने के लिए एक सुधारक पेश करता है। Lion (विकसित साइन मोमेंटम), जिसे 2023 में Google Brain द्वारा खोजा गया, मेमोरी उपयोग को कम करने के लिए साइन संचालन का उपयोग करता है और प्रतिस्पर्धी प्रदर्शन दिखाता है। ये विधियाँ अक्सर बड़े भाषा मॉडल और अन्य बड़े पैमाने के सिस्टमों के प्रशिक्षण में उपयोग की जाती हैं, जहाँ दक्षता और स्थिरता महत्वपूर्ण हैं।
Practical Considerations
सही SGD रूप का चयन समस्या पर निर्भर करता है। उत्तल समस्याओं के लिए, NAG अक्सर सैद्धांतिक गारंटी प्रदान करता है। गहरे नेटवर्कों के लिए, Adam या RMSProp सामान्य प्रारंभिक बिंदु हैं। सीखने की दर अनुसूची, जैसे वार्मअप और क्षय, अक्सर इन अनुकूलकों के साथ संयुक्त होती है। मिनी-बैच आकार भी प्रदर्शन को प्रभावित करता है; बड़े बैच चिकने ग्रेडिएंट प्रदान करते हैं लेकिन अधिक मेमोरी की आवश्यकता होती है। वितरित प्रशिक्षण में, LARS (परत-वार अनुकूली दर स्केलिंग) और LAMB (परत-वार अनुकूली क्षण) जैसे रूप बड़े बैचों तक स्केल करने के लिए उपयोग किए जाते हैं, जैसा कि AWS Trainium और Google Cloud जैसे सिस्टमों में देखा गया है।
Impact on Machine Learning
SGD रूप आधुनिक Artificial intelligence की सफलता में सहायक रहे हैं। वे विशाल डेटासेट पर लाखों पैरामीटर वाले गहरे नेटवर्कों के प्रशिक्षण को सक्षम करते हैं, जैसा कि OpenAI, Google DeepMind, और Anthropic जैसे संगठनों द्वारा किया जाता है। अनुकूलक का चयन मॉडल सटीकता और प्रशिक्षण गति को महत्वपूर्ण रूप से प्रभावित कर सकता है। अनुसंधान इन विधियों को परिष्कृत करना जारी रखता है, नियमित रूप से नए रूप उभरते हैं। Machine learning और संबंधित क्षेत्रों में चिकित्सकों के लिए उनके गुणों को समझना आवश्यक है।
See Also
- Gradient descent
- Backpropagation
- learning-rate
- optimization