स्टोकास्टिक ग्रेडिएंट डिसेंट वेरिएंट्स

अंग्रेज़ी से अनुवादित

स्टोकास्टिक ग्रेडिएंट डिसेंट (SGD) वेरिएंट्स अनुकूलन एल्गोरिदम हैं जो मोमेंटम, अनुकूली सीखने की दर, या दूसरे क्रम की जानकारी का उपयोग करके अपडेट चरणों को समायोजित करके बुनियादी SGD में सुधार करते हैं। वे आधुनिक मशीन लर्निंग मॉडल, जिसमें गहरे तंत्रिका नेटवर्क शामिल हैं, के प्रशिक्षण के लिए आवश्यक हैं।

स्टोकास्टिक ग्रेडिएंट डिसेंट (SGD) एक पुनरावृत्तीय अनुकूलन विधि है जो डेटा के यादृच्छिक रूप से चयनित उपसमुच्चय का उपयोग करके ग्रेडिएंट का अनुमान लगाकर ग्रेडिएंट डिसेंट का अनुमान लगाती है। इसकी सीमाओं, जैसे धीमी अभिसरण और सीखने की दर के प्रति संवेदनशीलता, को संबोधित करने के लिए SGD के विभिन्न रूप विकसित किए गए हैं। इन रूपों में मोमेंटम, नेस्टरोव त्वरित ग्रेडिएंट, AdaGrad, RMSProp, और Adam जैसी आधुनिक अनुकूली विधियाँ शामिल हैं, जो Machine learning और Deep learning में मॉडलों को कुशलतापूर्वक प्रशिक्षित करने के लिए व्यापक रूप से उपयोग की जाती हैं।

SGD का मूल विचार 1950 के दशक के रॉबिंस-मोनरो एल्गोरिदम से जुड़ा है, जिसने मूल-खोज के लिए स्टोकास्टिक अनुमान पेश किया। मशीन लर्निंग में, SGD एक उद्देश्य फलन को न्यूनतम करता है जो आमतौर पर प्रति-उदाहरण हानि फलनों का योग होता है। मूल अद्यतन नियम \( w := w - \eta \nabla Q_i(w) \) है, जहाँ \( \eta \) सीखने की दर है और \( Q_i \) \( i \)-वें नमूने के लिए हानि है। हालांकि सरल, यह अद्यतन धीरे-धीरे अभिसरित हो सकता है और दोलन कर सकता है, विशेष रूप से हानि परिदृश्य की घाटियों में। विभिन्न रूप अद्यतन दिशा, सीखने की दर, या दोनों को संशोधित करके इन मुद्दों का समाधान करते हैं।

Momentum

मोमेंटम एक तकनीक है जो लगातार ग्रेडिएंट्स की दिशा में वेग वेक्टर जमा करके SGD को त्वरित करती है। 1964 में बोरिस पॉलियाक द्वारा पेश किया गया, मोमेंटम भौतिक जड़ता का अनुकरण करता है: चरण \( t \) पर अद्यतन \( v_t = \mu v_{t-1} - \eta \nabla Q_i(w_t) \) और \( w_{t+1} = w_t + v_t \) है, जहाँ \( \mu \) मोमेंटम गुणांक है (अक्सर 0.9)। यह अनुकूलक को सुसंगत दिशाओं में तेजी से आगे बढ़ने में मदद करता है और उच्च-वक्रता क्षेत्रों में दोलनों को कम करता है। मोमेंटम गहरे नेटवर्कों के प्रशिक्षण के लिए विशेष रूप से प्रभावी है, क्योंकि यह शोरग्रस्त ग्रेडिएंट अनुमानों को सुचारू करता है।

Nesterov Accelerated Gradient

नेस्टरोव त्वरित ग्रेडिएंट (NAG) एक रूप है जो एक आगे-देखने वाला चरण जोड़ता है। 1983 में यूरी नेस्टरोव द्वारा प्रस्तावित, NAG वर्तमान स्थिति के बजाय प्रक्षेपित स्थिति \( w_t + \mu v_{t-1} \) पर ग्रेडिएंट की गणना करता है। अद्यतन \( v_t = \mu v_{t-1} - \eta \nabla Q_i(w_t + \mu v_{t-1}) \) और \( w_{t+1} = w_t + v_t \) बन जाता है। यह सुधार अतिशूटिंग को कम करता है और भविष्य के ग्रेडिएंट का अधिक सटीक अनुमान प्रदान करता है, जिससे उत्तल सेटिंग्स में तेजी से अभिसरण होता है। NAG अक्सर तंत्रिका नेटवर्क के प्रशिक्षण में उपयोग किया जाता है और कई पुस्तकालयों में शामिल किया गया है।

AdaGrad

AdaGrad, जिसे 2011 में जॉन डुची, एलाद हज़ान और योरम सिंगर द्वारा पेश किया गया, वर्गित ग्रेडिएंट्स के ऐतिहासिक योग के आधार पर प्रति पैरामीटर सीखने की दर को अनुकूलित करता है। प्रत्येक पैरामीटर \( w_j \) के लिए, अद्यतन \( w_j := w_j - \frac{\eta}{\sqrt{G_{j,j} + \epsilon}} \nabla Q_i(w_j) \) है, जहाँ \( G_{j,j} \) वर्गित ग्रेडिएंट्स को जमा करता है और \( \epsilon \) संख्यात्मक स्थिरता के लिए एक छोटा स्थिरांक है। AdaGrad विरल डेटा के लिए अच्छा काम करता है, क्योंकि यह दुर्लभ विशेषताओं को बड़े अद्यतन देता है। हालांकि, वर्गित ग्रेडिएंट्स का संचय समय के साथ सीखने की दर को सिकोड़ने का कारण बनता है, जो प्रशिक्षण को समय से पहले रोक सकता है।

RMSProp

RMSProp, जिसे 2012 में जेफ्री हिंटन द्वारा अपने व्याख्यान नोट्स में प्रस्तावित किया गया, AdaGrad की घटती सीखने की दर को वर्गित ग्रेडिएंट्स के घातीय रूप से क्षय होने वाले औसत का उपयोग करके संबोधित करता है। अद्यतन एक गतिशील औसत \( E[g^2]_t = \rho E[g^2]_{t-1} + (1-\rho) g_t^2 \) बनाए रखता है, जहाँ \( \rho \) क्षय दर है (आमतौर पर 0.9)। पैरामीटर अद्यतन \( w := w - \frac{\eta}{\sqrt{E[g^2]_t + \epsilon}} g_t \) है। RMSProp गैर-उत्तल सेटिंग्स में प्रभावी है और आवर्ती नेटवर्कों और गहरे शिक्षण मॉडलों के प्रशिक्षण में व्यापक रूप से उपयोग किया गया है।

Adam

Adam (अनुकूली क्षण अनुमान), जिसे 2015 में डिडेरिक किंगमा और जिमी बा द्वारा पेश किया गया, मोमेंटम और RMSProp को जोड़ता है। यह ग्रेडिएंट्स के पहले क्षण (माध्य) और दूसरे क्षण (विचरण) दोनों को बनाए रखता है, जिसमें प्रारंभिक चरणों के लिए पूर्वाग्रह सुधार होता है। अद्यतन \( m_t = \beta_1 m_{t-1} + (1-\beta_1) g_t \), \( v_t = \beta_2 v_{t-1} + (1-\beta_2) g_t^2 \), और \( \hat{m}_t = m_t / (1-\beta_1^t) \), \( \hat{v}_t = v_t / (1-\beta_2^t) \) है। पैरामीटर अद्यतन \( w := w - \eta \frac{\hat{m}_t}{\sqrt{\hat{v}_t} + \epsilon} \) है। Adam अपनी मजबूती और तेज़ अभिसरण के कारण कई Deep learning कार्यों के लिए एक डिफ़ॉल्ट अनुकूलक बन गया है। AdamW जैसे रूप, जो वजन क्षय को अलग करते हैं, और AMSGrad, जो अभिसरण मुद्दों को संबोधित करता है, भी विकसित किए गए हैं।

Modern Adaptive Methods

Adam से परे, कई अनुकूली विधियाँ प्रस्तावित की गई हैं। AdaBelief (2020) वर्तमान ग्रेडिएंट दिशा में विश्वास के आधार पर चरण आकार को समायोजित करता है। RAdam (सुधारित Adam) प्रारंभिक प्रशिक्षण चरण को स्थिर करने के लिए एक सुधारक पेश करता है। Lion (विकसित साइन मोमेंटम), जिसे 2023 में Google Brain द्वारा खोजा गया, मेमोरी उपयोग को कम करने के लिए साइन संचालन का उपयोग करता है और प्रतिस्पर्धी प्रदर्शन दिखाता है। ये विधियाँ अक्सर बड़े भाषा मॉडल और अन्य बड़े पैमाने के सिस्टमों के प्रशिक्षण में उपयोग की जाती हैं, जहाँ दक्षता और स्थिरता महत्वपूर्ण हैं।

Practical Considerations

सही SGD रूप का चयन समस्या पर निर्भर करता है। उत्तल समस्याओं के लिए, NAG अक्सर सैद्धांतिक गारंटी प्रदान करता है। गहरे नेटवर्कों के लिए, Adam या RMSProp सामान्य प्रारंभिक बिंदु हैं। सीखने की दर अनुसूची, जैसे वार्मअप और क्षय, अक्सर इन अनुकूलकों के साथ संयुक्त होती है। मिनी-बैच आकार भी प्रदर्शन को प्रभावित करता है; बड़े बैच चिकने ग्रेडिएंट प्रदान करते हैं लेकिन अधिक मेमोरी की आवश्यकता होती है। वितरित प्रशिक्षण में, LARS (परत-वार अनुकूली दर स्केलिंग) और LAMB (परत-वार अनुकूली क्षण) जैसे रूप बड़े बैचों तक स्केल करने के लिए उपयोग किए जाते हैं, जैसा कि AWS Trainium और Google Cloud जैसे सिस्टमों में देखा गया है।

Impact on Machine Learning

SGD रूप आधुनिक Artificial intelligence की सफलता में सहायक रहे हैं। वे विशाल डेटासेट पर लाखों पैरामीटर वाले गहरे नेटवर्कों के प्रशिक्षण को सक्षम करते हैं, जैसा कि OpenAI, Google DeepMind, और Anthropic जैसे संगठनों द्वारा किया जाता है। अनुकूलक का चयन मॉडल सटीकता और प्रशिक्षण गति को महत्वपूर्ण रूप से प्रभावित कर सकता है। अनुसंधान इन विधियों को परिष्कृत करना जारी रखता है, नियमित रूप से नए रूप उभरते हैं। Machine learning और संबंधित क्षेत्रों में चिकित्सकों के लिए उनके गुणों को समझना आवश्यक है।

See Also

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:optimization·machine-learning·deep-learning
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास