स्टोकास्टिक ग्रेडिएंट डिसेंट (SGD)

अंग्रेज़ी से अनुवादित

स्टोकेस्टिक ग्रेडिएंट डिसेंट (SGD) एक पुनरावृत्तीय अनुकूलन विधि है जो ग्रेडिएंट डिसेंट का अनुमान डेटा के यादृच्छिक रूप से चुने गए उपसमुच्चय का उपयोग करके लगाती है, जिससे बड़े पैमाने पर मशीन लर्निंग में कम्प्यूटेशनल लागत कम होती है।

स्टोकेस्टिक ग्रेडिएंट डिसेंट (अक्सर SGD के रूप में संक्षिप्त) एक पुनरावृत्तीय विधि है जो उपयुक्त स्मूथनेस गुणों, जैसे कि अवकलनीयता या उप-अवकलनीयता, वाले उद्देश्य फलन को अनुकूलित करने के लिए उपयोग की जाती है। इसे ग्रेडिएंट डिसेंट अनुकूलन का एक स्टोकेस्टिक सन्निकटन माना जा सकता है, क्योंकि यह पूरे डेटा सेट से गणना किए गए वास्तविक ग्रेडिएंट को, डेटा के यादृच्छिक रूप से चयनित उपसमुच्चय से गणना किए गए अनुमान से प्रतिस्थापित करता है। विशेष रूप से उच्च-आयामी अनुकूलन समस्याओं में, यह बहुत उच्च कम्प्यूटेशनल बोझ को कम करता है, कम अभिसरण दर के बदले में तेज़ पुनरावृत्तियाँ प्राप्त करता है। स्टोकेस्टिक सन्निकटन के पीछे की मूल अवधारणा 1950 के दशक के रॉबिंस-मोनरो एल्गोरिथ्म से जुड़ी हुई है। आज, स्टोकेस्टिक ग्रेडिएंट डिसेंट machine learning और व्यापक रूप से artificial intelligence में एक महत्वपूर्ण अनुकूलन विधि बन गया है।

पृष्ठभूमि

सांख्यिकीय अनुमान और मशीन लर्निंग दोनों ही एक उद्देश्य फलन को न्यूनतम करने की समस्या पर विचार करते हैं जिसका रूप एक योग है: Q(w) = (1/n) * sum_{i=1}^{n} Q_i(w), जहाँ पैरामीटर w जो Q(w) को न्यूनतम करता है, का अनुमान लगाया जाना है। प्रत्येक योग फलन Q_i आमतौर पर प्रशिक्षण के लिए उपयोग किए जाने वाले डेटा सेट में i-वें अवलोकन से जुड़ा होता है। शास्त्रीय सांख्यिकी में, योग-न्यूनीकरण समस्याएँ न्यूनतम वर्गों और स्वतंत्र अवलोकनों के लिए अधिकतम-संभावना अनुमान में उत्पन्न होती हैं। अनुमानकों का सामान्य वर्ग जो योगों के न्यूनतमकर्ता के रूप में उत्पन्न होते हैं, M-अनुमानक कहलाते हैं। हालाँकि, सांख्यिकी में, यह लंबे समय से मान्यता प्राप्त है कि कुछ अधिकतम-संभावना अनुमान समस्याओं के लिए स्थानीय न्यूनीकरण की आवश्यकता भी बहुत प्रतिबंधात्मक है। इसलिए, समकालीन सांख्यिकीय सिद्धांतकार अक्सर संभावना फलन के स्थिर बिंदुओं, या इसके व्युत्पन्न, स्कोर फलन, और अन्य अनुमान समीकरणों के शून्यों पर विचार करते हैं।

योग-न्यूनीकरण समस्या अनुभवजन्य जोखिम न्यूनीकरण के लिए भी उत्पन्न होती है। वहाँ, Q_i(w) i-वें उदाहरण पर हानि फलन का मान है, और Q(w) अनुभवजन्य जोखिम है। जब उपरोक्त फलन को न्यूनतम करने के लिए उपयोग किया जाता है, तो एक मानक (या "बैच") ग्रेडिएंट डिसेंट विधि w := w - eta nabla Q(w) = w - (eta/n) sum_{i=1}^{n} nabla Q_i(w) के रूप की पुनरावृत्तियाँ करेगी। चरण आकार को eta द्वारा दर्शाया जाता है, जिसे कभी-कभी मशीन लर्निंग में सीखने की दर कहा जाता है, और प्रतीक ":=" एल्गोरिथ्म में एक चर के अद्यतन को दर्शाता है।

कई मामलों में, योग फलनों का एक सरल रूप होता है जो योग-फलन और योग ग्रेडिएंट के सस्ते मूल्यांकन को सक्षम बनाता है। उदाहरण के लिए, सांख्यिकी में, एक-पैरामीटर घातीय परिवार किफायती फलन-मूल्यांकन और ग्रेडिएंट-मूल्यांकन की अनुमति देते हैं। हालाँकि, अन्य मामलों में, योग-ग्रेडिएंट का मूल्यांकन करने के लिए सभी योग फलनों के ग्रेडिएंट्स के महंगे मूल्यांकन की आवश्यकता हो सकती है। जब प्रशिक्षण सेट बहुत बड़ा होता है और कोई सरल सूत्र मौजूद नहीं होते हैं, तो ग्रेडिएंट्स के योगों का मूल्यांकन बहुत महंगा हो जाता है, क्योंकि ग्रेडिएंट का मूल्यांकन करने के लिए सभी योग फलनों के ग्रेडिएंट्स का मूल्यांकन करना आवश्यक होता है। हर पुनरावृत्ति पर कम्प्यूटेशनल लागत बचाने के लिए, स्टोकेस्टिक ग्रेडिएंट डिसेंट हर चरण पर योग फलनों का एक उपसमुच्चय नमूना करता है। यह बड़े पैमाने पर मशीन लर्निंग समस्याओं के मामले में बहुत प्रभावी है।

पुनरावृत्तीय विधि

स्टोकेस्टिक (या "ऑन-लाइन") ग्रेडिएंट डिसेंट में, Q(w) के वास्तविक ग्रेडिएंट का अनुमान एक एकल नमूने पर ग्रेडिएंट द्वारा लगाया जाता है: w := w - eta * nabla Q_i(w)। जैसे ही एल्गोरिथ्म प्रशिक्षण सेट के माध्यम से घूमता है, यह प्रत्येक प्रशिक्षण नमूने के लिए उपरोक्त अद्यतन करता है। एल्गोरिथ्म के अभिसरण तक प्रशिक्षण सेट पर कई पास बनाए जा सकते हैं। यदि ऐसा किया जाता है, तो चक्रों को रोकने के लिए प्रत्येक पास के लिए डेटा को फेरबदल किया जा सकता है। विशिष्ट कार्यान्वयन एक अनुकूली सीखने की दर का उपयोग कर सकते हैं ताकि एल्गोरिथ्म अभिसरण करे।

वास्तविक ग्रेडिएंट और एक एकल नमूने पर ग्रेडिएंट की गणना के बीच एक समझौता यह है कि प्रत्येक चरण पर एक से अधिक प्रशिक्षण नमूनों के विरुद्ध ग्रेडिएंट की गणना की जाए, जिसे "मिनी-बैच" कहा जाता है। यह वर्णित "सच्चे" स्टोकेस्टिक ग्रेडिएंट डिसेंट की तुलना में काफी बेहतर प्रदर्शन कर सकता है, क्योंकि कोड प्रत्येक चरण को अलग से गणना करने के बजाय वेक्टरकरण पुस्तकालयों का उपयोग कर सकता है, जैसा कि पहली बार "बंच-मोड बैकप्रोपेगेशन एल्गोरिथ्म" के संदर्भ में दिखाया गया था। यह चिकनी अभिसरण भी कर सकता है, क्योंकि प्रत्येक चरण पर गणना किया गया ग्रेडिएंट अधिक प्रशिक्षण नमूनों पर औसत होता है।

स्टोकेस्टिक ग्रेडिएंट डिसेंट के अभिसरण का विश्लेषण उत्तल न्यूनीकरण और स्टोकेस्टिक सन्निकटन के सिद्धांतों का उपयोग करके किया गया है। संक्षेप में, जब सीखने की दरें eta उचित दर से घटती हैं, और अपेक्षाकृत हल्की मान्यताओं के अधीन, स्टोकेस्टिक ग्रेडिएंट डिसेंट लगभग निश्चित रूप से एक वैश्विक न्यूनतम में अभिसरण करता है जब उद्देश्य फलन उत्तल या छद्म-उत्तल होता है, और अन्यथा लगभग निश्चित रूप से एक स्थानीय न्यूनतम में अभिसरण करता है। यह वास्तव में रॉबिंस-सीगमंड प्रमेय का एक परिणाम है।

रैखिक प्रतिगमन

मान लीजिए कि हम न्यूनतम वर्गों का उपयोग करके प्रशिक्षण उदाहरणों (x_i, y_i) के एक सेट के लिए एक सीधी रेखा y = a + bx फिट करना चाहते हैं। उद्देश्य फलन है Q(a, b) = (1/n) sum_{i=1}^{n} (y_i - (a + bx_i))^2। बैच ग्रेडिएंट डिसेंट सभी n उदाहरणों का उपयोग करके a और b के संबंध में Q के ग्रेडिएंट की गणना करेगा। इसके विपरीत, स्टोकेस्टिक ग्रेडिएंट डिसेंट एक यादृच्छिक उदाहरण i चुनता है और केवल उस उदाहरण के लिए वर्ग त्रुटि के ग्रेडिएंट का उपयोग करके a और b को अद्यतन करता है: a := a - eta (-2)(y_i - (a + bx_i)), और b := b - eta (-2x_i)(y_i - (a + bx_i))। यह प्रति पुनरावृत्ति बहुत सस्ता है, विशेष रूप से जब n बड़ा होता है।

मशीन लर्निंग में अनुप्रयोग

स्टोकेस्टिक ग्रेडिएंट डिसेंट Neural network और Deep learning मॉडलों के प्रशिक्षण की आधारशिला है। इन संदर्भों में, उद्देश्य फलन आमतौर पर अनुभवजन्य जोखिम होता है, और हानि फलन भविष्यवाणी किए गए और वास्तविक आउटपुट के बीच विसंगति को मापता है। उदाहरण के लिए, प्राकृतिक भाषा प्रसंस्करण के लिए एक transformer मॉडल को प्रशिक्षित करने में, SGD या इसके प्रकारों का उपयोग पाठ डेटा के मिनी-बैचों के आधार पर नेटवर्क के वज़न को अद्यतन करने के लिए किया जाता है। यह विधि बड़े पैमाने की समस्याओं के लिए विशेष रूप से प्रभावी है, जैसे कि large language model में सामने आने वाली, जहाँ प्रशिक्षण डेटा में अरबों टोकन शामिल हो सकते हैं।

SGD को अन्य डोमेन में भी लागू किया गया है, जिसमें computer vision (हालाँकि प्रदान किए गए स्लग में नहीं, यह एक सामान्य अनुप्रयोग है), reinforcement learning, और generative ai शामिल हैं। generative ai में, openai की GPT श्रृंखला और anthropic के Claude जैसे मॉडलों को स्टोकेस्टिक अनुकूलन तकनीकों का उपयोग करके प्रशिक्षित किया जाता है। ऑप्टिमाइज़र का चुनाव, अक्सर गति के साथ SGD या Adam (Optimizer), अभिसरण की गति और गुणवत्ता को महत्वपूर्ण रूप से प्रभावित करता है।

प्रकार और सुधार

स्टोकेस्टिक ग्रेडिएंट डिसेंट के कई प्रकार इसकी सीमाओं, जैसे धीमी अभिसरण और सीखने की दर के प्रति संवेदनशीलता, को संबोधित करने के लिए विकसित किए गए हैं। इनमें Stochastic Gradient Descent Variants जैसे गति, नेस्टरोव त्वरित ग्रेडिएंट, AdaGrad, RMSProp, और Adam (Optimizer) शामिल हैं। प्रत्येक प्रकार अभिसरण गुणों में सुधार के लिए अद्यतन नियम को संशोधित करता है। उदाहरण के लिए, गति पिछले अद्यतन का एक अंश वर्तमान अद्यतन में जोड़ती है, जो सही दिशा में ग्रेडिएंट्स को तेज करने और दोलनों को कम करने में मदद करती है। Adam, जो Adaptive Moment Estimation के लिए खड़ा है, प्रति-पैरामीटर सीखने की दरों को बनाए रखता है जो ग्रेडिएंट्स के पहले और दूसरे क्षणों के अनुमानों के आधार पर अनुकूलित होती हैं।

एक और महत्वपूर्ण सुधार Learning Rate Scheduling का उपयोग है, जो प्रशिक्षण के दौरान सीखने की दर को समायोजित करता है। सामान्य अनुसूचियों में चरण क्षय, घातीय क्षय, और कोसाइन एनीलिंग शामिल हैं। ये अनुसूचियाँ अनुकूलन आगे बढ़ने पर चरण आकार को कम करके एल्गोरिथ्म को अधिक विश्वसनीय रूप से अभिसरण करने में मदद करती हैं।

SGD के साथ परस्पर क्रिया करने वाली अन्य तकनीकों में Gradient Clipping शामिल है, जो एक सीमा से अधिक ग्रेडिएंट्स को स्केल करके विस्फोटक ग्रेडिएंट्स को रोकता है, और Batch Normalization और Layer Normalization, जो प्रत्येक परत के इनपुट के वितरण को स्थिर करते हैं, अक्सर उच्च सीखने की दरों की अनुमति देते हैं।

अभिसरण और चुनौतियाँ

जबकि SGD कम्प्यूटेशनल रूप से कुशल है, यह ग्रेडिएंट अनुमानों में विचरण का परिचय देता है, जिससे हानि में उतार-चढ़ाव हो सकता है। SGD की अभिसरण दर पुनरावृत्तियों की संख्या के संदर्भ में आम तौर पर बैच ग्रेडिएंट डिसेंट की तुलना में धीमी होती है, लेकिन प्रति-पुनरावृत्ति लागत बहुत कम होती है, जिससे बड़े पैमाने की सेटिंग्स में तेज़ समग्र प्रशिक्षण होता है। मिनी-बैच आकार का चुनाव एक महत्वपूर्ण हाइपरपैरामीटर है: छोटे बैच अधिक शोर का परिचय देते हैं लेकिन कम मेमोरी की आवश्यकता होती है, जबकि बड़े बैच चिकने ग्रेडिएंट्स प्रदान करते हैं लेकिन तेज न्यूनतम में अभिसरण कर सकते हैं, जो बदतर सामान्यीकरण कर सकते हैं।

SGD सैडल बिंदुओं या स्थानीय न्यूनतम में भी फंस सकता है, विशेष रूप से Deep learning जैसी गैर-उत्तल समस्याओं में। पुनः आरंभ करना, गति का उपयोग करना, या अनुकूली सीखने की दरों को नियोजित करना जैसी विभिन्न रणनीतियाँ इन मुद्दों को कम करने में मदद करती हैं। व्यवहार में, SGD और इसके प्रकार गहरे नेटवर्कों को प्रशिक्षित करने में उल्लेखनीय रूप से सफल रहे हैं, कई कार्यों पर अत्याधुनिक परिणाम प्राप्त करते हैं।

ऐतिहासिक संदर्भ

स्टोकेस्टिक ग्रेडिएंट डिसेंट की जड़ें रॉबिंस-मोनरो एल्गोरिथ्म में हैं, जिसे 1951 में हर्बर्ट रॉबिंस और सटन मोनरो द्वारा स्टोकेस्टिक सन्निकटन के लिए पेश किया गया था। इस विधि को बाद में 1980 के दशक में मशीन लर्निंग के लिए अनुकूलित किया गया, विशेष रूप से Neural network के लिए बैकप्रोपेगेशन के संदर्भ में। "स्टोकेस्टिक ग्रेडिएंट डिसेंट" शब्द व्यापक रूप से उपयोग में आया क्योंकि machine learning का क्षेत्र बढ़ा। आज, यह हर मशीन लर्निंग व्यवसायी के टूलकिट में एक मौलिक उपकरण है, और यह सभी प्रमुख गहन शिक्षण ढांचे में लागू किया गया है, जिसमें google deepmind, amazon web services, और microsoft azure जैसी कंपनियों द्वारा उपयोग किए जाने वाले शामिल हैं।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:optimization·machine-learning·deep-learning
इस पृष्ठ को अंतिम बार संपादित किया गया 9 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास