स्टोकास्टिक ग्रेडिएंट डिसेंट

अंग्रेज़ी से अनुवादित

स्टोकेस्टिक ग्रेडिएंट डिसेंट (SGD) एक पुनरावृत्तीय अनुकूलन एल्गोरिदम है जो ग्रेडिएंट का अनुमान लगाने के लिए डेटा के यादृच्छिक रूप से चयनित उपसमुच्चय का उपयोग करके ग्रेडिएंट डिसेंट का अनुमान लगाता है, जिससे बड़े पैमाने पर मशीन लर्निंग मॉडल का कुशल प्रशिक्षण संभव होता है।

स्टोकैस्टिक ग्रेडिएंट डिसेंट (अक्सर SGD के रूप में संक्षिप्त) एक पुनरावृत्तीय विधि है जो उपयुक्त स्मूथनेस गुणों, जैसे कि अवकलनीयता या उप-अवकलनीयता, वाले उद्देश्य फलन को अनुकूलित करने के लिए उपयोग की जाती है। इसे ग्रेडिएंट डिसेंट अनुकूलन का एक स्टोकैस्टिक सन्निकटन माना जा सकता है, क्योंकि यह पूरे डेटा सेट से परिकलित वास्तविक ग्रेडिएंट को, डेटा के यादृच्छिक रूप से चयनित उपसमुच्चय से परिकलित अनुमान से प्रतिस्थापित करता है। विशेष रूप से उच्च-आयामी अनुकूलन समस्याओं में, यह बहुत उच्च संगणनात्मक बोझ को कम करता है, कम अभिसरण दर के बदले में तेज़ पुनरावृत्तियाँ प्राप्त करता है।

स्टोकैस्टिक सन्निकटन के पीछे मूल विचार 1950 के दशक के रॉबिंस-मोनरो एल्गोरिदम से जुड़ा जा सकता है। आज, स्टोकैस्टिक ग्रेडिएंट डिसेंट Machine learning में एक महत्वपूर्ण अनुकूलन विधि बन गया है, विशेष रूप से न्यूरल नेटवर्क और अन्य Deep learning मॉडलों के प्रशिक्षण के लिए।

पृष्ठभूमि

सांख्यिकीय अनुमान और मशीन लर्निंग दोनों एक उद्देश्य फलन को न्यूनतम करने की समस्या पर विचार करते हैं जिसका रूप योग के रूप में होता है: Q(w) = (1/n) Σᵢ Qᵢ(w), जहाँ पैरामीटर w जो Q(w) को न्यूनतम करता है, अनुमानित किया जाना है। प्रत्येक योगात्मक फलन Qᵢ आम तौर पर प्रशिक्षण डेटा सेट में i-वें अवलोकन से जुड़ा होता है।

शास्त्रीय सांख्यिकी में, योग-न्यूनीकरण समस्याएँ न्यूनतम वर्गों और स्वतंत्र अवलोकनों के लिए अधिकतम-संभावना अनुमान में उत्पन्न होती हैं। सामान्य वर्ग के अनुमानक जो योगों के न्यूनतमक के रूप में उत्पन्न होते हैं, उन्हें M-अनुमानक कहा जाता है। हालाँकि, यह लंबे समय से मान्यता प्राप्त है कि कुछ अधिकतम-संभावना समस्याओं के लिए स्थानीय न्यूनीकरण की आवश्यकता भी बहुत प्रतिबंधात्मक है, इसलिए समकालीन सांख्यिकीय सिद्धांतकार अक्सर संभावना फलन के स्थिर बिंदुओं या इसके व्युत्पन्न, स्कोर फलन, के शून्यों पर विचार करते हैं।

योग-न्यूनीकरण समस्या अनुभवजन्य जोखिम न्यूनीकरण के लिए भी उत्पन्न होती है। वहाँ, Qᵢ(w) i-वें उदाहरण पर हानि फलन का मान है, और Q(w) अनुभवजन्य जोखिम है।

जब उपरोक्त फलन को न्यूनतम करने के लिए उपयोग किया जाता है, तो एक मानक (या "बैच") ग्रेडिएंट डिसेंट विधि निम्न रूप के पुनरावृत्तियों को निष्पादित करेगी: w := w - η ∇Q(w) = w - (η/n) Σᵢ ∇Qᵢ(w)। चरण आकार η को मशीन लर्निंग में कभी-कभी सीखने की दर कहा जाता है। कई मामलों में, योगात्मक फलनों का एक सरल रूप होता है जो योग-फलन और योग ग्रेडिएंट के सस्ते मूल्यांकन को सक्षम बनाता है, जैसे कि एक-पैरामीटर घातीय परिवारों में। हालाँकि, जब प्रशिक्षण सेट विशाल होता है और कोई सरल सूत्र मौजूद नहीं होते हैं, तो ग्रेडिएंट के योगों का मूल्यांकन बहुत महंगा हो जाता है क्योंकि इसके लिए सभी योगात्मक फलनों के ग्रेडिएंट का मूल्यांकन करना आवश्यक होता है। संगणनात्मक लागत को कम करने के लिए, स्टोकैस्टिक ग्रेडिएंट डिसेंट प्रत्येक चरण पर योगात्मक फलनों के एक उपसमुच्चय का नमूना लेता है, जो बड़े पैमाने पर मशीन लर्निंग समस्याओं में बहुत प्रभावी है।

पुनरावृत्तीय विधि

स्टोकैस्टिक (या "ऑन-लाइन") ग्रेडिएंट डिसेंट में, Q(w) के वास्तविक ग्रेडिएंट को एक एकल नमूने पर ग्रेडिएंट द्वारा अनुमानित किया जाता है: w := w - η ∇Qᵢ(w)। जैसे-जैसे एल्गोरिदम प्रशिक्षण सेट के माध्यम से आगे बढ़ता है, यह प्रत्येक प्रशिक्षण नमूने के लिए उपरोक्त अद्यतन करता है। एल्गोरिदम के अभिसरण तक प्रशिक्षण सेट पर कई पास बनाए जा सकते हैं। यदि ऐसा किया जाता है, तो चक्रों को रोकने के लिए प्रत्येक पास के लिए डेटा को फेरबदल किया जा सकता है। विशिष्ट कार्यान्वयन अनुकूली सीखने की दर का उपयोग कर सकते हैं ताकि एल्गोरिदम अभिसरण करे।

सूडोकोड में, स्टोकैस्टिक ग्रेडिएंट डिसेंट को इस प्रकार प्रस्तुत किया जा सकता है:

  1. पैरामीटर w और सीखने की दर η आरंभ करें।
  2. अभिसरण तक दोहराएँ:
    • प्रशिक्षण डेटा को फेरबदल करें।
    • प्रत्येक प्रशिक्षण उदाहरण i के लिए:
    • ग्रेडिएंट ∇Qᵢ(w) की गणना करें।
    • w := w - η ∇Qᵢ(w) अद्यतन करें।

वास्तविक ग्रेडिएंट और एक एकल नमूने पर ग्रेडिएंट की गणना के बीच एक समझौता यह है कि प्रत्येक चरण पर एक से अधिक प्रशिक्षण नमूनों के विरुद्ध ग्रेडिएंट की गणना की जाए, जिसे "मिनी-बैच" कहा जाता है। यह वास्तविक स्टोकैस्टिक ग्रेडिएंट डिसेंट से काफी बेहतर प्रदर्शन कर सकता है क्योंकि कोड प्रत्येक चरण को अलग से गणना करने के बजाय वेक्टराइजेशन लाइब्रेरी का उपयोग कर सकता है, जैसा कि पहले बैक-प्रोपेगेशन के संदर्भ में दिखाया गया था। यह स्मूथ अभिसरण भी कर सकता है, क्योंकि प्रत्येक चरण पर गणना किया गया ग्रेडिएंट अधिक प्रशिक्षण नमूनों पर औसत होता है।

स्टोकैस्टिक ग्रेडिएंट डिसेंट के अभिसरण का विश्लेषण उत्तल न्यूनीकरण और स्टोकैस्टिक सन्निकटन के सिद्धांतों का उपयोग करके किया गया है। संक्षेप में, जब सीखने की दर उचित दर से घटती है और अपेक्षाकृत हल्की मान्यताओं के अधीन, स्टोकैस्टिक ग्रेडिएंट डिसेंट लगभग निश्चित रूप से वैश्विक न्यूनतम में अभिसरण करता है जब उद्देश्य फलन उत्तल या छद्म-उत्तल होता है, और अन्यथा लगभग निश्चित रूप से स्थानीय न्यूनतम में अभिसरण करता है। यह रॉबिंस-सीगमंड प्रमेय का परिणाम है।

रेखीय प्रतिगमन

मान लीजिए हम प्रशिक्षण उदाहरणों (xᵢ, yᵢ) के एक सेट पर एक सीधी रेखा ŷ = w·x फिट करना चाहते हैं। एक सामान्य उद्देश्य माध्य वर्ग त्रुटि को न्यूनतम करना है: Q(w) = (1/n) Σᵢ (ŷᵢ - yᵢ)²। एक एकल उदाहरण के लिए ग्रेडिएंट ∇Qᵢ(w) = 2(ŷᵢ - yᵢ)xᵢ है। स्टोकैस्टिक ग्रेडिएंट डिसेंट में, अद्यतन w := w - η(ŷᵢ - yᵢ)xᵢ बन जाता है। यह सरल उदाहरण दिखाता है कि कैसे SGD एक समय में एक नमूने का उपयोग करता है, जिससे यह बड़े डेटासेट के लिए संगणनात्मक रूप से कुशल बन जाता है।

मशीन लर्निंग में अनुप्रयोग

स्टोकैस्टिक ग्रेडिएंट डिसेंट कई मशीन लर्निंग मॉडलों के प्रशिक्षण के लिए मुख्य अनुकूलन एल्गोरिदम है, जिसमें डीप लर्निंग मॉडल जैसे ट्रांसफार्मर और बड़े भाषा मॉडल शामिल हैं। इसका उपयोग छवि पहचान, प्राकृतिक भाषा प्रसंस्करण और जनरेटिव AI जैसे कार्यों के लिए न्यूरल नेटवर्क के प्रशिक्षण में किया जाता है। Adam और अन्य SGD वेरिएंट जैसे वेरिएंट अभिसरण और स्थिरता में सुधार के लिए विकसित किए गए हैं। प्रभावी प्रशिक्षण के लिए सीखने की दर अनुसूची का चुनाव महत्वपूर्ण है।

चुनौतियाँ और विस्तार

SGD को उपयुक्त सीखने की दर चुनने, शोर ग्रेडिएंट से निपटने और खराब स्थानीय न्यूनतम से बचने जैसी चुनौतियों का सामना करना पड़ता है। विस्तार में संवेग, अनुकूली सीखने की दर (जैसे, Adam), और विस्फोटक ग्रेडिएंट को रोकने के लिए ग्रेडिएंट क्लिपिंग जैसी तकनीकें शामिल हैं। डीप लर्निंग में, बैच नॉर्मलाइजेशन और ड्रॉपआउट जैसी विधियाँ अक्सर SGD के साथ मिलकर प्रशिक्षण में सुधार के लिए उपयोग की जाती हैं।

ऐतिहासिक संदर्भ

1950 के दशक का रॉबिंस-मोनरो एल्गोरिदम स्टोकैस्टिक सन्निकटन की नींव रखता है। 1980 और 1990 के दशक में, SGD न्यूरल नेटवर्क प्रशिक्षण में लोकप्रिय हो गया, विशेष रूप से बैक-प्रोपेगेशन के साथ। आज, यह कृत्रिम बुद्धिमत्ता अनुसंधान और उद्योग में एक मौलिक उपकरण बना हुआ है, जिसका उपयोग प्रमुख AI प्रयोगशालाओं और कंपनियों द्वारा किया जाता है।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:optimization·machine-learning·deep-learning·algorithms
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास