अंग्रेज़ी से अनुवादित

SGD विथ मोमेंटम एक स्टोकेस्टिक ग्रेडिएंट डिसेंट संस्करण है जो वेग वेक्टर संचित करके अभिसरण को तेज करता है, शोरग्रस्त ग्रेडिएंट अनुमानों को स्मूथ करता है और उच्च-आयामी अनुकूलन में दोलनों को कम करता है।

मोमेंटम के साथ SGD स्टोकेस्टिक ग्रेडिएंट डिसेंट (SGD) का एक प्रकार है जो अभिसरण को तेज करने और अपडेट को स्थिर करने के लिए एक मोमेंटम पद शामिल करता है। मानक SGD केवल वर्तमान मिनी-बैच ग्रेडिएंट का उपयोग करके पैरामीटर अपडेट करता है, जो शोरगुल वाला हो सकता है और अनियमित गति पैदा कर सकता है। मोमेंटम पिछले ग्रेडिएंट्स का चल रहा औसत बनाए रखकर इसे संबोधित करता है, जिससे अपडेट दिशा सुचारू होती है और दोलन कम होते हैं। भौतिक मोमेंटम से प्रेरित यह तकनीक, ऑप्टिमाइज़र को सुसंगत दिशाओं में गति बनाने और गहरे सीखने में सामान्य खराब-स्थिति वाले लॉस परिदृश्यों में घाटियों को अधिक कुशलता से पार करने की अनुमति देती है।

मूल विचार शास्त्रीय अनुकूलन से जुड़ा है और इसे 1980 के दशक में बर्कले शोधकर्ता बर्नार्ड विड्रो और अन्य द्वारा तंत्रिका नेटवर्क प्रशिक्षण में लोकप्रिय बनाया गया था, हालांकि आज व्यापक रूप से उपयोग किया जाने वाला विशिष्ट सूत्रीकरण कार्नेगी मेलन प्रोफेसर जेफ्री हिंटन द्वारा 1986 के पेपर 'लर्निंग रिप्रेजेंटेशन्स बाय बैक-प्रोपेगेटिंग एरर्स' में पेश किया गया था और बाद में उनके 2012 के व्याख्यान नोट्स में परिष्कृत किया गया। यह विधि गहरे तंत्रिका नेटवर्क के प्रशिक्षण में एक मानक उपकरण बन गई है, जो अक्सर एक आधार रेखा के रूप में कार्य करती है जिसके खिलाफ एडम जैसे नए ऑप्टिमाइज़र की तुलना की जाती है।

गणितीय सूत्रीकरण

मानक SGD में, पुनरावृत्ति \( t \) पर पैरामीटर अपडेट है:

\[ w_{t+1} = w_t - \eta \nabla Q_i(w_t) \]

जहां \( \eta \) सीखने की दर है और \( \nabla Q_i(w_t) \) नमूनों के एक मिनी-बैच से गणना किया गया ग्रेडिएंट है। मोमेंटम के साथ, एक अतिरिक्त वेग चर \( v \) पेश किया जाता है, और अपडेट बन जाता है:

\[ v_{t+1} = \mu v_t + \eta \nabla Q_i(w_t) \]

\[ w_{t+1} = w_t - v_{t+1} \]

यहां, \( \mu \) (आमतौर पर 0.5 और 0.9 के बीच) मोमेंटम गुणांक है, जो नियंत्रित करता है कि पिछला वेग कितना बनाए रखा जाता है। उच्च \( \mu \) पिछले ग्रेडिएंट्स को अधिक भार देता है, जिससे सुचारू लेकिन संभावित रूप से धीमी अनुकूलन नई ग्रेडिएंट दिशाओं में होता है। वेग समय के साथ ग्रेडिएंट्स को जमा करता है, इसलिए यदि ग्रेडिएंट लगातार एक ही दिशा में इंगित करता है, तो चरण आकार बढ़ता है, जिससे प्रगति तेज होती है। इसके विपरीत, यदि ग्रेडिएंट्स दोलन करते हैं, तो मोमेंटम पद उन्हें औसत कर देता है, जिससे झटके कम होते हैं।

अंतर्ज्ञान और सादृश्य

'मोमेंटम' नाम भौतिकी से आता है: एक गेंद पहाड़ी से लुढ़कती है और अपने द्रव्यमान के कारण गति प्राप्त करती है और दिशा बदलने का प्रतिरोध करती है। अनुकूलन में, वेग वेक्टर गेंद के मोमेंटम की तरह कार्य करता है, जिससे ऑप्टिमाइज़र छोटे स्थानीय उतार-चढ़ाव को 'पार' कर सकता है और एक सुसंगत दिशा में जारी रह सकता है। यह विशेष रूप से लंबी, संकीर्ण घाटियों वाली लॉस सतहों में उपयोगी है जहां मानक SGD घाटी की दीवारों पर ज़िगज़ैग करता है। मोमेंटम ऑप्टिमाइज़र को घाटी के तल के साथ अधिक सीधे चलने में मदद करता है, जिससे न्यूनतम तक पहुंचने के लिए आवश्यक पुनरावृत्तियों की संख्या कम हो जाती है।

विविधताएं और विस्तार

मोमेंटम की कई विविधताएं विकसित की गई हैं। नेस्टरोव त्वरित ग्रेडिएंट (NAG), जिसे 1983 में यूरी नेस्टरोव द्वारा पेश किया गया था, एक लुकहेड संस्करण है जो वर्तमान स्थिति के बजाय वर्तमान वेग लागू करने के बाद की स्थिति पर ग्रेडिएंट की गणना करता है। यह 'झलक' NAG को अपना मार्ग अधिक तेज़ी से सुधारने की अनुमति देता है, जिससे अक्सर शास्त्रीय मोमेंटम की तुलना में तेज़ अभिसरण होता है। गहरे सीखने में, NAG को कभी-कभी 'नेस्टरोव मोमेंटम' कहा जाता है और इसे टेंसरफ्लो और पायटॉर्च जैसी लाइब्रेरीज़ में लागू किया जाता है।

एक और संबंधित अवधारणा हेवी-बॉल मोमेंटम है, जो अनिवार्य रूप से ऊपर वर्णित शास्त्रीय मोमेंटम है। 'हेवी बॉल' शब्द एक सतह पर लुढ़कती भारी गेंद के सादृश्य से आता है, और इसे अनुकूलन साहित्य में कभी-कभी 'मोमेंटम' के साथ विनिमेय रूप से उपयोग किया जाता है।

गहरे सीखने के प्रशिक्षण में भूमिका

व्यवहार में, मोमेंटम के साथ SGD व्यापक रूप से तंत्रिका नेटवर्क के प्रशिक्षण के लिए उपयोग किया जाता है, जिसमें बड़े भाषा मॉडल और ट्रांसफॉर्मर शामिल हैं। उदाहरण के लिए, ओपनएआई और गूगल डीपमाइंड ने विभिन्न प्रशिक्षण रनों में मोमेंटम-आधारित ऑप्टिमाइज़र का उपयोग करने की सूचना दी है। यह विधि बड़े मिनी-बैच और सीखने की दर अनुसूचियों का उपयोग करते समय प्रशिक्षण को स्थिर करने में मदद करती है, क्योंकि वेग पद बैच-से-बैच ग्रेडिएंट शोर को सुचारू करता है। मोमेंटम को सीखने की दर अनुसूचियों के साथ जोड़ना भी आम है जो समय के साथ सीखने की दर को घटाती हैं, जिससे ऑप्टिमाइज़र बड़े प्रारंभिक कदम उठा सकता है और फिर बारीक ट्यूनिंग कर सकता है।

एडम के साथ तुलना

एडम ऑप्टिमाइज़र, जो 2015 में पेश किया गया था, प्रत्येक पैरामीटर के लिए अलग अनुकूली सीखने की दर बनाए रखकर मोमेंटम का विस्तार करता है, मोमेंटम को प्रति-पैरामीटर स्केलिंग के साथ जोड़ता है। एडम अक्सर व्यवहार में तेज़ी से अभिसरण करता है, विशेष रूप से विरल ग्रेडिएंट्स या शोरगुल वाले उद्देश्यों के लिए, लेकिन मोमेंटम के साथ SGD कुछ कार्यों में बेहतर सामान्यीकरण कर सकता है, विशेष रूप से कंप्यूटर विज़न में। कई चिकित्सक कन्वोल्यूशनल नेटवर्क के लिए डिफ़ॉल्ट के रूप में मोमेंटम के साथ SGD और ट्रांसफॉर्मर के लिए एडम का उपयोग करते हैं, हालांकि चुनाव विशिष्ट समस्या पर निर्भर करता है। शोध से पता चला है कि मोमेंटम के साथ SGD, जब ठीक से ट्यून किया जाता है, तो तुलनीय या बेहतर परीक्षण सटीकता प्राप्त कर सकता है, विशेष रूप से वजन आरंभीकरण और बैच सामान्यीकरण के साथ।

अभिसरण गुण

सैद्धांतिक रूप से, मोमेंटम के साथ SGD उत्तलता धारणाओं के तहत मानक SGD की अभिसरण गारंटी बनाए रखता है। उत्तल उद्देश्यों के लिए, रॉबिन्स-मोनरो स्थितियों को संतुष्ट करने वाली घटती सीखने की दर के साथ, एल्गोरिदम लगभग निश्चित रूप से वैश्विक न्यूनतम में परिवर्तित होता है। गैर-उत्तल उद्देश्यों के लिए, यह स्थानीय न्यूनतम या स्थिर बिंदु में परिवर्तित होता है। मोमेंटम पद स्पर्शोन्मुख अभिसरण दर को नहीं बदलता है लेकिन स्थिर कारकों में सुधार कर सकता है, जिसका अर्थ है कि यह अक्सर कम पुनरावृत्तियों में दी गई सटीकता तक पहुंचता है। हालांकि, सही मोमेंटम गुणांक चुनना महत्वपूर्ण है; बहुत अधिक मान ओवरशूटिंग और विचलन का कारण बन सकता है, जबकि बहुत कम मान लाभ को कम करता है।

व्यावहारिक विचार

मोमेंटम के साथ SGD लागू करते समय, कई व्यावहारिक विवरण मायने रखते हैं। मोमेंटम गुणांक अक्सर डिफ़ॉल्ट के रूप में 0.9 पर सेट किया जाता है, लेकिन बहुत गहरे नेटवर्क के लिए 0.95 या 0.99 जैसे मान उपयोग किए जाते हैं। कुछ कार्यान्वयन एक मोमेंटम अनुसूची का उपयोग करते हैं जो प्रशिक्षण के दौरान \( \mu \) बढ़ाती है, कम शुरू करके और रैंप अप करती है। इसके अतिरिक्त, मोमेंटम ग्रेडिएंट क्लिपिंग के साथ इंटरैक्ट करता है: मोमेंटम अपडेट लागू करने से पहले ग्रेडिएंट्स को क्लिप करना वेग को बहुत बड़ा होने से रोकता है, जो आवर्ती नेटवर्क या अस्थिर ग्रेडिएंट्स वाले मॉडल के प्रशिक्षण के लिए महत्वपूर्ण है। वितरित प्रशिक्षण में, मोमेंटम को समकालिक या अतुल्यकालिक रूप से लागू किया जा सकता है, जिसमें प्रतिलिपि प्रस्तुत करने योग्यता के लिए समकालिक मोमेंटम अधिक सामान्य है।

ऐतिहासिक संदर्भ

अनुकूलन में मोमेंटम की अवधारणा गहरे सीखने से पहले की है। 1960 के दशक में, बर्नार्ड विड्रो और टेड हॉफ ने न्यूनतम माध्य वर्ग फिल्टर विकसित किया, जिसने अपने अपडेट में मोमेंटम का एक रूप उपयोग किया। तंत्रिका नेटवर्क के लिए आधुनिक सूत्रीकरण अक्सर जेफ्री हिंटन के 1986 के काम को श्रेय दिया जाता है, जहां उन्होंने बैकप्रोपेगेशन को तेज करने के तरीके के रूप में 'मोमेंटम विधि' का वर्णन किया। तब से, यह मशीन लर्निंग लाइब्रेरीज़ में एक प्रमुख बन गया है, जिसमें scikit-learn, टेंसरफ्लो और पायटॉर्च में कार्यान्वयन शामिल हैं। इसकी सरलता और प्रभावशीलता ने अधिक जटिल ऑप्टिमाइज़र के प्रसार के बावजूद इसकी निरंतर प्रासंगिकता सुनिश्चित की है।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:optimization·machine-learning·deep-learning
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास