अंग्रेज़ी से अनुवादित

मोमेंटम ऑप्टिमाइज़र एक तकनीक है जो वेग वेक्टर को संचित करके ग्रेडिएंट डिसेंट को तेज़ करती है, अपडेट को स्मूथ करती है और न्यूरल नेटवर्क प्रशिक्षण में अभिसरण को गति देती है।

मोमेंटम ऑप्टिमाइज़र ग्रेडिएंट-आधारित अनुकूलन को तेज़ करने की एक विधि है, विशेष रूप से तंत्रिका नेटवर्क के प्रशिक्षण में। इसे मानक स्टोकेस्टिक ग्रेडिएंट डिसेंट (SGD) की धीमी अभिसरण और दोलन समस्याओं को संबोधित करने के लिए पेश किया गया था। पिछले ग्रेडिएंट्स से जानकारी ले जाने वाले वेग वेक्टर को संचित करके, मोमेंटम अद्यतन प्रक्षेपवक्र को सुचारू करता है और ऑप्टिमाइज़र को सुसंगत दिशाओं में तेज़ी से आगे बढ़ने की अनुमति देता है, जबकि उच्च-वक्रता क्षेत्रों में दोलनों को कम करता है। यह तकनीक मशीन लर्निंग और गहन शिक्षण में मौलिक है, जो Adam और RMSProp जैसे कई आधुनिक ऑप्टिमाइज़रों का आधार बनती है।

मोमेंटम का मूल विचार पहाड़ी से लुढ़कती गेंद के समान है: यह उतरते समय गति प्राप्त करती है, और इसकी गति वर्तमान ग्रेडिएंट और पिछले वेग दोनों से प्रभावित होती है। गणितीय रूप से, मोमेंटम के लिए अद्यतन नियम है: v_t = μ v_{t-1} - η ∇L(θ_t), θ_{t+1} = θ_t + v_t, जहाँ v वेग वेक्टर है, μ मोमेंटम गुणांक है (आमतौर पर 0.9), η सीखने की दर है, और ∇L हानि फलन का ग्रेडिएंट है। यह सूत्रीकरण 1980 के दशक में यूरी नेस्टरोव द्वारा लोकप्रिय किया गया था, जिन्होंने नेस्टरोव त्वरित ग्रेडिएंट (NAG) नामक एक संस्करण भी प्रस्तावित किया, जो एक आगे की ओर देखने वाले स्थान पर ग्रेडिएंट का मूल्यांकन करता है, जिससे और भी तेज़ अभिसरण मिलता है।

ऐतिहासिक विकास

अनुकूलन में मोमेंटम की अवधारणा आधुनिक गहन शिक्षण से पहले की है। 1964 में, बर्नार्ड विड्रो और मार्शियन हॉफ ने न्यूनतम माध्य वर्ग (LMS) एल्गोरिथ्म पेश किया, जिसमें अद्यतनों को स्थिर करने के लिए मोमेंटम का एक रूप शामिल था। हालाँकि, ग्रेडिएंट डिसेंट के लिए औपचारिक मोमेंटम विधि 1964 में बोरिस पोल्याक द्वारा पेश की गई थी, जिन्होंने हेवी-बॉल विधि का प्रस्ताव रखा। इस विधि को बाद में 1983 में यूरी नेस्टरोव द्वारा अपनी त्वरित ग्रेडिएंट विधि के साथ परिष्कृत किया गया, जिसने उत्तल समस्याओं के लिए इष्टतम अभिसरण दर प्राप्त की। 1980 और 1990 के दशक में, मोमेंटम तंत्रिका नेटवर्क के प्रशिक्षण में एक मानक उपकरण बन गया, जैसा कि डेविड ई. रुमेलहार्ट, जेफ्री हिंटन और रोनाल्ड विलियम्स की पाठ्यपुस्तकों में प्रलेखित है, जिन्होंने बैकप्रोपेगेशन को लोकप्रिय बनाया और सीखने को गति देने के लिए मोमेंटम का उपयोग किया।

गणितीय सूत्रीकरण

मोमेंटम ऑप्टिमाइज़र मानक SGD अद्यतन में एक वेग पद जोड़कर संशोधित करता है। मानक SGD अद्यतन है θ_{t+1} = θ_t - η ∇L(θ_t)। मोमेंटम के साथ, अद्यतन बन जाता है: v_t = μ v_{t-1} - η * ∇L(θ_t), θ_{t+1} = θ_t + v_t। यहाँ, μ मोमेंटम गुणांक है, जो आमतौर पर 0.5 और 0.9 के बीच सेट किया जाता है। एक उच्च μ पिछले ग्रेडिएंट्स को अधिक भार देता है, जिससे नई ग्रेडिएंट दिशाओं के प्रति सुचारू लेकिन संभावित रूप से धीमी प्रतिक्रियाएँ होती हैं। वेग वेक्टर v पिछले ग्रेडिएंट्स का एक घातीय रूप से क्षय होने वाला औसत संचित करता है। यह औसत अद्यतनों में भिन्नता को कम करता है, जो विशेष रूप से तब लाभकारी होता है जब ग्रेडिएंट शोरगुल वाले होते हैं, जैसे कि मिनी-बैच के साथ स्टोकेस्टिक ग्रेडिएंट डिसेंट में।

नेस्टरोव त्वरित ग्रेडिएंट (NAG) एक संस्करण है जो एक आगे की ओर देखने वाले बिंदु पर ग्रेडिएंट की गणना करता है: v_t = μ v_{t-1} - η ∇L(θ_t + μ * v_{t-1}), θ_{t+1} = θ_t + v_t। यह आगे की ओर देखना NAG को भविष्य की "झलक" देता है, जिससे यह अपने पाठ्यक्रम को अधिक तेज़ी से सही कर सकता है और कई सेटिंग्स में तेज़ अभिसरण प्राप्त कर सकता है। व्यवहार में, NAG अक्सर मानक मोमेंटम से बेहतर प्रदर्शन करता है, विशेष रूप से उत्तल समस्याओं और गहरे नेटवर्क के लिए।

तंत्रिका नेटवर्क के प्रशिक्षण में भूमिका

गहरे तंत्रिका नेटवर्क के प्रशिक्षण में, मोमेंटम व्यापक रूप से अभिसरण को तेज़ करने और स्थिरता में सुधार करने के लिए उपयोग किया जाता है। मोमेंटम के बिना, SGD खड़ी दिशाओं के साथ दोलन कर सकता है और उथली दिशाओं के साथ धीरे-धीरे आगे बढ़ सकता है। मोमेंटम ग्रेडिएंट्स को औसत करके दोलनों को कम करता है, जिससे ऑप्टिमाइज़र को सुसंगत दिशाओं में बड़े कदम उठाने की अनुमति मिलती है। यह कई परतों वाली गहरी वास्तुकला के प्रशिक्षण के लिए विशेष रूप से महत्वपूर्ण है, जहाँ हानि परिदृश्य अत्यधिक गैर-उत्तल होता है और इसमें कई स्थानीय न्यूनतम और सैडल बिंदु होते हैं। मोमेंटम वेग संचित करके सैडल बिंदुओं से बचने में मदद करता है, जो ऑप्टिमाइज़र को सपाट क्षेत्रों से आगे ले जा सकता है।

आधुनिक गहन शिक्षण ढाँचे, जैसे TensorFlow और PyTorch, अपने SGD ऑप्टिमाइज़रों में मोमेंटम को एक मानक पैरामीटर के रूप में शामिल करते हैं। उदाहरण के लिए, PyTorch का torch.optim.SGD एक momentum तर्क स्वीकार करता है, और TensorFlow के tf.keras.optimizers.SGD में एक momentum पैरामीटर है। ये कार्यान्वयन चिकित्सकों को अपने प्रशिक्षण पाइपलाइनों में आसानी से मोमेंटम जोड़ने की अनुमति देते हैं।

विविधताएँ और विस्तार

कई ऑप्टिमाइज़र मोमेंटम अवधारणा पर आधारित हैं। सबसे उल्लेखनीय Adam (अनुकूली क्षण अनुमान) है, जिसे 2015 में डीडेरिक पी. किंगमा और जिमी बा द्वारा पेश किया गया था। Adam मोमेंटम को प्रति-पैरामीटर अनुकूली सीखने की दरों के साथ जोड़ता है, ग्रेडिएंट्स के पहले क्षण (माध्य) और दूसरे क्षण (अकेंद्रित विचरण) दोनों का उपयोग करता है। यह Adam को विरल ग्रेडिएंट्स और शोरगुल वाले डेटा के प्रति मजबूत बनाता है, और यह गहन शिक्षण के लिए सबसे लोकप्रिय ऑप्टिमाइज़रों में से एक बन गया है। RMSProp, जिसे जेफ्री हिंटन ने अपने व्याख्यान नोट्स में पेश किया, सीखने की दर को सामान्य करने के लिए वर्ग ग्रेडिएंट्स के चलते औसत का उपयोग करता है, और यह मोमेंटम का एक रूप भी शामिल करता है। अन्य विविधताओं में AdaGrad शामिल है, जो ऐतिहासिक ग्रेडिएंट्स के आधार पर सीखने की दरों को अनुकूलित करता है, और Nadam, जो नेस्टरोव मोमेंटम को Adam के साथ जोड़ता है।

व्यावहारिक विचार

मोमेंटम का उपयोग करते समय, मोमेंटम गुणांक μ का चुनाव महत्वपूर्ण है। एक सामान्य डिफ़ॉल्ट 0.9 है, लेकिन बहुत शोरगुल वाले ग्रेडिएंट्स के लिए 0.95 या 0.99 जैसे मान उपयोग किए जाते हैं। सीखने की दर η को मोमेंटम के साथ मिलकर ट्यून किया जाना चाहिए; एक उच्च मोमेंटम अक्सर बड़ी सीखने की दर की अनुमति देता है, लेकिन बहुत अधिक सीखने की दर विचलन का कारण बन सकती है। व्यवहार में, सीखने की दर अनुसूचियाँ (जैसे चरण क्षय या कोसाइन एनीलिंग) अक्सर अच्छे प्रदर्शन को प्राप्त करने के लिए मोमेंटम के साथ संयुक्त होती हैं। इसके अतिरिक्त, वजन क्षय (L2 नियमितीकरण) अक्सर मोमेंटम से अलग लागू किया जाता है, जैसे AdamW में, हस्तक्षेप से बचने के लिए।

मोमेंटम अन्य अनुकूलन संदर्भों में भी उपयोग किया जाता है, जैसे बड़े भाषा मॉडल और ट्रांसफार्मर का प्रशिक्षण। उदाहरण के लिए, GPT और BERT जैसे मॉडलों का प्रशिक्षण अक्सर मोमेंटम के साथ Adam का उपयोग करता है, जो बड़े पैरामीटर स्थानों और मिनी-बैच प्रशिक्षण से शोरगुल वाले ग्रेडिएंट्स को संभालने में मदद करता है।

अन्य ऑप्टिमाइज़रों के साथ तुलना

सादे SGD की तुलना में, मोमेंटम तेज़ी से अभिसरण करता है और सीखने की दर के प्रति कम संवेदनशील होता है। हालाँकि, यह एक अतिरिक्त हाइपरपैरामीटर (μ) पेश करता है जिसे ट्यून करने की आवश्यकता होती है। Adam जैसे अनुकूली तरीकों की तुलना में, मोमेंटम सरल है और अक्सर कुछ कार्यों में बेहतर सामान्यीकरण करता है, विशेष रूप से कंप्यूटर विज़न के लिए। शोध से पता चला है कि मोमेंटम के साथ SGD कुछ वास्तुकलाओं के लिए Adam की तुलना में बेहतर परीक्षण सटीकता प्राप्त कर सकता है, हालाँकि Adam प्रारंभिक चरण में तेज़ी से अभिसरण करता है। इसने संकर दृष्टिकोणों को जन्म दिया है, जैसे प्रशिक्षण के दौरान Adam से मोमेंटम के साथ SGD पर स्विच करना।

प्रभाव और विरासत

मोमेंटम ऑप्टिमाइज़र ने कृत्रिम बुद्धिमत्ता के क्षेत्र पर गहरा प्रभाव डाला है। यह अनुकूलन टूलबॉक्स में एक मौलिक उपकरण है, जो गहरे नेटवर्क के प्रशिक्षण को सक्षम बनाता है जो अन्यथा अव्यावहारिक होता। इसके सिद्धांतों को कई अन्य ऑप्टिमाइज़रों तक विस्तारित किया गया है, और यह अनुसंधान और उद्योग में एक मानक आधार रेखा बना हुआ है। मोमेंटम की अवधारणा ने अन्य क्षेत्रों को भी प्रभावित किया है, जैसे सुदृढीकरण सीखना और जनरेटिव एआई, जहाँ इसका उपयोग प्रशिक्षण को स्थिर करने के लिए किया जाता है।

संदर्भ और आगे पढ़ना

एक व्यापक समझ के लिए, पाठकों को पोल्याक (1964) और नेस्टरोव (1983) के मूल पत्रों के साथ-साथ इयान गुडफेलो, योशुआ बेंगियो और आरोन कुर्विल की गहन शिक्षण पाठ्यपुस्तकों का पता लगाने के लिए प्रोत्साहित किया जाता है, जो मोमेंटम को विस्तार से कवर करते हैं। ऑनलाइन संसाधन, जैसे PyTorch और TensorFlow के दस्तावेज़, मोमेंटम को लागू करने पर व्यावहारिक मार्गदर्शन प्रदान करते हैं।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:optimization·deep-learning·machine-learning·neural-networks
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास