अंग्रेज़ी से अनुवादित

AdaDelta एक अनुकूली सीखने की दर अनुकूलन एल्गोरिथ्म है जो तंत्रिका नेटवर्क को प्रशिक्षित करने के लिए उपयोग किया जाता है, जिसे 2012 में RMSProp के विस्तार के रूप में पेश किया गया था, जो मैन्युअल रूप से निर्धारित सीखने की दर की आवश्यकता को समाप्त करता है।

AdaDelta एक अनुकूली अधिगम दर अनुकूलन एल्गोरिथ्म है जिसे तंत्रिका नेटवर्क के प्रशिक्षण के लिए डिज़ाइन किया गया है। इसे 2012 में मैथ्यू डी. ज़ीलर द्वारा पेपर "ADADELTA: An Adaptive Learning Rate Method" में प्रस्तुत किया गया था। यह विधि RMSProp पर आधारित है, लेकिन उपयोगकर्ता द्वारा निर्दिष्ट प्रारंभिक अधिगम दर की आवश्यकता को हटा देती है, इसके बजाय पिछले ग्रेडिएंट्स और पैरामीटर अपडेट्स की एक खिड़की से प्रति-पैरामीटर चरण आकार प्राप्त करती है। यह उन परिदृश्यों में विशेष रूप से उपयोगी है जहां वैश्विक अधिगम दर को ट्यून करना कठिन होता है या जहां हानि परिदृश्य पैरामीटरों के बीच महत्वपूर्ण रूप से भिन्न होता है।

AdaDelta की मुख्य नवीनता दो घातीय रूप से क्षय होने वाले औसतों के उपयोग में निहित है: एक वर्गित ग्रेडिएंट्स के लिए और दूसरा वर्गित पैरामीटर अपडेट्स के लिए। स्टोकेस्टिक ग्रेडिएंट डीसेंट के उन प्रकारों के विपरीत जो एक निश्चित या अनुसूचित अधिगम दर पर निर्भर करते हैं, AdaDelta चरण आकार की गणना हाल के अपडेट्स के मूल माध्य वर्ग और हाल के ग्रेडिएंट्स के मूल माध्य वर्ग के अनुपात के रूप में करता है। यह अनुपात आयामहीन है और ग्रेडिएंट्स के पैमाने के अनुसार स्वचालित रूप से अनुकूलित हो जाता है, जो एल्गोरिथ्म को मैन्युअल हस्तक्षेप के बिना गहरे नेटवर्क की विभिन्न परतों में सुसंगत व्यवहार बनाए रखने की अनुमति देता है।

ऐतिहासिक संदर्भ और प्रेरणा

AdaDelta का उद्भव गहन अधिगम अनुकूलन तकनीकों में तेजी से प्रगति के दौर में हुआ। 2010 के दशक की शुरुआत में, लुप्त या विस्फोटक ग्रेडिएंट्स जैसे मुद्दों और अधिगम दर अनुसूचियों की संवेदनशीलता के कारण गहरे नेटवर्क को प्रशिक्षित करना कुख्यात रूप से चुनौतीपूर्ण था। गति (मोमेंटम) और ग्रेडिएंट क्लिपिंग जैसी विधियों ने आंशिक समाधान प्रदान किए, लेकिन उन्हें अभी भी हाइपरपैरामीटरों की सावधानीपूर्वक ट्यूनिंग की आवश्यकता थी। RMSProp, जिसे जेफ्री हिंटन ने 2012 के आसपास अपने व्याख्यान नोट्स में प्रस्तुत किया, वर्गित ग्रेडिएंट्स के चल रहे औसत के साथ अपडेट्स को सामान्य करके ग्रेडिएंट पैमाने की समस्या को संबोधित करता था, लेकिन फिर भी इसे अधिगम दर की आवश्यकता होती थी।

ज़ीलर, तब गूगल में (हालांकि यह काम स्वतंत्र रूप से किया गया था), एक ऐसा अनुकूलक बनाना चाहते थे जो अधिगम दर की पसंद के प्रति मजबूत हो। प्रेरणा व्यावहारिक थी: बड़े पैमाने के प्रयोगों में, उपयुक्त अधिगम दर खोजना अक्सर महत्वपूर्ण समय और कम्प्यूटेशनल संसाधनों की खपत करता था। AdaDelta का डिज़ाइन अनुकूलक को आत्म-ट्यूनिंग बनाने, चिकित्सकों पर बोझ कम करने और विभिन्न समस्याओं में अधिक प्रतिलिपि योग्य परिणाम सक्षम करने के उद्देश्य से किया गया था।

यह पेपर जून 2012 में arXiv पर प्रकाशित हुआ और तुरंत मशीन लर्निंग समुदाय के भीतर ध्यान आकर्षित किया। यह चरण आकार के लिए बिना किसी वैश्विक हाइपरपैरामीटर के पूर्ण रूप से अनुकूली प्रति-आयाम अधिगम दर प्रस्तावित करने वाली पहली विधियों में से एक थी, एक अवधारणा जो बाद में Adam जैसे अन्य अनुकूलकों को प्रभावित करेगी (जो अभी भी अधिगम दर की आवश्यकता रखता है लेकिन डिफ़ॉल्ट 0.001 है)।

गणितीय सूत्रीकरण

AdaDelta प्रत्येक पैरामीटर θ के लिए दो स्थिति चर बनाए रखता है: वर्गित ग्रेडिएंट्स का घातीय गतिशील औसत, जिसे E[g²]_t के रूप में दर्शाया जाता है, और वर्गित पैरामीटर अपडेट्स का घातीय गतिशील औसत, जिसे E[Δθ²]_t के रूप में दर्शाया जाता है। प्रत्येक समय चरण t पर, एल्गोरिथ्म θ के संबंध में हानि के ग्रेडिएंट g_t की गणना करता है।

पहला औसत इस प्रकार अद्यतन किया जाता है:

E[g²]_t = ρ E[g²]_{t-1} + (1 - ρ) g_t²

जहां ρ एक क्षय स्थिरांक है, सामान्यतः 0.95 पर सेट किया जाता है। यह RMSProp में अद्यतन के समान है।

दूसरा औसत वर्गित अपडेट्स को ट्रैक करता है, लेकिन इसे वर्तमान चरण के पैरामीटर परिवर्तन का उपयोग करके अद्यतन किया जाता है। पैरामीटर अपडेट्स का मूल माध्य वर्ग (RMS) इस प्रकार गणना की जाती है:

RMS[Δθ]_{t-1} = sqrt(E[Δθ²]_{t-1} + ε)

जहां ε एक छोटा स्थिरांक है (अक्सर 1e-6) जो शून्य से विभाजन से बचने के लिए होता है। पैरामीटर अद्यतन तब होता है:

Δθ_t = - (RMS[Δθ]_{t-1} / RMS[g]_t) * g_t

जहां RMS[g]_t = sqrt(E[g²]_t + ε)। अद्यतन लागू करने के बाद, एल्गोरिथ्म नए गणना किए गए Δθ_t का उपयोग करके E[Δθ²]_t को अद्यतन करता है:

E[Δθ²]_t = ρ E[Δθ²]_{t-1} + (1 - ρ) Δθ_t²

यह सूत्रीकरण सुनिश्चित करता है कि चरण आकार हाल के अपडेट्स के मूल माध्य वर्ग और हाल के ग्रेडिएंट्स के मूल माध्य वर्ग का अनुपात है। क्योंकि अंश और हर दोनों की इकाइयां समान हैं (वर्गित पैरामीटर मान), परिणामी चरण आकार इकाईहीन है, यही कारण है कि इस विधि को अधिगम दर की आवश्यकता नहीं होती है। क्षय स्थिरांक ρ गतिशील औसतों की खिड़की के आकार को नियंत्रित करता है, जिसमें बड़े मान पिछले इतिहास को अधिक महत्व देते हैं।

RMSProp और Adam के साथ तुलना

AdaDelta को अक्सर RMSProp का एक विस्तार के रूप में वर्णित किया जाता है क्योंकि यह समान ग्रेडिएंट स्केलिंग तंत्र का उपयोग करता है। मुख्य अंतर यह है कि RMSProp ग्रेडिएंट्स के मूल माध्य वर्ग द्वारा ग्रेडिएंट को विभाजित करता है और फिर एक निश्चित अधिगम दर η से गुणा करता है। इसके विपरीत, AdaDelta उस निश्चित η को पिछले पैरामीटर अपडेट्स के मूल माध्य वर्ग से बदल देता है। यह प्रतिस्थापन चरण आकार को न केवल ग्रेडिएंट परिमाण के लिए बल्कि हानि फलन की वक्रता के लिए भी अनुकूली बनाता है, जैसा कि वास्तविक अपडेट्स में परिलक्षित होता है।

Adam की तुलना में, जिसे 2015 में डिडेरिक किंग्मा और जिमी बा ने प्रस्तुत किया, AdaDelta ग्रेडिएंट्स के दूसरे क्षणों का उपयोग करने का विचार साझा करता है। हालांकि, Adam पहले क्षण अनुमान के माध्यम से गति (मोमेंटम) को भी शामिल करता है और प्रारंभिक समय चरणों के लिए पूर्वाग्रह सुधार का उपयोग करता है। Adam को अभी भी अधिगम दर की आवश्यकता होती है, हालांकि इसका डिफ़ॉल्ट मान 0.001 कई अनुप्रयोगों में अच्छा काम करता है। इसके विपरीत, AdaDelta में कोई अधिगम दर हाइपरपैरामीटर नहीं है, जो उन परिदृश्यों में एक लाभ हो सकता है जहां इष्टतम अधिगम दर अज्ञात है या कार्यों के बीच भिन्न होती है।

अनुभवजन्य अध्ययनों से पता चला है कि AdaDelta अक्सर कई मानक बेंचमार्क पर Adam के समान प्रदर्शन करता है, लेकिन उन स्थितियों में अधिक स्थिर हो सकता है जहां ग्रेडिएंट परिमाण समय के साथ भारी रूप से बदलते हैं। हालांकि, Adam की गति अवधि कुछ गैर-उत्तल समस्याओं में स्थानीय न्यूनतम से बचने में अधिक प्रभावी ढंग से मदद कर सकती है। 2020 के दशक के मध्य तक, Adam और इसके प्रकार (जैसे AdamW) अभ्यास में अधिक व्यापक रूप से उपयोग किए जाते हैं, विशेष रूप से ट्रांसफॉर्मर और बड़े भाषा मॉडल के प्रशिक्षण में, लेकिन AdaDelta एक प्रासंगिक आधार रेखा बना हुआ है और अभी भी कुछ क्षेत्रों में उपयोग किया जाता है जहां इसके गुण फायदेमंद होते हैं।

कार्यान्वयन विवरण और प्रकार

व्यवहार में, AdaDelta को लागू करने के लिए प्रति पैरामीटर दो अतिरिक्त वेक्टर संग्रहीत करने की आवश्यकता होती है, जो सादे SGD की तुलना में मेमोरी फुटप्रिंट को दोगुना करता है। यह Adam की मेमोरी आवश्यकताओं के समान है। क्षय स्थिरांक ρ सामान्यतः 0.95 पर सेट किया जाता है, और एप्सिलॉन ε को संख्यात्मक स्थिरता सुनिश्चित करने के लिए 1e-6 जैसे छोटे मान पर सेट किया जाता है। कुछ कार्यान्वयन थोड़ा अलग एप्सिलॉन प्लेसमेंट का उपयोग करते हैं, इसे वर्गमूल के भीतर जोड़ते हैं बजाय बाहर, लेकिन प्रभाव नगण्य है।

एक सामान्य प्रकार AdaDelta को भार आरंभीकरण योजनाओं और बैच सामान्यीकरण के साथ जोड़कर प्रशिक्षण को और स्थिर करना है। यह विधि डेटा संवर्धन और पाठ्यक्रम अधिगम रणनीतियों के साथ भी संगत है। वितरित प्रशिक्षण सेटिंग्स में, AdaDelta का उपयोग तुल्यकालिक या अतुल्यकालिक अपडेट्स के साथ किया जा सकता है, हालांकि विचलन से बचने के लिए गतिशील औसतों को श्रमिकों के बीच समकालिक किया जाना चाहिए।

TensorFlow, PyTorch और JAX सहित कई गहन अधिगम फ्रेमवर्क AdaDelta के अंतर्निर्मित कार्यान्वयन प्रदान करते हैं। उदाहरण के लिए, PyTorch का torch.optim.Adadelta उपयोगकर्ताओं को rho और eps पैरामीटर निर्दिष्ट करने की अनुमति देता है, जिसमें डिफ़ॉल्ट क्रमशः 0.9 और 1e-6 हैं (ध्यान दें कि PyTorch में डिफ़ॉल्ट rho 0.9 है, जो मूल पेपर के 0.95 से भिन्न है)। यह अंतर अलग व्यवहार का कारण बन सकता है, इसलिए चिकित्सकों को अपने चुने हुए फ्रेमवर्क में विशिष्ट डिफ़ॉल्टों के बारे में जागरूक होना चाहिए।

अनुप्रयोग और उपयोग के मामले

AdaDelta को मशीन लर्निंग कार्यों की एक विस्तृत श्रृंखला पर लागू किया गया है, जिसमें छवि वर्गीकरण, वाक् पहचान और प्राकृतिक भाषा प्रसंस्करण शामिल हैं। 2010 के दशक की शुरुआत में, इसका उपयोग CIFAR-10 और ImageNet जैसे डेटासेट पर गहरे संवॉल्यूशनल नेटवर्क को प्रशिक्षित करने के लिए किया गया था, जिसमें गति के साथ SGD की तुलना में कम हाइपरपैरामीटर ट्यूनिंग के साथ प्रतिस्पर्धी परिणाम प्राप्त हुए। यह अनुक्रम मॉडलिंग के लिए आवर्तक तंत्रिका नेटवर्क में भी उपयोग पाया गया, जहां ग्रेडिएंट परिमाण समय चरणों के बीच महत्वपूर्ण रूप से भिन्न हो सकते हैं।

AdaDelta का एक उल्लेखनीय लाभ प्रारंभिक पैरामीटरों की पसंद के प्रति इसकी मजबूती है। क्योंकि इसे अधिगम दर की आवश्यकता नहीं होती है, यह अक्सर स्वचालित मशीन लर्निंग पाइपलाइनों या नई वास्तुकलाओं को बेंचमार्क करते समय डिफ़ॉल्ट अनुकूलक के रूप में उपयोग किया जाता है। उदाहरण के लिए, टोरंटो विश्वविद्यालय और स्टैनफोर्ड एआई लैब के शोधकर्ताओं ने अनुकूलन एल्गोरिथ्मों की तुलना करने वाले अध्ययनों में AdaDelta का उपयोग किया है, हालांकि यह जनरेटिव एआई मॉडल में कम आम है, जो आमतौर पर Adam को पसंद करते हैं।

सुदृढीकरण अधिगम में, AdaDelta का उपयोग निरंतर नियंत्रण कार्यों के लिए नीतियों को प्रशिक्षित करने के लिए किया गया है, जहां पुरस्कार संकेत शोरगुल वाला हो सकता है और ग्रेडिएंट पैमाना भिन्न होता है। इसका अनुकूली चरण आकार मैन्युअल शेड्यूलिंग के बिना स्थिर अपडेट्स बनाए रखने में मदद करता है। हालांकि, हाल के वर्षों में, Adam और LAMB जैसे अधिक उन्नत अनुकूलक बड़े पैमाने के प्रशिक्षण में अधिक लोकप्रिय हो गए हैं, आंशिक रूप से अधिगम दर वार्मअप और ग्रेडिएंट क्लिपिंग तकनीकों के साथ उनकी संगतता के कारण।

सैद्धांतिक गुण और सीमाएं

सैद्धांतिक दृष्टिकोण से, AdaDelta को विकर्ण पूर्व शर्तित ग्रेडिएंट डीसेंट विधि के रूप में देखा जा सकता है, जहां पूर्व शर्तक ग्रेडिएंट्स और अपडेट्स के इतिहास के आधार पर ऑनलाइन अद्यतन किया जाता है। यह प्राकृतिक ग्रेडिएंट विधियों के समान है लेकिन सरल अनुमान के साथ। यह विधि सुनिश्चित करती है कि चरण आकार हमेशा सकारात्मक और परिबद्ध हो, बशर्ते ग्रेडिएंट्स परिबद्ध हों, जो उत्तल सेटिंग्स में अभिसरण में मदद करता है। हालांकि, गैर-उत्तल उद्देश्यों के लिए औपचारिक अभिसरण प्रमाण सीमित हैं, जैसा कि अनुकूली विधियों के लिए सामान्य है।

AdaDelta की एक सीमा यह है कि यह ρ की पसंद के प्रति संवेदनशील हो सकता है। यदि ρ बहुत छोटा है, गतिशील औसत पिछली जानकारी को जल्दी से भूल जाते हैं, जिससे अस्थिर अपडेट्स होते हैं; यदि बहुत बड़ा है, एल्गोरिथ्म हानि परिदृश्य में परिवर्तनों पर धीरे-धीरे प्रतिक्रिया कर सकता है। अधिगम दर की कमी का अर्थ यह भी है कि उपयोगकर्ता के पास समग्र चरण आकार पर कम नियंत्रण होता है, जो एक नुकसान हो सकता है जब एक विशिष्ट चरण आकार ज्ञात हो कि अच्छा काम करता है।

एक और मुद्दा यह है कि AdaDelta की अद्यतन नियम कभी-कभी प्रशिक्षण के प्रारंभिक चरणों में बहुत छोटे चरण आकार का कारण बन सकता है, क्योंकि प्रारंभिक E[Δθ²] शून्य होता है। यह एप्सिलॉन शब्द द्वारा कम किया जाता है, लेकिन यह शुरुआत में अभिसरण को धीमा कर सकता है। कुछ कार्यान्वयन इससे बचने के लिए E[Δθ²] को एक छोटे सकारात्मक मान से आरंभ करते हैं, लेकिन यह एक अतिरिक्त हाइपरपैरामीटर पेश करता है।

विरासत और प्रभाव

AdaDelta की शुरुआत ने गहन अधिगम में अनुकूली अनुकूलन विधियों के व्यापक रुझान में योगदान दिया। इसने प्रदर्शित किया कि एक अधिगम दर को पूरी तरह से समाप्त किया जा सकता है, जिसने हाइपरपैरामीटर-मुक्त अनुकूलकों में बाद के शोध को प्रेरित किया। हालांकि इसे Adam के समान व्यापक अपनाने की सफलता नहीं मिली, यह अनुकूलन टूलकिट का एक महत्वपूर्ण हिस्सा बना हुआ है और अक्सर गहन अधिगम तकनीकों पर पाठ्यपुस्तकों और सर्वेक्षण पेपरों में उद्धृत किया जाता है।

यह विधि मूल पेपर में अपने स्पष्ट और संक्षिप्त प्रदर्शन के लिए भी उल्लेखनीय है, जिसमें कई बेंचमार्क कार्यों पर विस्तृत व्युत्पत्तियां और प्रयोग शामिल थे। ज़ीलर के काम ने Adam और AMSGrad जैसे बाद के विकासों को प्रभावित किया, जिन्होंने अनुकूली विधियों की कुछ सैद्धांतिक कमियों को संबोधित किया। 2020 के दशक तक, AdaDelta अभी भी प्रमुख गहन अधिगम पुस्तकालयों में शामिल है और कभी-कभी अनुसंधान में उपयोग किया जाता है जब अधिगम-दर-मुक्त अनुकूलक की इच्छा होती है, हालांकि इसका व्यावहारिक उपयोग अधिक आधुनिक विकल्पों के सापेक्ष घट गया है।

संक्षेप में, AdaDelta तंत्रिका नेटवर्क के लिए अनुकूलन एल्गोरिथ्मों के विकास में एक महत्वपूर्ण कदम का प्रतिनिधित्व करता है, जो मैन्युअल ट्यूनिंग के बिना चरण आकार को अनुकूलित करने का एक सैद्धांतिक तरीका प्रदान करता है। इसकी विरासत बाद के अनुकूलकों के डिज़ाइन में और मजबूत, आत्म-ट्यूनिंग प्रशिक्षण प्रक्रियाओं की चल रही खोज में बनी हुई है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:optimization·deep-learning·machine-learning·neural-networks
इस पृष्ठ को अंतिम बार संपादित किया गया 9 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास