स्टोकेस्टिक वेट एवरेजिंग

अंग्रेज़ी से अनुवादित

स्टोकास्टिक वेट एवरेजिंग (SWA) एक डीप लर्निंग तकनीक है जो प्रशिक्षण पथ के साथ मॉडल वेट्स का औसत निकालती है ताकि सामान्यीकरण में सुधार हो सके, जो अक्सर पारंपरिक प्रशिक्षण की तुलना में चापलूसी मिनिमा और बेहतर प्रदर्शन देती है।

स्टोकेस्टिक वेट एवरेजिंग (SWA) एक मॉडल एवरेजिंग तकनीक है जो डीप लर्निंग में सामान्यीकरण में सुधार करती है, जो तंत्रिका-नेटवर्क के वज़न को उसके प्रशिक्षण प्रक्षेपवक्र के साथ कई बिंदुओं पर औसत करके काम करती है। पारंपरिक प्रशिक्षण के विपरीत, जो केवल अंतिम वज़न को बनाए रखता है, SWA प्रशिक्षण के बाद के चरण के दौरान नियमित अंतराल पर वज़न एकत्र करता है और उनके अंकगणितीय माध्य की गणना करता है। यह सरल प्रक्रिया अक्सर हानि परिदृश्य में चापलूस समाधानों की ओर ले जाती है, जो बेहतर परीक्षण प्रदर्शन और मजबूती से जुड़े होते हैं। SWA को पावेल इज़मेलोव, दिमित्री पोडोप्रिखिन, तिमुर गारिपोव, दिमित्री वेत्रोव और एंड्रयू गॉर्डन विल्सन ने अपने 2018 के पेपर "एवरेजिंग वेट्स लीड्स टू वाइडर ऑप्टिमा एंड बेटर जनरलाइज़ेशन" में पेश किया था। इस विधि के लिए अंतर्निहित मॉडल आर्किटेक्चर या हानि फलन में कोई बदलाव की आवश्यकता नहीं होती है, जिससे इसे मौजूदा प्रशिक्षण पाइपलाइनों में एकीकृत करना आसान हो जाता है।

SWA के पीछे मुख्य विचार यह है कि स्टोकेस्टिक ग्रेडिएंट डिसेंट (SGD) या इसके वेरिएंट के साथ प्रशिक्षण के दौरान, मॉडल पैरामीटर कम हानि वाले क्षेत्र के आसपास दोलन करते हैं। इन पैरामीटरों को औसत करने से दोलनों को सुचारू किया जा सकता है और एक ऐसा समाधान प्राप्त किया जा सकता है जो एक विस्तृत, सपाट न्यूनतम में स्थित होता है। ऐसे सपाट न्यूनतम को तीव्र न्यूनतम की तुलना में बेहतर सामान्यीकरण करने वाला माना जाता है क्योंकि वे प्रशिक्षण और परीक्षण वितरणों के बीच गड़बड़ी और बदलावों के प्रति कम संवेदनशील होते हैं। SWA को विभिन्न आर्किटेक्चर और कार्यों में सटीकता और अंशांकन में सुधार करते हुए दिखाया गया है, जिसमें छवि वर्गीकरण, वस्तु पहचान और भाषा मॉडलिंग शामिल हैं।

तंत्र और एल्गोरिदम

SWA दो चरणों में काम करता है। पहले चरण में, मॉडल को एक मानक सीखने की दर अनुसूची (जैसे, कोसाइन एनीलिंग या स्टेप डिके) के साथ प्रशिक्षित किया जाता है ताकि न्यूनतम के पास के क्षेत्र तक पहुंचा जा सके। दूसरे चरण में, प्रशिक्षण एक स्थिर या चक्रीय सीखने की दर के साथ जारी रहता है, और वज़न प्रत्येक युग के अंत में या पुनरावृत्तियों की एक निश्चित संख्या के बाद एकत्र किए जाते हैं। SWA वज़न को एक चलती औसत के रूप में अद्यतन किया जाता है: n_swa = n_swa + 1; w_swa = (w_swa * (n_swa - 1) + w) / n_swa, जहाँ w वर्तमान वज़न है और w_swa औसत वज़न है। अंतिम मॉडल w_swa का उपयोग करता है।

एक महत्वपूर्ण विवरण यह है कि बैच नॉर्मलाइज़ेशन आँकड़ों की पुनर्गणना औसत के बाद की जानी चाहिए, क्योंकि बैच नॉर्मलाइज़ेशन परतों के चलते माध्य और विचरण को वज़न के साथ औसत नहीं किया जाता है। व्यवहार में, SWA वज़न की गणना के बाद, बैच नॉर्मलाइज़ेशन आँकड़ों को अद्यतन करने के लिए प्रशिक्षण डेटा पर एक फॉरवर्ड पास किया जाता है। यह चरण उन मॉडलों के लिए महत्वपूर्ण है जो बैच नॉर्मलाइज़ेशन का उपयोग करते हैं, जैसे ResNets।

सैद्धांतिक प्रेरणा

SWA की सफलता को अक्सर हानि परिदृश्य ज्यामिति के परिप्रेक्ष्य से समझाया जाता है। इज़मेलोव एट अल। के शोध और बाद के कार्यों ने दिखाया है कि SGD कम-हानि क्षेत्र की सीमा के पास के बिंदुओं पर अभिसरण करता है, जबकि कई बिंदुओं पर औसत समाधान को उस क्षेत्र के केंद्र की ओर ले जाता है। यह केंद्रीय बिंदु आम तौर पर एक चापलूस बेसिन में स्थित होता है, जो बेहतर सामान्यीकरण से जुड़ा होता है। सपाट न्यूनतम और सामान्यीकरण के बीच के संबंध का व्यापक अध्ययन किया गया है, जिसमें PAC-Bayes सीमाओं और हानि फलन की तीव्रता से संबंध हैं।

एक अन्य दृष्टिकोण SWA को बायेसियन अनुमान से जोड़ता है। कुछ मान्यताओं के तहत, SGD के प्रक्षेपवक्र को एक मार्कोव श्रृंखला के रूप में देखा जा सकता है जो एक पश्च वितरण से नमूना लेती है। इस प्रक्षेपवक्र के साथ औसत पश्च माध्य का अनुमान लगाता है, जो वर्ग त्रुटि हानि के लिए बेयस-इष्टतम भविष्यवाणी है। यह व्याख्या SWA को स्टोकेस्टिक ग्रेडिएंट मार्कोव चेन मोंटे कार्लो विधियों से जोड़ती है, हालाँकि SWA सरल है और इसमें शोर पैमानों के सावधानीपूर्वक ट्यूनिंग की आवश्यकता नहीं होती है।

वेरिएंट और विस्तार

प्रदर्शन को और बेहतर बनाने के लिए SWA के कई वेरिएंट प्रस्तावित किए गए हैं। एक उल्लेखनीय विस्तार स्टोकेस्टिक वेट एवरेजिंग गाऊसी (SWAG) है, जिसे वेस्ले मैडॉक्स, तिमुर गारिपोव, पावेल इज़मेलोव, दिमित्री वेत्रोव और एंड्रयू गॉर्डन विल्सन ने 2019 में पेश किया था। SWAG एकत्र किए गए वज़न के पहले और दूसरे क्षणों का उपयोग करके एक गाऊसी फिट करके वज़न के पश्च वितरण का अनुमान लगाता है। यह अनिश्चितता अनुमान और बेहतर अंशांकन की अनुमति देता है, और इसका उपयोग बायेसियन डीप लर्निंग के लिए किया जा सकता है।

एक अन्य वेरिएंट फास्ट ज्योमेट्रिक एन्सेम्बलिंग (FGE) है, जो हानि परिदृश्य के विभिन्न तरीकों से वज़न एकत्र करने के लिए एक चक्रीय सीखने की दर अनुसूची का उपयोग करता है। SWA को और भी बेहतर प्रदर्शन प्राप्त करने के लिए FGE के साथ जोड़ा जा सकता है। इसके अतिरिक्त, SWA को सीखने की दर अनुसूचियों, डेटा संवर्धन और प्रूनिंग जैसी तकनीकों के साथ एकीकृत किया गया है ताकि मजबूती और दक्षता बढ़ाई जा सके।

अनुप्रयोग

SWA को विभिन्न डोमेन में सफलतापूर्वक लागू किया गया है। कंप्यूटर विज़न में, यह CIFAR-10, CIFAR-100 और ImageNet जैसे डेटासेट पर छवि वर्गीकरणकर्ताओं की सटीकता में सुधार करता है। उदाहरण के लिए, SWA को CIFAR-100 पर PreAct ResNet-164 की परीक्षण सटीकता को बिना किसी आर्किटेक्चरल परिवर्तन के 81.15% से बढ़ाकर 82.90% करते हुए दिखाया गया है। वस्तु पहचान में, SWA प्रशिक्षण को स्थिर करने और औसत परिशुद्धता में सुधार करने में मदद करता है।

प्राकृतिक भाषा प्रसंस्करण में, SWA का उपयोग ट्रांसफॉर्मर और बड़े भाषा मॉडल को अधिक प्रभावी ढंग से प्रशिक्षित करने के लिए किया गया है। यह भाषा मॉडलिंग कार्यों में अति-अनुकूलन को कम करने और भ्रम (perplexity) में सुधार करने के लिए दिखाया गया है। SWA जनरेटिव मॉडल जैसे GAN और डिफ्यूज़न मॉडल को भी लाभ पहुँचाता है, जिससे स्मूद वेट अपडेट मिलते हैं, जो अधिक स्थिर प्रशिक्षण और उच्च गुणवत्ता वाले नमूनों की ओर ले जा सकते हैं।

मानक पर्यवेक्षित शिक्षण से परे, SWA को अर्ध-पर्यवेक्षित शिक्षण, स्थानांतरण शिक्षण और डोमेन अनुकूलन के लिए अनुकूलित किया गया है। इसकी सरलता और व्यापकता इसे मशीन लर्निंग चिकित्सक के टूलकिट में एक मूल्यवान उपकरण बनाती है।

अन्य तकनीकों के साथ तुलना

SWA की तुलना अक्सर अन्य नियमितीकरण और एन्सेम्बलिंग विधियों से की जाती है। पारंपरिक एन्सेम्बल के विपरीत, जो कई स्वतंत्र रूप से प्रशिक्षित मॉडलों से भविष्यवाणियों को औसत करते हैं, SWA वज़न को औसत करता है, जो कम्प्यूटेशनल रूप से सस्ता है और केवल एक प्रशिक्षण रन की आवश्यकता होती है। यह इसे विशेष रूप से आकर्षक बनाता है जब मॉडल भंडारण या अनुमान लागत एक चिंता का विषय हो।

ड्रॉपआउट या बैच नॉर्मलाइज़ेशन जैसी तकनीकों की तुलना में, SWA प्रशिक्षण गतिशीलता को संशोधित नहीं करता है, बल्कि वज़न को पोस्ट-प्रोसेस करता है। इसका उपयोग इन विधियों के साथ संयोजन में किया जा सकता है। SWA Adam और अन्य अनुकूली अनुकूलकों से भी भिन्न है, जो प्रति-पैरामीटर सीखने की दर बनाए रखते हैं; SWA आम तौर पर SGD या Adam प्रक्षेपवक्रों के शीर्ष पर लागू होता है।

SWA की एक सीमा यह है कि इसे यह निर्धारित करने के लिए एक अनुसूची की आवश्यकता होती है कि वज़न एकत्र करना कब शुरू करना है। यदि संग्रह बहुत जल्दी शुरू होता है, तो औसत उप-इष्टतम वज़न से प्रभावित हो सकता है; यदि बहुत देर से, लाभ कम हो जाते हैं। हालाँकि, व्यवहार में, एक सरल नियम यह है कि सीखने की दर कम मूल्य पर क्षय होने के बाद संग्रह शुरू करना चाहिए।

व्यावहारिक विचार

SWA को लागू करना सीधा है। अधिकांश डीप लर्निंग फ्रेमवर्क, जैसे PyTorch और TensorFlow, SWA के लिए उपयोगिताएँ या उदाहरण प्रदान करते हैं। मुख्य चरण हैं: (1) मॉडल को एक मानक अनुसूची के साथ प्रशिक्षित करें, (2) एक स्थिर या चक्रीय सीखने की दर के साथ प्रशिक्षण जारी रखें, (3) अंतराल पर वज़न एकत्र करें, (4) चलती औसत की गणना करें, और (5) बैच नॉर्मलाइज़ेशन आँकड़ों की पुनर्गणना करें।

SWA को हाइपरपैरामीटर विकल्पों के प्रति मजबूत दिखाया गया है। दूसरे चरण के लिए सीखने की दर आम तौर पर प्रारंभिक अनुसूची के न्यूनतम मूल्य या एक छोटे स्थिरांक पर सेट की जाती है। वज़न संग्रह की आवृत्ति हर युग या हर कुछ सौ पुनरावृत्तियों में हो सकती है। व्यवहार में, 5 से 20 युगों के लिए वज़न एकत्र करना अक्सर पर्याप्त होता है।

प्रभाव और स्वागत

SWA की शुरुआत का डीप लर्निंग समुदाय पर महत्वपूर्ण प्रभाव पड़ा है। इसने अनुमान के दौरान अतिरिक्त कम्प्यूटेशनल लागत के बिना सामान्यीकरण में सुधार करने के लिए एक सरल फिर भी प्रभावी विधि प्रदान की। पेपर को व्यापक रूप से उद्धृत किया गया है और इसने वेट एवरेजिंग और सपाट न्यूनतम पर कई अनुवर्ती कार्यों को प्रेरित किया है। SWA अब कई प्रशिक्षण पाइपलाइनों में एक मानक तकनीक है, विशेष रूप से शैक्षणिक अनुसंधान और प्रतियोगिताओं में।

SWA ने अन्य एवरेजिंग विधियों के विकास को भी प्रभावित किया है, जैसे एक्सपोनेंशियल मूविंग एवरेज (EMA), जो आमतौर पर जनरेटिव मॉडल और बड़े भाषा मॉडल के प्रशिक्षण में उपयोग किया जाता है। EMA एक वेरिएंट है जो हाल के वज़न को अधिक महत्व देता है, और इसकी सरलता और प्रभावशीलता के कारण अक्सर व्यवहार में उपयोग किया जाता है। SWA और EMA पूरक हैं, और कुछ फ्रेमवर्क उनके बीच स्विच करने की अनुमति देते हैं।

सीमाएँ और भविष्य की दिशाएँ

इसके लाभों के बावजूद, SWA की सीमाएँ हैं। यह मानता है कि हानि परिदृश्य अपेक्षाकृत चिकना है और वज़न का औसत सार्थक है, जो सभी आर्किटेक्चर या कार्यों के लिए सत्य नहीं हो सकता है। उदाहरण के लिए, बैच नॉर्मलाइज़ेशन वाले मॉडल को सावधानीपूर्वक संभालने की आवश्यकता होती है, और जटिल पैरामीटर स्थान वाले मॉडल (जैसे, आवर्ती नेटवर्क) को उतना लाभ नहीं हो सकता है। इसके अतिरिक्त, SWA अनिश्चितता अनुमान प्रदान नहीं करता है जब तक कि इसे विस्तारित न किया जाए (जैसे, SWAG)।

भविष्य के शोध दिशाओं में अनुकूली एवरेजिंग अनुसूचियों का विकास, SWA को बायेसियन विधियों के साथ जोड़ना, और SWA को सुदृढीकरण सीखने और संघीय सीखने जैसे नए डोमेन में लागू करना शामिल है। जैसे-जैसे डीप लर्निंग विकसित होती रहेगी, SWA जैसी वेट एवरेजिंग तकनीकें मॉडल प्रदर्शन और विश्वसनीयता में सुधार के लिए एक मौलिक उपकरण बनी रहेंगी।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:optimization·deep-learning·model-averaging·generalization
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास