अंग्रेज़ी से अनुवादित

स्व-आसवन एक मशीन लर्निंग तकनीक है जिसमें एक मॉडल अपने स्वयं के पूर्वानुमानों को नरम लक्ष्य के रूप में उपयोग करके स्वयं को प्रशिक्षित करता है, जिसमें शिक्षक और छात्र समान वास्तुकला होते हैं, जो अक्सर सामान्यीकरण और अंशांकन में सुधार करता है।

स्व-आसवन (self-distillation) ज्ञान आसवन का एक रूप है, जिसमें एक ही तंत्रिका नेटवर्क शिक्षक और छात्र दोनों की भूमिका निभाता है। पारंपरिक आसवन के विपरीत, जहां एक बड़ा या अधिक जटिल मॉडल एक छोटे मॉडल का मार्गदर्शन करता है, स्व-आसवन दोनों भूमिकाओं के लिए समान वास्तुकला का उपयोग करता है। मॉडल प्रशिक्षण डेटा पर नरम पूर्वानुमान (संभाव्यता वितरण) उत्पन्न करता है, और इन पूर्वानुमानों का उपयोग वास्तविक लेबल के साथ अतिरिक्त प्रशिक्षण लक्ष्यों के रूप में किया जाता है। यह प्रक्रिया पुनरावृत्त रूप से या बहु-पीढ़ी रूप में लागू की जा सकती है, जहां मॉडल की प्रत्येक पीढ़ी पिछली पीढ़ी के आउटपुट से सीखती है। यह तकनीक किसी बाहरी शिक्षक मॉडल या अतिरिक्त लेबल किए गए डेटा की आवश्यकता के बिना मॉडल की सटीकता, अंशांकन और मजबूती में सुधार करती दिखाई गई है।

यह अवधारणा ज्ञान आसवन के व्यापक क्षेत्र से उभरी, जिसे 2010 के दशक के मध्य में लोकप्रिय बनाया गया था। मानक आसवन में, एक उच्च-क्षमता वाला शिक्षक नेटवर्क नरम लेबल उत्पन्न करता है जिसे एक छोटा छात्र नेटवर्क अनुकरण करता है, वर्ग समानताओं और अनिश्चितताओं के बारे में ज्ञान स्थानांतरित करता है। स्व-आसवन एक अलग शिक्षक की आवश्यकता को समाप्त करता है, क्योंकि मॉडल अपने स्वयं के ज्ञान को आसवित करता है। यह विशेष रूप से आकर्षक है क्योंकि यह बड़े शिक्षक को प्रशिक्षित करने की कम्प्यूटेशनल लागत से बचाता है और वास्तुकला संबंधी बाधाओं को समाप्त करता है जो अक्सर शिक्षक-छात्र सेटअप के साथ होती हैं। शोधकर्ताओं ने पाया है कि यहां तक कि एक अकेला मॉडल भी, जब अपने स्वयं के नरम लक्ष्यों के साथ प्रशिक्षित होता है, प्रदर्शन में सुधार प्राप्त कर सकता है - यह एक ऐसी घटना है जिसने महत्वपूर्ण सैद्धांतिक और अनुभवजन्य जांच को जन्म दिया है।

तंत्र और प्रशिक्षण प्रक्रिया

एक विशिष्ट स्व-आसवन सेटअप में, प्रशिक्षण प्रक्रिया चरणों में आगे बढ़ती है। पहले, एक तंत्रिका नेटवर्क को कठोर लेबल (वन-हॉट एन्कोडेड ग्राउंड ट्रुथ) और क्रॉस-एन्ट्रॉपी जैसे हानि फलन का उपयोग करके एक मानक वर्गीकरण कार्य पर प्रशिक्षित किया जाता है। इस प्रारंभिक प्रशिक्षण के बाद, मॉडल के सॉफ्टमैक्स आउटपुट प्रत्येक प्रशिक्षण उदाहरण के लिए दर्ज किए जाते हैं। ये नरम आउटपुट, जिन्हें अक्सर संभाव्यता वितरण को तेज या चपटा करने के लिए तापमान-स्केल किया जाता है, शिक्षक के ज्ञान के रूप में कार्य करते हैं। अगले चरण में, समान मॉडल वास्तुकला को पुनः आरंभ किया जाता है (या मौजूदा वज़न को फाइन-ट्यून किया जाता है) और एक संयुक्त हानि का उपयोग करके प्रशिक्षित किया जाता है जिसमें मूल कठोर लेबल और पिछले चरण के नरम लक्ष्य दोनों शामिल होते हैं। तापमान पैरामीटर नरम लक्ष्यों की चिकनाई को नियंत्रित करता है; उच्च तापमान अंतर-वर्ग संबंधों को प्रकट करने वाले नरम वितरण उत्पन्न करते हैं।

यह प्रक्रिया कई पीढ़ियों के लिए दोहराई जा सकती है। उदाहरण के लिए, पीढ़ी 0 में प्रशिक्षित एक मॉडल पीढ़ी 1 के लिए नरम लेबल उत्पन्न करता है, जो फिर पीढ़ी 2 के लिए नरम लेबल उत्पन्न करता है, और इसी तरह आगे। दिलचस्प बात यह है कि प्रदर्शन अक्सर पहले कुछ पीढ़ियों में सुधरता है, इससे पहले कि यह स्थिर हो या थोड़ा गिर जाए। ये लाभ मॉडल को अधिक नियमित निर्णय सीमा सीखने के लिए जिम्मेदार ठहराए जाते हैं, क्योंकि नरम लक्ष्य वर्ग समानताओं के बारे में जानकारी एन्कोड करते हैं जो कठोर लेबल प्रदान नहीं करते हैं। प्रशिक्षण उद्देश्य आमतौर पर क्रॉस-एन्ट्रॉपी हानि को एक आसवन हानि के साथ जोड़ता है, जिसे एक हाइपरपैरामीटर द्वारा भारित किया जाता है जो शिक्षक के नरम लक्ष्यों के प्रभाव को संतुलित करता है।

सैद्धांतिक स्पष्टीकरण

कई सिद्धांत प्रस्तावित किए गए हैं ताकि यह समझाया जा सके कि स्व-आसवन क्यों काम करता है। एक प्रमुख स्पष्टीकरण नरम लक्ष्यों के निहित नियमितीकरण प्रभाव से संबंधित है। कठोर लेबल मॉडल को सभी संभाव्यता द्रव्यमान को सही वर्ग को आवंटित करने के लिए मजबूर करते हैं, जो अति-विश्वसनीय पूर्वानुमानों और अति-अनुकूलन का कारण बन सकता है। इसके विपरीत, नरम लक्ष्य मॉडल को समान वर्गों के बीच संभाव्यता वितरित करने के लिए प्रोत्साहित करते हैं, जो लेबल स्मूथिंग के एक रूप के रूप में कार्य करते हैं। यह मॉडल की शोर के प्रति संवेदनशीलता को कम करता है और सामान्यीकरण में सुधार करता है।

काम की एक अन्य श्रृंखला स्व-आसवन को "डार्क नॉलेज" की अवधारणा से जोड़ती है - यह विचार कि गलत वर्गों के बीच सापेक्ष संभावनाएं उपयोगी जानकारी रखती हैं। जब एक मॉडल को अपने स्वयं के नरम लक्ष्यों पर प्रशिक्षित किया जाता है, तो यह प्रभावी रूप से इस डार्क नॉलेज को बढ़ाता है, जिससे अधिक मजबूत फीचर प्रतिनिधित्व होता है। इसके अतिरिक्त, कुछ शोधकर्ता स्व-आसवन को एन्ट्रॉपी नियमितीकरण के एक रूप के रूप में देखते हैं, जहां मॉडल को बहुत अधिक निश्चित होने के लिए दंडित किया जाता है, इस प्रकार चिकनी निर्णय सीमाओं को बढ़ावा मिलता है।

अनुकूलन परिप्रेक्ष्य से, स्व-आसवन को बूटस्ट्रैपिंग के एक रूप के रूप में देखा जा सकता है। मॉडल अपने स्वयं के पूर्वानुमानों को पुनरावृत्त रूप से परिष्कृत करता है, और प्रत्येक पीढ़ी अगले के लिए थोड़ा बेहतर लक्ष्य प्रदान करती है। यह प्रक्रिया अपेक्षा-अधिकतमीकरण के समान है, जहां मॉडल लक्ष्य उत्पन्न करने और उनके लिए फिट होने के बीच वैकल्पिक होता है। सैद्धांतिक विश्लेषणों से पता चला है कि कुछ शर्तों के तहत, स्व-आसवन एक निश्चित बिंदु पर अभिसरित होता है जो एक अच्छी तरह से अंशांकित मॉडल से मेल खाता है, जिसमें बेहतर सटीकता होती है।

गहन शिक्षण में अनुप्रयोग

स्व-आसवन ने गहन शिक्षण के विभिन्न डोमेनों में अनुप्रयोग पाए हैं। कंप्यूटर विज़न में, इसका उपयोग छवि वर्गीकरण मॉडल को बेहतर बनाने के लिए किया गया है, विशेष रूप से सीमित लेबल किए गए डेटा वाले परिदृश्यों में। उदाहरण के लिए, CIFAR-10 और ImageNet जैसे डेटासेट पर प्रशिक्षित मॉडलों ने स्व-आसवित होने पर लगातार सटीकता में सुधार दिखाया है। यह तकनीक अर्ध-पर्यवेक्षित शिक्षण में भी प्रभावी है, जहां मॉडल अलेबल किए गए डेटा के लिए नरम लेबल उत्पन्न करता है, जिससे प्रभावी प्रशिक्षण सेट का विस्तार होता है।

प्राकृतिक भाषा प्रसंस्करण में, स्व-आसवन को ट्रांसफार्मर-आधारित मॉडलों पर लागू किया गया है, जिसमें बड़े भाषा मॉडल शामिल हैं। उदाहरण के लिए, एक भाषा मॉडल को सुसंगतता और तथ्यात्मक सटीकता में सुधार के लिए अपने स्वयं के उत्पन्न उत्तरों पर प्रशिक्षित किया जा सकता है। यह दृष्टिकोण स्व-प्रशिक्षण से संबंधित है, जहां एक मॉडल अलेबल किए गए कोरपस पर अपने स्वयं के पूर्वानुमानों को पुनरावृत्त रूप से लेबल करता है। स्व-आसवन का उपयोग अनुक्रम-से-अनुक्रम कार्यों, जैसे मशीन अनुवाद, में भी किया गया है, जहां मॉडल के स्वयं के अनुवाद अतिरिक्त प्रशिक्षण डेटा के रूप में कार्य करते हैं।

वर्गीकरण और पीढ़ी से परे, स्व-आसवन को मॉडल प्रूनिंग और संपीड़न के लिए अनुकूलित किया गया है। मॉडल को कम चौड़ाई या गहराई के साथ स्वयं में आसवित करके, शोधकर्ता कॉम्पैक्ट मॉडल प्राप्त कर सकते हैं जो अधिकांश मूल प्रदर्शन को बनाए रखते हैं। यह सीमित कम्प्यूटेशनल संसाधनों वाले एज डिवाइसों पर मॉडल तैनात करने के लिए विशेष रूप से उपयोगी है, जैसे कि क्वालकॉम या एआरएम के उपकरण।

अन्य तकनीकों के साथ संबंध

स्व-आसवन कई अन्य प्रशिक्षण विधियों के साथ वैचारिक समानताएं साझा करता है। यह पाठ्यक्रम शिक्षण से निकटता से संबंधित है, जहां प्रशिक्षण उदाहरणों को एक सार्थक क्रम में प्रस्तुत किया जाता है। स्व-आसवन में, नरम लक्ष्यों को पाठ्यक्रम के एक रूप के रूप में देखा जा सकता है, क्योंकि वे धीरे-धीरे मॉडल की समझ को परिष्कृत करते हैं। यह डेटा संवर्द्धन के साथ भी ओवरलैप करता है, क्योंकि नरम लक्ष्य प्रभावी रूप से नए प्रशिक्षण संकेत बनाते हैं। कुछ शोधकर्ताओं ने नियमितीकरण को और बढ़ाने के लिए स्व-आसवन को ड्रॉपआउट और बैच सामान्यीकरण के साथ जोड़ा है।

यह तकनीक AI फीडबैक से सुदृढीकरण शिक्षण से भी जुड़ी हुई है, जहां एक मॉडल सुधार के लिए अपने या किसी अन्य मॉडल के फीडबैक का उपयोग करता है। स्व-आसवन में, फीडबैक मॉडल का अपना संभाव्यता वितरण होता है, जो एक नरम इनाम संकेत के रूप में कार्य करता है। इसके अतिरिक्त, स्व-आसवन को ज्ञान आसवन के एक विशेष मामले के रूप में देखा जा सकता है, जहां शिक्षक और छात्र समान वास्तुकला साझा करते हैं, विशिष्ट विषम सेटअप के विपरीत।

अनुभवजन्य निष्कर्ष और बेंचमार्क

अनुभवजन्य अध्ययनों ने प्रदर्शित किया है कि स्व-आसवन लगातार कई वास्तुकलाओं और डेटासेटों पर परीक्षण सटीकता में सुधार करता है। उदाहरण के लिए, CIFAR-100 पर, स्व-आसवित अवशिष्ट नेटवर्क ने केवल कठोर लेबल के साथ प्रशिक्षित बेसलाइन की तुलना में 1-2% सटीकता सुधार प्राप्त करने की सूचना दी है। ImageNet पर, लाभ छोटे लेकिन अभी भी महत्वपूर्ण हैं, अक्सर लगभग 0.5-1%। सुधार अधिक स्पष्ट होते हैं जब मॉडल अति-पैरामीटरयुक्त होता है या जब डेटासेट छोटा होता है, यह सुझाव देते हुए कि स्व-आसवन एक नियमितीकरणकर्ता के रूप में कार्य करता है।

अंशांकन एक और क्षेत्र है जहां स्व-आसवन उत्कृष्ट है। स्व-आसवित मॉडलों में कम अपेक्षित अंशांकन त्रुटि होती है, जिसका अर्थ है कि उनकी भविष्यवाणी की संभावनाएं वास्तविक सटीकता को बेहतर ढंग से प्रतिबिंबित करती हैं। यह उन अनुप्रयोगों के लिए महत्वपूर्ण है जहां निर्णय विश्वास मायने रखता है, जैसे चिकित्सा निदान या स्वायत्त ड्राइविंग। टेस्ला ऑटोपायलट या वेमो प्रणालियों में, अच्छी तरह से अंशांकित मॉडल अति-विश्वसनीय त्रुटियों के जोखिम को कम करते हैं।

स्व-आसवन को प्रतिकूल हमलों के प्रति मजबूती में सुधार करने के लिए भी दिखाया गया है। नरम लक्ष्यों द्वारा प्रेरित चिकनी निर्णय सीमाएं छोटे गड़बड़ी के लिए भविष्यवाणियों को पलटना कठिन बनाती हैं। यह दृष्टि और भाषा दोनों मॉडलों में देखा गया है, हालांकि प्रभाव समर्पित प्रतिकूल प्रशिक्षण विधियों की तुलना में मामूली है।

विविधताएं और विस्तार

विशिष्ट चुनौतियों को संबोधित करने के लिए स्व-आसवन की कई विविधताएं प्रस्तावित की गई हैं। "पुनर्जन्म नेटवर्क" (born-again networks) नामक एक प्रकार में, एक छात्र मॉडल प्रशिक्षित किया जाता है जो शिक्षक के समान वास्तुकला में होता है लेकिन भिन्न यादृच्छिक आरंभीकरण के साथ। छात्र को शिक्षक के नरम लक्ष्यों पर प्रशिक्षित किया जाता है, और यह प्रक्रिया कई पीढ़ियों के लिए दोहराई जाती है। यह दृष्टिकोण लगातार सुधार दिखाता है, बाद की पीढ़ियां कभी-कभी पहले वालों से बेहतर प्रदर्शन करती हैं।

एक और विस्तार "ऑनलाइन स्व-आसवन" है, जहां मॉडल अलग-अलग चरणों में बजाय उसी प्रशिक्षण रन के दौरान अपने स्वयं के पूर्वानुमानों को आसवित करता है। यह मॉडल के आउटपुट का चल औसत बनाए रखकर या साझा वर्गीकरणकर्ता का उपयोग करके प्राप्त किया जाता है। ऑनलाइन तरीके अधिक कुशल हैं क्योंकि वे कई प्रशिक्षण पास से बचते हैं, लेकिन वे कम स्थिर हो सकते हैं।

स्व-आसवन को ट्रांसफार्मर में बहु-शीर्ष ध्यान तंत्र के साथ भी जोड़ा गया है। उदाहरण के लिए, एक मॉडल अपने स्वयं के ध्यान शीर्षों से ज्ञान को एक शीर्ष में आसवित कर सकता है, जिससे व्याख्या और प्रदर्शन में सुधार होता है। यह विशेष रूप से मशीन अनुवाद और सारांश में उपयोग किए जाने वाले एन्कोडर-डिकोडर वास्तुकलाओं के लिए प्रासंगिक है।

चुनौतियां और सीमाएं

अपने लाभों के बावजूद, स्व-आसवन सार्वभौमिक रूप से प्रभावी नहीं है। कुछ मामलों में, विशेष रूप से बहुत छोटे मॉडलों या अत्यधिक शोर वाले डेटासेटों के साथ, लाभ नगण्य या नकारात्मक भी होते हैं। तकनीक अतिरिक्त हाइपरपैरामीटर भी पेश करती है, जैसे तापमान और आसवन भार, जिन्हें ट्यूनिंग की आवश्यकता होती है। अनुचित सेटिंग्स अति-अनुकूलन या अति-स्मूथिंग का कारण बन सकती हैं, जहां मॉडल बहुत रूढ़िवादी हो जाता है और भेदभावपूर्ण शक्ति खो देता है।

एक और सीमा कम्प्यूटेशनल ओवरहेड है। जबकि स्व-आसवन एक अलग शिक्षक को प्रशिक्षित करने से बचाता है, यह अभी भी कई प्रशिक्षण पास या नरम लक्ष्यों के भंडारण की आवश्यकता रखता है, जो बड़े डेटासेटों के लिए मेमोरी-गहन हो सकता है। अरबों पैरामीटर वाले बड़े भाषा मॉडलों के लिए, प्रत्येक प्रशिक्षण उदाहरण के लिए नरम लक्ष्य उत्पन्न करना और संग्रहीत करना अव्यावहारिक है। शोधकर्ताओं ने सन्निकटन प्रस्तावित किए हैं, जैसे डेटा के एक उपसमुच्चय का उपयोग करना या नरम लक्ष्यों को संपीड़ित करना, लेकिन ये अतिरिक्त जटिलता पेश करते हैं।

स्व-आसवन की सैद्धांतिक समझ अधूरी बनी हुई है। जबकि अनुभवजन्य परिणाम आशाजनक हैं, कोई एकीकृत ढांचा नहीं है जो सभी देखी गई घटनाओं की व्याख्या करता हो। कुछ अध्ययनों से पता चला है कि स्व-आसवन प्रारंभिक मॉडल में मौजूद पूर्वाग्रहों को बढ़ा सकता है, जिससे उप-इष्टतम समाधान हो सकते हैं। यह विशेष रूप से उन अनुप्रयोगों में चिंताजनक है जहां निष्पक्षता महत्वपूर्ण है।

भविष्य की दिशाएं

चल रहे शोध स्व-आसवन को अधिक कुशल और मजबूत बनाने के तरीकों की खोज कर रहे हैं। एक दिशा अनुकूली तापमान अनुसूचियों का विकास है जो प्रशिक्षण के दौरान मॉडल के विश्वास के आधार पर समायोजित होते हैं। एक और अंशांकन के लिए विशेष रूप से डिज़ाइन किए गए हानि फलनों, जैसे फोकल हानि या लेबल स्मूथिंग प्रकारों, के साथ स्व-आसवन का एकीकरण है।

जनरेटिव AI के संदर्भ में, स्व-आसवन उत्पन्न पाठ की तथ्यात्मक स्थिरता में सुधार के लिए एक विधि के रूप में जांच की जा रही है। एक मॉडल को अपने स्वयं के उत्तरों को आसवित करके, यह मतिभ्रम से बचना सीख सकता है। यह विशेष रूप से ओपनएआई और एंथ्रोपिक मॉडलों के लिए प्रासंगिक है, जो उच्च-जोखिम वाले वातावरण में तैनात हैं।

स्व-आसवन को अधिक विविध प्रशिक्षण संकेत बनाने के लिए डेटा संवर्द्धन तकनीकों के साथ भी जोड़ा जा रहा है। उदाहरण के लिए, एक मॉडल समान इनपुट के संवर्द्धित संस्करणों के लिए नरम लक्ष्य उत्पन्न कर सकता है, जो स्थिरता लागू करता है और अपरिवर्तनशीलता में सुधार करता है। यह दृष्टिकोण अर्ध-पर्यवेक्षित और स्व-पर्यवेक्षित शिक्षण प्रतिमानों में वादा दिखाता है।

अंत में, स्व-आसवन के सैद्धांतिक आधारों को समझने में बढ़ती रुचि है। शोधकर्ता सूचना सिद्धांत और अनुकूलन से उपकरणों का उपयोग करके यह चिह्नित कर रहे हैं कि स्व-आसवन कब और क्यों मदद करता है। यह तकनीक को लागू करने और इसके हाइपरपैरामीटर सेट करने के लिए सिद्धांतित दिशानिर्देशों को जन्म दे सकता है।

निष्कर्ष

स्व-आसवन एक सरल फिर भी शक्तिशाली विचार का प्रतिनिधित्व करता है: एक मॉडल स्वयं से सीख सकता है। अपने स्वयं के पूर्वानुमानों को नरम लक्ष्यों के रूप में उपयोग करके, यह बाहरी पर्यवेक्षण के बिना बेहतर सामान्यीकरण, अंशांकन और मजबूती प्राप्त करता है। तकनीक को कई कार्यों और वास्तुकलाओं में मान्य किया गया है, छोटे कन्वोल्यूशनल नेटवर्क से लेकर बड़े ट्रांसफार्मर तक। हालांकि चुनौतियां बनी हुई हैं, विशेष रूप से कम्प्यूटेशनल लागत और सैद्धांतिक समझ के संदर्भ में, स्व-आसवन मशीन लर्निंग टूलबॉक्स में एक मुख्य तत्व बने रहने की संभावना है। जैसे-जैसे मॉडल आकार और जटिलता में बढ़ते रहते हैं, स्व-आसवन अतिरिक्त डेटा या वास्तुकला परिवर्तनों के बिना प्रदर्शन में सुधार करने का एक स्केलेबल तरीका प्रदान करता है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:machine-learning·deep-learning·knowledge-distillation·training-techniques
इस पृष्ठ को अंतिम बार संपादित किया गया 9 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास