अंग्रेज़ी से अनुवादित

ज्ञान आसवन एक बड़े, जटिल मॉडल से ज्ञान को एक छोटे मॉडल में स्थानांतरित करता है, वैधता बनाए रखते हुए कम्प्यूटेशनल लागत को कम करता है। यह मशीन लर्निंग अनुप्रयोगों जैसे ऑब्जेक्ट डिटेक्शन और प्राकृतिक भाषा प्रसंस्करण में व्यापक रूप से उपयोग किया जाता है।

ज्ञान आसवन, जिसे मॉडल आसवन के रूप में भी जाना जाता है, Machine learning में एक ऐसी तकनीक है जिसमें ज्ञान एक बड़े, जटिल मॉडल (शिक्षक) से एक छोटे, सरल मॉडल (छात्र) में स्थानांतरित किया जाता है। लक्ष्य एक ऐसा संहत मॉडल बनाना है जो बड़े मॉडल की भविष्यवाणी सटीकता को बनाए रखे, जबकि मूल्यांकन में अधिक कम्प्यूटेशनल रूप से कुशल हो। यह संसाधन-सीमित हार्डवेयर, जैसे मोबाइल उपकरणों पर मॉडलों को तैनात करने के लिए विशेष रूप से मूल्यवान है, जहां एक बड़े मॉडल को चलाने की कम्प्यूटेशनल लागत निषेधात्मक है। यह प्रक्रिया इस विचार का उपयोग करती है कि एक बड़े मॉडल का आउटपुट, विशेष रूप से इसकी नरम संभावनाएं, अंतिम वर्ग लेबल की तुलना में अधिक समृद्ध जानकारी रखती हैं, और इस जानकारी का उपयोग एक छोटे मॉडल को प्रभावी ढंग से प्रशिक्षित करने के लिए किया जा सकता है।

ज्ञान आसवन मॉडल संपीड़न से अलग है, जो एक नया मॉडल प्रशिक्षित किए बिना मौजूदा मॉडल के आकार को कम करने वाले तरीकों को संदर्भित करता है, जैसे कि प्रति पैरामीटर बिट्स की संख्या घटाना। मॉडल संपीड़न आम तौर पर वास्तुकला और पैरामीटर संख्या को संरक्षित करता है, जबकि आसवन में एक नया, छोटा मॉडल प्रशिक्षित करना शामिल है। यह तकनीक विभिन्न डोमेन में सफलतापूर्वक लागू की गई है, जिसमें वस्तु पहचान, ध्वनिक मॉडल, प्राकृतिक भाषा प्रसंस्करण, और हाल ही में ग्राफ तंत्रिका नेटवर्क के लिए गैर-ग्रिड डेटा शामिल है।

ऐतिहासिक पृष्ठभूमि

ज्ञान आसवन की अवधारणा की जड़ें Deep learning और Neural network अनुसंधान के व्यापक क्षेत्र में हैं। जबकि मॉडलों के बीच ज्ञान स्थानांतरित करने का विचार विभिन्न रूपों में खोजा गया है, आधुनिक सूत्रीकरण अक्सर जेफ्री हिंटन, ओरिओल विनाल्स और जेफ डीन द्वारा 2015 के पेपर, "डिस्टिलिंग द नॉलेज इन ए न्यूरल नेटवर्क" से जुड़ा है। इस काम ने सॉफ्टमैक्स फ़ंक्शन में तापमान के उपयोग को औपचारिक रूप से शिक्षक के आउटपुट को नरम करने के लिए स्थापित किया, जिससे अधिक प्रभावी ज्ञान हस्तांतरण संभव हुआ। तब से, ज्ञान आसवन मशीन लर्निंग टूलबॉक्स में एक मानक तकनीक बन गई है, जिसमें कई विविधताएं और अनुप्रयोग हैं।

मुख्य सिद्धांत

ज्ञान आसवन के पीछे मूल सिद्धांत यह है कि एक बड़े मॉडल, जैसे कि एक बहुत गहरे Neural network या मॉडलों के एक समूह, में एक छोटे मॉडल की तुलना में उच्च ज्ञान क्षमता होती है। हालांकि, यह क्षमता पूरी तरह से उपयोग नहीं की जा सकती है, और बड़े मॉडल का मूल्यांकन इस बात की परवाह किए बिना कम्प्यूटेशनल रूप से महंगा है कि इसकी कितनी क्षमता उपयोग की जाती है। आसवन का उद्देश्य बड़े मॉडल में एन्कोड किए गए ज्ञान को वैधता के नुकसान के बिना एक छोटे मॉडल में स्थानांतरित करना है। छोटा मॉडल, कम खर्चीला होने के कारण, कम शक्तिशाली हार्डवेयर पर तैनात किया जा सकता है।

मुख्य अंतर्दृष्टि यह है कि एक प्रशिक्षित मॉडल का नरम आउटपुट, जो विभिन्न वर्गों को संभावनाएं प्रदान करता है, मॉडल के आंतरिक प्रतिनिधित्व के बारे में जानकारी रखता है। उदाहरण के लिए, जब एक मॉडल बिल्ली की छवि को सही ढंग से वर्गीकृत करता है, तो यह 'बिल्ली' के लिए उच्च संभावना प्रदान कर सकता है, लेकिन 'कुत्ते' या 'लोमड़ी' के लिए छोटी, गैर-शून्य संभावनाएं भी प्रदान कर सकता है। ये छोटी संभावनाएं वर्गों के बीच सूक्ष्म समानताओं और संबंधों को एन्कोड करती हैं, जो केवल कठोर लेबल (सबसे संभावित वर्ग) का उपयोग करने पर खो जाती हैं। ज्ञान आसवन इस नरम जानकारी का लाभ उठाकर छात्र मॉडल को एक समृद्ध प्रतिनिधित्व सिखाता है।

गणितीय सूत्रीकरण

एक विशिष्ट वर्गीकरण कार्य में, एक तंत्रिका नेटवर्क की अंतिम परत लॉगिट्स (कच्चे स्कोर) को संभावनाओं में बदलने के लिए सॉफ्टमैक्स फ़ंक्शन का उपयोग करती है। मानक सॉफ्टमैक्स इस प्रकार दिया गया है:

\( y_i(x) = \frac{e^{z_i(x)}}{\sum_j e^{z_j(x)}} \)

जहां \( z_i(x) \) इनपुट \( x \) के लिए वर्ग \( i \) का लॉगिट है। ज्ञान आसवन में, एक तापमान पैरामीटर \( t \) पेश किया जाता है, जो सॉफ्टमैक्स को संशोधित करता है:

\( y_i(x|t) = \frac{e^{z_i(x)/t}}{\sum_j e^{z_j(x)/t}} \)

एक उच्च तापमान \( t \) एक नरम संभावना वितरण उत्पन्न करता है, जिसका अर्थ है कि संभावनाएं वर्गों में अधिक समान रूप से फैली हुई हैं। यह नरम वितरण वर्गों के बीच संबंधों के बारे में अधिक जानकारी प्रकट करता है, क्योंकि माध्यमिक वर्गों में मॉडल का आत्मविश्वास अधिक स्पष्ट हो जाता है।

आसवन के दौरान, छात्र मॉडल को एक स्थानांतरण सेट पर प्रशिक्षित किया जाता है, जो मूल प्रशिक्षण डेटा या नया, संभवतः अलेबल डेटा हो सकता है। हानि फ़ंक्शन आम तौर पर छात्र के आउटपुट और शिक्षक के आउटपुट के बीच क्रॉस-एन्ट्रॉपी होता है, दोनों एक उच्च तापमान पर गणना किए जाते हैं। एक इनपुट \( x \) के लिए हानि है:

\( E(x|t) = -\sum_i \hat{y}_i(x|t) \log y_i(x|t) \)

जहां \( \hat{y}_i(x|t) \) शिक्षक का आउटपुट है और \( y_i(x|t) \) छात्र का आउटपुट है। एक उच्च तापमान का उपयोग आउटपुट की एन्ट्रॉपी को बढ़ाता है, जो छात्र को सीखने के लिए अधिक जानकारी प्रदान करता है और विभिन्न रिकॉर्डों के बीच ग्रेडिएंट्स के विचरण को कम करता है, जिससे उच्च सीखने की दर संभव होती है।

प्रशिक्षण प्रक्रिया

ज्ञान आसवन की प्रशिक्षण प्रक्रिया में आम तौर पर कई चरण शामिल होते हैं। पहले, एक बड़ा शिक्षक मॉडल मानक तकनीकों का उपयोग करके मूल डेटासेट पर प्रशिक्षित किया जाता है। यह मॉडल एक एकल बड़ा नेटवर्क या मॉडलों का एक समूह हो सकता है। शिक्षक के प्रशिक्षित होने के बाद, इसके नरम आउटपुट स्थानांतरण सेट के लिए उत्पन्न किए जाते हैं, अक्सर एक उच्च तापमान पर। फिर छात्र मॉडल को इन नरम आउटपुट की नकल करने के लिए प्रशिक्षित किया जाता है, ऊपर वर्णित क्रॉस-एन्ट्रॉपी हानि का उपयोग करके।

कुछ मामलों में, हानि को छात्र के आउटपुट और जमीनी सत्य लेबल के बीच क्रॉस-एन्ट्रॉपी के साथ बढ़ाया जाता है, यदि उपलब्ध हो। यह संयोजन छात्र को शिक्षक का ज्ञान और वास्तविक लक्ष्य लेबल दोनों सीखने में मदद करता है। तापमान आम तौर पर प्रशिक्षण के दौरान एनील किया जाता है, उच्च शुरू होकर धीरे-धीरे 1 तक कम होता है, ताकि नरम लक्ष्यों से सीखने से कठोर लेबल के साथ परिष्कृत करने की ओर संक्रमण हो सके।

अनुप्रयोग

ज्ञान आसवन को Artificial intelligence के कई क्षेत्रों में सफलतापूर्वक लागू किया गया है। कंप्यूटर विज़न में, इसका उपयोग वस्तु पहचान और छवि वर्गीकरण के लिए किया जाता है, जिससे मॉडल एज उपकरणों पर चल सकते हैं। वाक् पहचान में, ध्वनिक मॉडल विलंबता और मेमोरी उपयोग को कम करने के लिए आसवन से लाभान्वित होते हैं। Natural language processing में, आसवन का उपयोग बड़े Transformer (architecture)-आधारित मॉडलों, जैसे Large language model, को छोटे संस्करणों में संपीड़ित करने के लिए किया जाता है, जिन्हें मोबाइल उपकरणों या वास्तविक समय अनुप्रयोगों में तैनात किया जा सकता है। उदाहरण के लिए, एक बड़े Generative AI सिस्टम जैसे मॉडल को विशिष्ट कार्यों के लिए एक छोटे मॉडल में आसवित किया जा सकता है, जो मूल के प्रदर्शन का अधिकांश भाग बनाए रखता है।

हाल ही में, ज्ञान आसवन को ग्राफ तंत्रिका नेटवर्क तक बढ़ाया गया है, जो सामाजिक नेटवर्क या आणविक संरचनाओं जैसे गैर-ग्रिड डेटा पर काम करते हैं। यह विस्तार विभिन्न डेटा प्रकारों और मॉडल वास्तुकलाओं में तकनीक की बहुमुखी प्रतिभा को प्रदर्शित करता है।

विविधताएं और विस्तार

विशिष्ट चुनौतियों का समाधान करने के लिए ज्ञान आसवन की कई विविधताएं विकसित की गई हैं। एक उल्लेखनीय विविधता उल्टा ज्ञान आसवन है, जहां ज्ञान एक छोटे मॉडल से एक बड़े मॉडल में स्थानांतरित किया जाता है। यह कम आम है, लेकिन उन परिदृश्यों में उपयोगी हो सकता है जहां एक छोटे मॉडल को विशिष्ट डेटा पर प्रशिक्षित किया गया है और लक्ष्य उस डेटा पर एक बड़े मॉडल के प्रदर्शन को बढ़ाना है।

अन्य विस्तारों में ध्यान-आधारित आसवन शामिल है, जहां छात्र शिक्षक के ध्यान मानचित्रों की नकल करना सीखता है, और विशेषता-आधारित आसवन, जहां मध्यवर्ती प्रतिनिधित्व लक्ष्य के रूप में उपयोग किए जाते हैं। इन विधियों का उद्देश्य शिक्षक से अधिक विस्तृत जानकारी को पकड़कर ज्ञान हस्तांतरण की निष्ठा में सुधार करना है।

लाभ और सीमाएं

ज्ञान आसवन का प्राथमिक लाभ महत्वपूर्ण सटीकता हानि के बिना संसाधन-सीमित उपकरणों पर उच्च-प्रदर्शन मॉडल तैनात करने की क्षमता है। यह मोबाइल ऐप्स, एम्बेडेड सिस्टम और वास्तविक समय अनुमान जैसे अनुप्रयोगों के लिए महत्वपूर्ण है। आसवन तेज़ अनुमान समय और कम ऊर्जा खपत भी कर सकता है।

हालांकि, सीमाएं हैं। प्रशिक्षण प्रक्रिया के लिए एक अच्छी तरह से प्रशिक्षित शिक्षक की आवश्यकता होती है, जिसे प्राप्त करना कम्प्यूटेशनल रूप से महंगा हो सकता है। इसके अतिरिक्त, छात्र मॉडल हमेशा शिक्षक के समान प्रदर्शन स्तर प्राप्त नहीं कर सकता है, खासकर यदि क्षमता अंतर बहुत बड़ा है। तापमान और स्थानांतरण सेट का चुनाव भी सावधानीपूर्वक ट्यूनिंग की आवश्यकता होती है।

अन्य तकनीकों से संबंध

ज्ञान आसवन अक्सर अन्य मॉडल अनुकूलन तकनीकों के साथ संयोजन में उपयोग किया जाता है। उदाहरण के लिए, Model Pruning को आसवन के बाद छात्र मॉडल पर लागू किया जा सकता है ताकि इसका आकार और कम हो सके। Data Augmentation का उपयोग स्थानांतरण सेट का विस्तार करने के लिए किया जा सकता है, जिससे छात्र का सामान्यीकरण बेहतर होता है। आसवन Curriculum Learning से भी संबंधित है, क्योंकि नरम लक्ष्यों को प्रगतिशील सीखने का एक रूप देखा जा सकता है।

Deep learning के संदर्भ में, आसवन Transfer learning का एक रूप है, जहां एक मॉडल से ज्ञान दूसरे में स्थानांतरित किया जाता है। यह Reinforcement Learning from AI Feedback (RLAIF) (एआई फीडबैक से सुदृढीकरण सीखने) से भी निकट से संबंधित है, हालांकि बाद वाला मानव वरीयताओं के साथ मॉडलों को संरेखित करने पर केंद्रित है।

भविष्य की दिशाएं

जैसे-जैसे मॉडल आकार में बढ़ते जा रहे हैं, विशेष रूप से Large language model के क्षेत्र में, ज्ञान आसवन और भी महत्वपूर्ण होने की संभावना है। शोधकर्ता OpenAI, Anthropic, और Google DeepMind जैसे संगठनों द्वारा विकसित बड़े मॉडलों से ज्ञान को छोटे, अधिक कुशल मॉडलों में आसवित करने के तरीकों की खोज कर रहे हैं। यह उन्नत एआई क्षमताओं तक पहुंच को लोकतांत्रिक बनाने के लिए महत्वपूर्ण है, क्योंकि यह छोटे संगठनों और व्यक्तिगत डेवलपर्स को व्यापक कम्प्यूटेशनल संसाधनों की आवश्यकता के बिना शक्तिशाली मॉडल का उपयोग करने की अनुमति देता है।

अनुसंधान का एक अन्य क्षेत्र ऑनलाइन आसवन है, जहां शिक्षक और छात्र एक साथ प्रशिक्षित होते हैं, और सहयोगी आसवन, जहां कई मॉडल एक दूसरे से सीखते हैं। इन दृष्टिकोणों का उद्देश्य आसवन प्रक्रिया की दक्षता और प्रभावशीलता में सुधार करना है।

संक्षेप में, ज्ञान आसवन मॉडल संपीड़न और ज्ञान हस्तांतरण के लिए एक शक्तिशाली तकनीक है। बड़े मॉडलों के नरम आउटपुट का लाभ उठाकर, यह संहत मॉडलों के निर्माण को सक्षम बनाता है जो सटीक और कुशल दोनों हैं, जिससे यह आधुनिक मशीन लर्निंग तैनाती रणनीतियों की आधारशिला बन जाती है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:machine-learning·deep-learning·model-compression·knowledge-transfer
इस पृष्ठ को अंतिम बार संपादित किया गया 9 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास