अंग्रेज़ी से अनुवादित

स्थानांतरण अधिगम (Transfer learning) एक मशीन लर्निंग तकनीक है जिसमें एक कार्य से प्राप्त ज्ञान को किसी संबंधित कार्य पर प्रदर्शन सुधारने के लिए पुनः उपयोग किया जाता है, अक्सर डाउनस्ट्रीम कार्यों पर पूर्व-प्रशिक्षित मॉडलों को ठीक-ट्यूनिंग (fine-tuning) करके। यह आधुनिक डीप लर्निंग अनुप्रयोगों की आधारशिला बन गया है।

ट्रांसफर लर्निंग (TL) एक तकनीक है मशीन लर्निंग में जिसमें किसी कार्य से सीखा गया ज्ञान किसी संबंधित कार्य पर प्रदर्शन बढ़ाने के लिए पुनः उपयोग किया जाता है। उदाहरण के लिए, छवि वर्गीकरण के लिए, कारों को पहचानना सीखते समय प्राप्त ज्ञान को ट्रकों को पहचानने की कोशिश करते समय लागू किया जा सकता है। यह विषय सीखने के स्थानांतरण पर मनोवैज्ञानिक साहित्य से संबंधित है, हालांकि दोनों क्षेत्रों के बीच व्यावहारिक संबंध सीमित हैं। पहले से सीखे गए कार्यों से नए कार्यों में जानकारी का पुनः उपयोग या स्थानांतरण सीखने की दक्षता में काफी सुधार करने की क्षमता रखता है। चूंकि ट्रांसफर लर्निंग कई उद्देश्य कार्यों के साथ प्रशिक्षण का उपयोग करता है, यह लागत-संवेदनशील मशीन लर्निंग और बहु-उद्देश्य अनुकूलन से संबंधित है।

आधुनिक अभ्यास में, ट्रांसफर लर्निंग का प्रमुख रूप एक बड़े तंत्रिका नेटवर्क को व्यापक, डेटा-समृद्ध स्रोत कार्य पर पूर्व-प्रशिक्षित करना है, फिर इसे सीमित डेटा वाले संकीर्ण लक्ष्य कार्य पर सूक्ष्म-ट्यून करना है। यह दृष्टिकोण गहन शिक्षण में कई सफलताओं को रेखांकित करता है, विशेष रूप से प्राकृतिक भाषा प्रसंस्करण में (जैसा कि बड़े भाषा मॉडल के साथ देखा गया है) और कंप्यूटर दृष्टि में। शब्द 'ट्रांसफर लर्निंग विवरण' अक्सर इस सूक्ष्म-ट्यूनिंग प्रक्रिया में शामिल व्यावहारिक और सैद्धांतिक विचारों को संदर्भित करता है।

इतिहास

1976 में, बोज़िनोव्स्की और फुल्गोसी ने तंत्रिका नेटवर्क प्रशिक्षण में ट्रांसफर लर्निंग को संबोधित करते हुए एक पेपर प्रकाशित किया। पेपर ने विषय का एक गणितीय और ज्यामितीय मॉडल दिया। 1981 में, एक रिपोर्ट ने कंप्यूटर टर्मिनलों के अक्षरों का प्रतिनिधित्व करने वाली छवियों के डेटासेट पर ट्रांसफर लर्निंग के अनुप्रयोग पर विचार किया, प्रयोगात्मक रूप से सकारात्मक और नकारात्मक ट्रांसफर लर्निंग का प्रदर्शन किया। नकारात्मक स्थानांतरण तब होता है जब स्रोत ज्ञान लक्ष्य प्रदर्शन को नुकसान पहुंचाता है।

1992 में, लोरियन प्रैट ने भेदभाव-आधारित स्थानांतरण (DBT) एल्गोरिदम तैयार किया। 1998 तक, क्षेत्र में बहु-कार्य सीखने के साथ-साथ अधिक औपचारिक सैद्धांतिक नींव शामिल करने के लिए उन्नति हुई थी। ट्रांसफर लर्निंग पर प्रभावशाली प्रकाशनों में 1998 में पुस्तक लर्निंग टू लर्न, 2009 का एक सर्वेक्षण, और 2019 का एक सर्वेक्षण शामिल हैं।

एंड्रयू एनजी ने अपने NIPS 2016 ट्यूटोरियल में कहा कि ट्रांसफर लर्निंग पर्यवेक्षित शिक्षण के बाद मशीन लर्निंग वाणिज्यिक सफलता का अगला चालक बन जाएगा। 2020 के पेपर 'रिथिंकिंग प्री-ट्रेनिंग एंड सेल्फ-ट्रेनिंग' में, ज़ोफ़ एट अल। ने बताया कि पूर्व-प्रशिक्षण कुछ सेटिंग्स में सटीकता को नुकसान पहुंचा सकता है और इसके बजाय स्व-प्रशिक्षण की वकालत की, जो ट्रांसफर लर्निंग के सूक्ष्म व्यापार-नापसंद को उजागर करता है।

परिभाषा

ट्रांसफर लर्निंग की परिभाषा डोमेन और कार्यों के संदर्भ में दी गई है। एक डोमेन D में शामिल हैं: एक फीचर स्पेस X और एक सीमांत संभाव्यता वितरण P(X), जहां X = {x_1, ..., x_n} ∈ X। एक विशिष्ट डोमेन D = {X, P(X)} दिए जाने पर, एक कार्य में दो घटक होते हैं: एक लेबल स्पेस Y और एक उद्देश्य भविष्यवाणी फ़ंक्शन f: X → Y। फ़ंक्शन f एक नए उदाहरण x के लेबल f(x) की भविष्यवाणी करता है। यह कार्य, जिसे T = {Y, f(x)} के रूप में दर्शाया गया है, जोड़े {x_i, y_i} से युक्त प्रशिक्षण डेटा से सीखा जाता है।

एक स्रोत डोमेन D_S और सीखने के कार्य T_S, और एक लक्ष्य डोमेन D_T और सीखने के कार्य T_T दिए जाने पर, जहां D_S ≠ D_T या T_S ≠ T_T, ट्रांसफर लर्निंग का उद्देश्य D_S और T_S में ज्ञान का उपयोग करके D_T में लक्ष्य भविष्यवाणी फ़ंक्शन f_T(·) की सीखने में सुधार करने में मदद करना है। प्रमुख धारणा यह है कि स्रोत और लक्ष्य कार्य पर्याप्त रूप से संबंधित हैं ताकि साझा ज्ञान स्थानांतरित किया जा सके।

सूक्ष्म-ट्यूनिंग की तंत्र

गहन शिक्षण में ट्रांसफर लर्निंग का सबसे सामान्य कार्यान्वयन सूक्ष्म-ट्यूनिंग है। एक मॉडल को पहले एक बड़े, सामान्य डेटासेट (स्रोत कार्य) पर पूर्व-प्रशिक्षित किया जाता है। फिर, इसके वजन का उपयोग लक्ष्य कार्य पर प्रशिक्षण के लिए आरंभीकरण के रूप में किया जाता है। पूर्व-प्रशिक्षित नेटवर्क की निचली परतें, जो आमतौर पर सामान्य विशेषताएं सीखती हैं, अक्सर सीखी गई प्रस्तुतियों को संरक्षित करने के लिए स्थिर या कम सीखने की दर के साथ अनुकूलित की जाती हैं, जबकि उच्च परतों को लक्ष्य डेटा पर फिर से प्रशिक्षित किया जाता है।

सूक्ष्म-ट्यूनिंग को पूरे नेटवर्क पर या केवल परतों के एक उपसमुच्चय पर लागू किया जा सकता है। जब लक्ष्य डेटासेट छोटा होता है, तो चिकित्सक अक्सर ओवरफिटिंग से बचने के लिए अधिकांश परतों को स्थिर करते हैं और केवल अंतिम वर्गीकरण हेड को अपडेट करते हैं। बड़े लक्ष्य डेटासेट के लिए, अधिक आक्रामक सूक्ष्म-ट्यूनिंग संभव है। ड्रॉपआउट, बैच सामान्यीकरण, और परत सामान्यीकरण जैसी तकनीकें आमतौर पर सूक्ष्म-ट्यूनिंग के दौरान मॉडल को नियमित करने के लिए उपयोग की जाती हैं।

ट्रांसफर लर्निंग के प्रकार

ट्रांसफर लर्निंग को स्रोत और लक्ष्य डोमेन और कार्यों के बीच सहमति के स्तर के आधार पर वर्गीकृत किया जा सकता है। आगमनात्मक ट्रांसफर लर्निंग तब होता है जब स्रोत और लक्ष्य कार्य भिन्न होते हैं, भले ही डोमेन समान हों। पारगमन ट्रांसफर लर्निंग तब होता है जब डोमेन भिन्न होते हैं लेकिन कार्य समान होते हैं। अनुपयुक्त ट्रांसफर लर्निंग तब लागू होता है जब कार्य और डोमेन दोनों भिन्न होते हैं लेकिन लेबल किया गया डेटा उपलब्ध नहीं होता है।

व्यवहार में, अधिकांश गहन शिक्षण अनुप्रयोग समान फीचर स्पेस के साथ आगमनात्मक ट्रांसफर लर्निंग का उपयोग करते हैं - उदाहरण के लिए, सामान्य पाठ पर एक ट्रांसफॉर्मर को पूर्व-प्रशिक्षित करना और इसे भावना विश्लेषण पर सूक्ष्म-ट्यून करना। बहु-कार्य सीखना, जहां एक मॉडल को एक साथ कई उद्देश्यों पर प्रशिक्षित किया जाता है, निकटता से संबंधित है और ट्रांसफर लर्निंग के साथ गणितीय नींव साझा करता है।

अनुप्रयोग

ट्रांसफर लर्निंग AI अनुप्रयोगों में व्यापक है। कंप्यूटर दृष्टि में, ImageNet पर पूर्व-प्रशिक्षित मॉडल को चिकित्सा छवि विश्लेषण, वस्तु पहचान और स्वायत्त ड्राइविंग के लिए सूक्ष्म-ट्यून किया गया है। प्राकृतिक भाषा प्रसंस्करण में, OpenAI और Google DeepMind ने बड़े पूर्व-प्रशिक्षित मॉडल जारी किए हैं जिन्हें शोधकर्ता प्रश्न उत्तर या अनुवाद जैसे विशिष्ट कार्यों के लिए सूक्ष्म-ट्यून करते हैं।

विशिष्ट उदाहरणों में पाठ समझ के लिए BERT शामिल है, जिसे मास्क किए गए भाषा मॉडलिंग पर पूर्व-प्रशिक्षित किया गया था और भावना वर्गीकरण या नामित इकाई पहचान के लिए सूक्ष्म-ट्यून किया गया था। भाषण पहचान में, सामान्य ऑडियो पर पूर्व-प्रशिक्षित मॉडल ध्वनिक वातावरण के लिए अनुकूलित होते हैं। सुदृढीकरण सीखने में, ट्रांसफर लर्निंग पिछले कार्यों से नीतियों का पुनः उपयोग करके नए वातावरण में सीखने को तेज कर सकता है।

सैद्धांतिक विचार

ट्रांसफर लर्निंग की प्रभावशीलता स्रोत और लक्ष्य वितरण के बीच समानता पर निर्भर करती है। एक प्रमुख सैद्धांतिक परिणाम यह है कि लक्ष्य कार्य पर सामान्यीकरण त्रुटि स्रोत कार्य पर त्रुटि और दो डोमेन के बीच विचलन को मापने वाले एक शब्द के योग से बाधित होती है। यह संबंध ट्रांसफर लर्निंग कब लागू करना है इसके बारे में व्यावहारिक निर्णयों का मार्गदर्शन करता है।

नकारात्मक स्थानांतरण तब हो सकता है जब स्रोत ज्ञान लक्ष्य कार्य के लिए भ्रामक हो। उदाहरण के लिए, कई वर्गों के साथ छवि वर्गीकरण पर पूर्व-प्रशिक्षण एक लक्ष्य कार्य में मदद नहीं कर सकता है जिसमें बहुत अलग लेबल वितरण होता है। डोमेन अनुकूलन तकनीकें, जैसे प्रतिकूल प्रशिक्षण, डोमेन बदलाव को कम करने का लक्ष्य रखती हैं। सामान्य तौर पर, हालिया शोध इस बात पर जोर देता है कि ट्रांसफर लर्निंग एक चांदी की गोली नहीं है; सावधानीपूर्वक मूल्यांकन आवश्यक है।

अनुकूलन तकनीकें

बड़े पूर्व-प्रशिक्षित मॉडल को सूक्ष्म-ट्यून करने के लिए विशेष अनुकूलन की आवश्यकता होती है। Adam अनुकूलक और इसके वेरिएंट मानक विकल्प हैं, अक्सर शुरुआत से प्रशिक्षण की तुलना में कम प्रारंभिक सीखने की दर के साथ। ग्रेडिएंट क्लिपिंग का उपयोग अक्सर सूक्ष्म-ट्यूनिंग के दौरान विस्फोट को रोकने के लिए किया जाता है। पाठ्यक्रम सीखना भी लागू किया जा सकता है, जहां लक्ष्य डेटासेट को बढ़ती कठिनाई में प्रस्तुत किया जाता है।

एक और दृष्टिकोण पूर्व-प्रशिक्षित परतों के लिए छोटी सीखने की दर और नई आरंभिक परतों के लिए उच्च दर का उपयोग करना है। इसके अतिरिक्त, डेटा संवर्धन तकनीकें, जैसे यादृच्छिक क्रॉपिंग या टोकन मास्किंग, छोटे लक्ष्य डेटासेट पर मॉडल को सामान्यीकृत करने में मदद कर सकती हैं। कुछ विधियां महत्वपूर्ण सटीकता हानि के बिना मॉडल आकार को कम करने के लिए सूक्ष्म-ट्यूनिंग के बाद मॉडल प्रूनिंग का उपयोग करती हैं।

बड़े भाषा मॉडल से संबंध

बड़े भाषा मॉडल के उदय ने ट्रांसफर लर्निंग को पहले से कहीं अधिक महत्वपूर्ण बना दिया है। GPT-3 और Claude जैसे मॉडल विशाल कोर्पोरा पर पूर्व-प्रशिक्षित होते हैं और फिर सूक्ष्म-ट्यूनिंग या प्रॉम्प्टिंग के माध्यम से डाउनस्ट्रीम कार्यों के लिए अनुकूलित होते हैं। कुछ मामलों में, ट्रांसफर लर्निंग निर्देश ट्यूनिंग के माध्यम से पैमाने पर किया जाता है, जहां एक मॉडल को सामान्यीकरण में सुधार करने के लिए कई कार्यों पर एक साथ सूक्ष्म-ट्यून किया जाता है।

मानव प्रतिक्रिया से सुदृढीकरण सीखना (RLHF) ट्रांसफर लर्निंग का एक रूप है जहां एक पूर्व-प्रशिक्षित मॉडल को इनाम संकेत के रूप में मानव प्राथमिकताओं का उपयोग करके सूक्ष्म-ट्यून किया जाता है। यह दृष्टिकोण मानव मूल्यों के साथ मॉडल को संरेखित करने में सहायक रहा है। Anthropic और OpenAI से शोध दर्शाता है कि ट्रांसफर लर्निंग सुरक्षा और संरेखण के साथ कैसे जुड़ता है।

चुनौतियाँ और भविष्य की दिशाएँ

एक प्रमुख चुनौती पूर्व-प्रशिक्षण की कम्प्यूटेशनल लागत है, जिसके लिए अक्सर AWS Trainium या Google Cloud TPU जैसे विशेष हार्डवेयर के बड़े क्लस्टर की आवश्यकता होती है। कुशल ट्रांसफर लर्निंग पर सक्रिय शोध है, जिसमें एडेप्टर या LoRA जैसे पैरामीटर-कुशल तरीके शामिल हैं जो केवल वजन के एक छोटे अंश को अपडेट करते हैं।

एक और चिंता विस्मृति है - जब एक नए कार्य पर सूक्ष्म-ट्यूनिंग की जाती है, तो मॉडल स्रोत कार्य से ज्ञान खो सकता है। निरंतर सीखने के दृष्टिकोण इसको कम करने का लक्ष्य रखते हैं। 2020 के दशक की शुरुआत तक, ट्रांसफर लर्निंग एक सक्रिय शोध क्षेत्र बना हुआ है, जिसमें पूर्व-प्रशिक्षण कब मदद करता है और कब नहीं, इसके बारे में सूक्ष्म निष्कर्ष हैं, जैसा कि ज़ोफ़ एट अल। द्वारा उजागर किया गया है। भविष्य का काम सैद्धांतिक गारंटी और नकारात्मक स्थानांतरण से बचने के लिए बेहतर तरीकों पर केंद्रित हो सकता है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:machine-learning·transfer-learning·fine-tuning
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास