स्व-पर्यवेक्षित अधिगम (Self-supervised learning)

अंग्रेज़ी से अनुवादित

स्व-पर्यवेक्षित शिक्षण एक मशीन लर्निंग दृष्टिकोण है जिसमें एक मॉडल बिना लेबल वाले डेटा से अपने स्वयं के प्रशिक्षण लेबल उत्पन्न करता है, अक्सर किसी इनपुट के छिपे या लुप्त हिस्से को उसके शेष भाग से भविष्यवाणी करके।

स्व-पर्यवेक्षित अधिगम एक प्रशिक्षण दृष्टिकोण है जिसमें एक मॉडल उस डेटा से सीखता है जिसमें मानव-प्रदत्त लेबल नहीं होते, बल्कि वह डेटा की संरचना से सीधे अपना स्वयं का पर्यवेक्षी संकेत निर्मित करता है। जैसा कि Supervised learning में प्रत्येक इनपुट के लिए सही आउटपुट बताया जाता है, उसके विपरीत, मॉडल को एक ऐसा कार्य दिया जाता है जैसे डेटा के शेष भाग से उसके छिपे या लुप्त हिस्से की भविष्यवाणी करना, और उस कार्य के लिए "लेबल" केवल वह वास्तविक मान होता है जो छिपाया गया था, जो पहले से ही कच्चे, बिना लेबल वाले डेटासेट में बिना किसी अतिरिक्त एनोटेशन लागत के मौजूद होता है।

मूल विचार और उद्देश्य

सबसे विशिष्ट उदाहरण अगला-टोकन भविष्यवाणी है: पाठ के एक अनुक्रम से अंतिम शब्द हटाकर, एक मॉडल को उस शब्द की भविष्यवाणी करने के लिए प्रशिक्षित किया जाता है, और क्योंकि सामान्य पाठ में पहले से ही उसका अगला शब्द होता है, किसी मानव को कभी भी कुछ लेबल नहीं करना पड़ता। यह ठीक वही उद्देश्य है जिसका उपयोग आधुनिक बड़े भाषा मॉडल को पूर्व-प्रशिक्षित करने के लिए किया जाता है, जो Common Crawl जैसे स्रोतों से एकत्रित विशाल मात्रा में कच्चे पाठ से केवल एक अनुक्रम में अगले टोकन की बार-बार भविष्यवाणी करके सीखते हैं। एक संबंधित उद्देश्य, मास्क्ड-टोकन भविष्यवाणी, एक अनुक्रम के भीतर टोकनों के एक यादृच्छिक उपसमूह को छिपाता है और मॉडल को आसपास के संदर्भ से उन्हें वापस भरने के लिए प्रशिक्षित करता है; यह BERT के पीछे का पूर्व-प्रशिक्षण उद्देश्य था। कंप्यूटर विज़न और मल्टीमॉडल अधिगम में, स्व-पर्यवेक्षित उद्देश्यों में एक छवि के मास्क्ड-आउट क्षेत्र की भविष्यवाणी करना, और कंट्रास्टिव उद्देश्य शामिल हैं, जिनका उपयोग CLIP द्वारा किया जाता है, जो मॉडल को यह पहचानने के लिए प्रशिक्षित करते हैं कि छवि और पाठ के कौन से जोड़े (या एक ही छवि के दो संवर्धित दृश्य) एक साथ हैं बनाम कौन से बेमेल हैं।

पर्यवेक्षित और अ-पर्यवेक्षित अधिगम से संबंध

स्व-पर्यवेक्षित अधिगम अवधारणात्मक रूप से पर्यवेक्षित अधिगम और Unsupervised learning के बीच स्थित है। यह अ-पर्यवेक्षित अधिगम की तरह बिना लेबल वाले डेटा से काम करता है, लेकिन यह स्पष्ट सही उत्तर के साथ एक स्पष्ट भविष्यवाणी कार्य परिभाषित करता है, और इसे सामान्य पर्यवेक्षित प्रशिक्षण में उपयोग किए जाने वाले समान हानि फलन, Gradient descent और Backpropagation तंत्र के साथ अनुकूलित किया जाता है। कुछ शोधकर्ता इसे अ-पर्यवेक्षित अधिगम का एक उपप्रकार मानते हैं; अन्य इसे अपनी स्वयं की श्रेणी मानते हैं क्योंकि इसकी प्रशिक्षण प्रक्रिया पर्यवेक्षित अधिगम से बहुत निकटता से मिलती-जुलती है, केवल लेबल के स्रोत में भिन्नता होती है।

यह क्यों महत्वपूर्ण है

स्व-पर्यवेक्षित अधिगम ने एक मौलिक बाधा को हल किया जिसने पर्यवेक्षित अधिगम को सीमित किया था: मानव-लेबल वाले डेटा की कमी और लागत। क्योंकि इंटरनेट और अन्य बड़े संग्रहों में पहले से ही विशाल मात्रा में बिना लेबल वाला पाठ, चित्र, ऑडियो और वीडियो मौजूद है, स्व-पर्यवेक्षित उद्देश्यों ने मॉडलों को उस पैमाने पर प्रशिक्षित करने की अनुमति दी जो लेबल वाले डेटासेट कभी मेल नहीं खा सकते थे, एक बदलाव जिसने सीधे आधुनिक फाउंडेशन मॉडल युग के पीछे स्केलिंग को सक्षम किया। यह वह तंत्र है जिसके द्वारा Transfer learning भाषा के लिए इतना प्रभावी बन गया: एक मॉडल जो व्यापक पाठ पर स्व-पर्यवेक्षित उद्देश्य के साथ पूर्व-प्रशिक्षित होता है, वह ऐसे सामान्य प्रतिनिधित्व सीखता है जो अपेक्षाकृत कम कार्य-विशिष्ट Fine-tuning के साथ कई नीचे-धारा कार्यों में अच्छी तरह से स्थानांतरित होने के लिए पर्याप्त होते हैं।

उल्लेखनीय मील के पत्थर और प्रभाव

Word2vec का 2013 का शब्द-भविष्यवाणी उद्देश्य भाषा पर लागू स्व-पर्यवेक्षित अधिगम का एक प्रारंभिक प्रभावशाली उदाहरण है, हालांकि उस समय यह शब्द अभी व्यापक उपयोग में नहीं था। यह दृष्टिकोण 2018 में BERT और GPT श्रृंखला के बाद क्षेत्र की शब्दावली और रणनीति का केंद्र बन गया, और 2020 के दशक की शुरुआत तक स्व-पर्यवेक्षित पूर्व-प्रशिक्षण के बाद पर्यवेक्षित या वरीयता-आधारित फाइन-ट्यूनिंग अनिवार्य रूप से हर प्रमुख बड़े भाषा मॉडल के लिए मानक विधि बन गई थी। यही प्रतिमान पाठ से परे भी विस्तारित हुआ: भविष्य के फ्रेम की भविष्यवाणी करने वाले स्व-पर्यवेक्षित वीडियो मॉडल रोबोटिक्स और स्वायत्त प्रणालियों के लिए विश्व मॉडलों पर शोध का एक मूलभूत घटक हैं। स्व-पर्यवेक्षित अधिगम की केंद्रीय सीमा यह है कि परिणामी प्रतिनिधित्व की गुणवत्ता अभी भी अंतर्निहित बिना लेबल वाले डेटा की गुणवत्ता, पैमाने और विविधता पर निर्भर करती है, और उस डेटा में मौजूद पूर्वाग्रह या अंतराल मॉडल में उसी तरह अवशोषित हो जाते हैं जैसे वे पर्यवेक्षित प्रशिक्षण में होते हैं।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:machine-learning·deep-learning·model-training
इस पृष्ठ को अंतिम बार संपादित किया गया 2 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास