स्व-पर्यवेक्षित अधिगम एक प्रशिक्षण दृष्टिकोण है जिसमें एक मॉडल उस डेटा से सीखता है जिसमें मानव-प्रदत्त लेबल नहीं होते, बल्कि वह डेटा की संरचना से सीधे अपना स्वयं का पर्यवेक्षी संकेत निर्मित करता है। जैसा कि Supervised learning में प्रत्येक इनपुट के लिए सही आउटपुट बताया जाता है, उसके विपरीत, मॉडल को एक ऐसा कार्य दिया जाता है जैसे डेटा के शेष भाग से उसके छिपे या लुप्त हिस्से की भविष्यवाणी करना, और उस कार्य के लिए "लेबल" केवल वह वास्तविक मान होता है जो छिपाया गया था, जो पहले से ही कच्चे, बिना लेबल वाले डेटासेट में बिना किसी अतिरिक्त एनोटेशन लागत के मौजूद होता है।
मूल विचार और उद्देश्य
सबसे विशिष्ट उदाहरण अगला-टोकन भविष्यवाणी है: पाठ के एक अनुक्रम से अंतिम शब्द हटाकर, एक मॉडल को उस शब्द की भविष्यवाणी करने के लिए प्रशिक्षित किया जाता है, और क्योंकि सामान्य पाठ में पहले से ही उसका अगला शब्द होता है, किसी मानव को कभी भी कुछ लेबल नहीं करना पड़ता। यह ठीक वही उद्देश्य है जिसका उपयोग आधुनिक बड़े भाषा मॉडल को पूर्व-प्रशिक्षित करने के लिए किया जाता है, जो Common Crawl जैसे स्रोतों से एकत्रित विशाल मात्रा में कच्चे पाठ से केवल एक अनुक्रम में अगले टोकन की बार-बार भविष्यवाणी करके सीखते हैं। एक संबंधित उद्देश्य, मास्क्ड-टोकन भविष्यवाणी, एक अनुक्रम के भीतर टोकनों के एक यादृच्छिक उपसमूह को छिपाता है और मॉडल को आसपास के संदर्भ से उन्हें वापस भरने के लिए प्रशिक्षित करता है; यह BERT के पीछे का पूर्व-प्रशिक्षण उद्देश्य था। कंप्यूटर विज़न और मल्टीमॉडल अधिगम में, स्व-पर्यवेक्षित उद्देश्यों में एक छवि के मास्क्ड-आउट क्षेत्र की भविष्यवाणी करना, और कंट्रास्टिव उद्देश्य शामिल हैं, जिनका उपयोग CLIP द्वारा किया जाता है, जो मॉडल को यह पहचानने के लिए प्रशिक्षित करते हैं कि छवि और पाठ के कौन से जोड़े (या एक ही छवि के दो संवर्धित दृश्य) एक साथ हैं बनाम कौन से बेमेल हैं।
पर्यवेक्षित और अ-पर्यवेक्षित अधिगम से संबंध
स्व-पर्यवेक्षित अधिगम अवधारणात्मक रूप से पर्यवेक्षित अधिगम और Unsupervised learning के बीच स्थित है। यह अ-पर्यवेक्षित अधिगम की तरह बिना लेबल वाले डेटा से काम करता है, लेकिन यह स्पष्ट सही उत्तर के साथ एक स्पष्ट भविष्यवाणी कार्य परिभाषित करता है, और इसे सामान्य पर्यवेक्षित प्रशिक्षण में उपयोग किए जाने वाले समान हानि फलन, Gradient descent और Backpropagation तंत्र के साथ अनुकूलित किया जाता है। कुछ शोधकर्ता इसे अ-पर्यवेक्षित अधिगम का एक उपप्रकार मानते हैं; अन्य इसे अपनी स्वयं की श्रेणी मानते हैं क्योंकि इसकी प्रशिक्षण प्रक्रिया पर्यवेक्षित अधिगम से बहुत निकटता से मिलती-जुलती है, केवल लेबल के स्रोत में भिन्नता होती है।
यह क्यों महत्वपूर्ण है
स्व-पर्यवेक्षित अधिगम ने एक मौलिक बाधा को हल किया जिसने पर्यवेक्षित अधिगम को सीमित किया था: मानव-लेबल वाले डेटा की कमी और लागत। क्योंकि इंटरनेट और अन्य बड़े संग्रहों में पहले से ही विशाल मात्रा में बिना लेबल वाला पाठ, चित्र, ऑडियो और वीडियो मौजूद है, स्व-पर्यवेक्षित उद्देश्यों ने मॉडलों को उस पैमाने पर प्रशिक्षित करने की अनुमति दी जो लेबल वाले डेटासेट कभी मेल नहीं खा सकते थे, एक बदलाव जिसने सीधे आधुनिक फाउंडेशन मॉडल युग के पीछे स्केलिंग को सक्षम किया। यह वह तंत्र है जिसके द्वारा Transfer learning भाषा के लिए इतना प्रभावी बन गया: एक मॉडल जो व्यापक पाठ पर स्व-पर्यवेक्षित उद्देश्य के साथ पूर्व-प्रशिक्षित होता है, वह ऐसे सामान्य प्रतिनिधित्व सीखता है जो अपेक्षाकृत कम कार्य-विशिष्ट Fine-tuning के साथ कई नीचे-धारा कार्यों में अच्छी तरह से स्थानांतरित होने के लिए पर्याप्त होते हैं।
उल्लेखनीय मील के पत्थर और प्रभाव
Word2vec का 2013 का शब्द-भविष्यवाणी उद्देश्य भाषा पर लागू स्व-पर्यवेक्षित अधिगम का एक प्रारंभिक प्रभावशाली उदाहरण है, हालांकि उस समय यह शब्द अभी व्यापक उपयोग में नहीं था। यह दृष्टिकोण 2018 में BERT और GPT श्रृंखला के बाद क्षेत्र की शब्दावली और रणनीति का केंद्र बन गया, और 2020 के दशक की शुरुआत तक स्व-पर्यवेक्षित पूर्व-प्रशिक्षण के बाद पर्यवेक्षित या वरीयता-आधारित फाइन-ट्यूनिंग अनिवार्य रूप से हर प्रमुख बड़े भाषा मॉडल के लिए मानक विधि बन गई थी। यही प्रतिमान पाठ से परे भी विस्तारित हुआ: भविष्य के फ्रेम की भविष्यवाणी करने वाले स्व-पर्यवेक्षित वीडियो मॉडल रोबोटिक्स और स्वायत्त प्रणालियों के लिए विश्व मॉडलों पर शोध का एक मूलभूत घटक हैं। स्व-पर्यवेक्षित अधिगम की केंद्रीय सीमा यह है कि परिणामी प्रतिनिधित्व की गुणवत्ता अभी भी अंतर्निहित बिना लेबल वाले डेटा की गुणवत्ता, पैमाने और विविधता पर निर्भर करती है, और उस डेटा में मौजूद पूर्वाग्रह या अंतराल मॉडल में उसी तरह अवशोषित हो जाते हैं जैसे वे पर्यवेक्षित प्रशिक्षण में होते हैं।