अनसुपरवाइज़्ड लर्निंग मशीन-लर्निंग की एक श्रेणी है जिसमें मॉडल को बिना किसी लेबल वाले आउटपुट के डेटा दिया जाता है और उसे स्वयं संरचना, पैटर्न या समूहों की खोज करनी होती है, बजाय सुपरवाइज़्ड लर्निंग की तरह किसी ज्ञात सही उत्तर को पुनरुत्पादित करने के लिए प्रशिक्षित किए जाने के। चूँकि अनसुपरवाइज़्ड विधियों को मानव-एनोटेटेड लेबल की आवश्यकता नहीं होती, इन्हें दुनिया में उपलब्ध कच्चे, बिना लेबल वाले डेटा की विशाल मात्रा पर सीधे लागू किया जा सकता है, जैसे कि असंरचित पाठ, चित्र, या लेनदेन लॉग, जिससे यह दृष्टिकोण उन स्थितियों में आकर्षक बन जाता है जहाँ लेबलिंग महंगी, धीमी, या पैमाने पर असंभव है।
Core tasks
सबसे आम अनसुपरवाइज़्ड कार्य क्लस्टरिंग है, जो बिना किसी पूर्व-निर्धारित श्रेणी के समान डेटा बिंदुओं को एक साथ समूहित करता है, जिसमें k-means या पदानुक्रमित क्लस्टरिंग जैसे एल्गोरिदम का उपयोग किया जाता है; एक खुदरा विक्रेता बिना यह जाने कि परिणामी खंड क्या होने चाहिए, खरीदारी व्यवहार के आधार पर ग्राहकों को क्लस्टर कर सकता है। आयामीता में कमी की तकनीकें, जिनमें प्रिंसिपल कंपोनेंट विश्लेषण और ऑटोएनकोडर शामिल हैं, उच्च-आयामी डेटा को कम संख्या में चरों में संपीड़ित करती हैं, जबकि इसकी अंतर्निहित संरचना को यथासंभव संरक्षित रखती हैं, जो अक्सर विज़ुअलाइज़ेशन या अन्य मॉडलों के लिए प्रीप्रोसेसिंग चरण के रूप में उपयोगी होती हैं। विसंगति का पता लगाना अनसुपरवाइज़्ड विधियों का उपयोग करके उन डेटा बिंदुओं को चिह्नित करता है जो डेटासेट के बड़े हिस्से से काफी भिन्न होते हैं, जो धोखाधड़ी का पता लगाने और औद्योगिक निगरानी में लागू होता है। घनत्व अनुमान और जनरेटिव मॉडलिंग, जिसका उदाहरण जनरेटिव एडवरसैरियल नेटवर्क और डिफ्यूज़न मॉडल हैं, डेटासेट के अंतर्निहित संभाव्यता वितरण को इतनी अच्छी तरह से सीखते हैं कि उससे नए, यथार्थवादी नमूने उत्पन्न कर सकें।
History
क्लस्टरिंग और प्रिंसिपल कंपोनेंट विश्लेषण जैसी अनसुपरवाइज़्ड तकनीकों की जड़ें आधुनिक मशीन-लर्निंग से बहुत पहले सांख्यिकी में हैं, और अनसुपरवाइज़्ड लर्निंग के तंत्रिका दृष्टिकोण, जिनमें 1980 के दशक में जॉन हॉपफील्ड द्वारा विकसित प्रारंभिक ऑटोएनकोडर और हॉपफील्ड नेटवर्क शामिल हैं, डीप लर्निंग युग से पहले के हैं। हालाँकि, 2000 के दशक और 2010 के दशक की शुरुआत के अधिकांश समय के लिए, बड़े लेबल वाले डेटासेट पर सुपरवाइज़्ड लर्निंग ने अधिकांश व्यावहारिक बेंचमार्क पर अनसुपरवाइज़्ड दृष्टिकोणों से बेहतर प्रदर्शन किया, और अनसुपरवाइज़्ड लर्निंग को मुख्य रूप से खोजपूर्ण विश्लेषण या प्रीप्रोसेसिंग चरण के रूप में देखा गया, न कि अत्याधुनिक परिणामों के मार्ग के रूप में।
Relationship to self-supervised learning
अनसुपरवाइज़्ड लर्निंग और स्व-पर्यवेक्षित लर्निंग के बीच का अंतर अक्सर भ्रम का स्रोत होता है। स्व-पर्यवेक्षित लर्निंग को कभी-कभी अनसुपरवाइज़्ड लर्निंग के उपसमुच्चय या आधुनिक पुनर्परिभाषा के रूप में वर्णित किया जाता है: दोनों बिना लेबल वाले डेटा पर काम करते हैं, लेकिन स्व-पर्यवेक्षित विधियाँ डेटा से ही एक स्पष्ट, स्वचालित रूप से उत्पन्न भविष्यवाणी कार्य का निर्माण करती हैं, जैसे कि मास्क किए गए शब्द या अनुक्रम में अगले टोकन की भविष्यवाणी करना, जो उन्हें सुपरवाइज़्ड लर्निंग के समान एक स्पष्ट प्रशिक्षण संकेत देता है, भले ही किसी मानव ने कभी डेटा को लेबल नहीं किया हो। यह अंतर मायने रखता है क्योंकि स्व-पर्यवेक्षित प्रीट्रेनिंग, न कि क्लासिकल अनसुपरवाइज़्ड लर्निंग जो क्लस्टरिंग या आयामीता-कमी के अर्थ में है, आधुनिक बड़े भाषा मॉडल और अन्य फाउंडेशन मॉडल के प्रशिक्षण को शक्ति प्रदान करती है।
Applications and significance
अनसुपरवाइज़्ड लर्निंग का उपयोग खोजपूर्ण डेटा विश्लेषण, ग्राहक विभाजन, विषय मॉडलिंग, अनुशंसा प्रणाली प्रीट्रेनिंग, और विसंगति और धोखाधड़ी का पता लगाने वाली पाइपलाइनों के घटक के रूप में व्यापक रूप से जारी है। विशेष रूप से डीप लर्निंग में, इसकी जनरेटिव शाखा, GAN और बाद में डिफ्यूज़न मॉडल, आधुनिक टेक्स्ट-टू-इमेज और टेक्स्ट-टू-वीडियो प्रणालियों की नींव बन गए, जो प्राकृतिक छवियों के स्थान जैसे जटिल डेटा वितरणों को सीखने और उनसे नमूना लेने के द्वारा बने।
Limitations
चूँकि अनसुपरवाइज़्ड लर्निंग के पास जाँचने के लिए कोई ग्राउंड-ट्रुथ उत्तर नहीं होता, इसके परिणामों का मूल्यांकन करना स्वाभाविक रूप से सुपरवाइज़्ड मॉडलों के मूल्यांकन की तुलना में अधिक कठिन और अधिक व्यक्तिपरक होता है: एक क्लस्टरिंग परिणाम को वर्गीकरण भविष्यवाणी की तरह केवल "सही" या "गलत" के रूप में स्कोर नहीं किया जा सकता, और एक ही डेटा पर लागू विभिन्न अनसुपरवाइज़्ड एल्गोरिदम सार्थक रूप से भिन्न, समान रूप से बचाव योग्य समूह उत्पन्न कर सकते हैं। यह अस्पष्टता इसका एक कारण है कि क्षेत्र की सबसे बड़ी हालिया सफलताएँ, विशेष रूप से भाषा और छवि निर्माण में, क्लासिकल अनसुपरवाइज़्ड क्लस्टरिंग और घनत्व अनुमान विधियों के बजाय अधिक संरचित स्व-पर्यवेक्षित प्रतिमान पर निर्भर रही हैं।