STL-10 एक बेंचमार्क इमेज डेटासेट है जिसे अनुपरिवेक्षित (unsupervised) और स्व-पर्यवेक्षित (self-supervised) शिक्षण में अनुसंधान का समर्थन करने के लिए बनाया गया है। यह लेबल किए गए उदाहरणों के अपेक्षाकृत छोटे सेट (कुल 13,000) के साथ-साथ बड़ी संख्या में बिना लेबल वाली छवियों (100,000) को शामिल करने के लिए उल्लेखनीय है। यह डिज़ाइन एल्गोरिदम को लेबल किए गए सबसेट पर फाइन-ट्यूनिंग से पहले उपयोगी दृश्य विशेषताओं को सीखने के लिए बिना लेबल वाले डेटा का लाभ उठाने के लिए प्रोत्साहित करता है, जो व्यावहारिक परिदृश्यों को दर्शाता है जहां लेबल किया गया डेटा दुर्लभ है लेकिन बिना लेबल वाला डेटा प्रचुर मात्रा में है।
डेटासेट में 10 वर्ग शामिल हैं: हवाई जहाज, पक्षी, कार, बिल्ली, हिरण, कुत्ता, घोड़ा, बंदर, जहाज और ट्रक। प्रत्येक लेबल वाले वर्ग में 1,300 नमूने होते हैं, जो 500 प्रशिक्षण के लिए, 500 परीक्षण के लिए और 300 सत्यापन के लिए विभाजित होते हैं (एक विभाजन जो सभी शोधकर्ताओं द्वारा सामान्य रूप से उपयोग नहीं किया जाता है, जो अक्सर प्रशिक्षण और सत्यापन को जोड़ते हैं)। प्रत्येक छवि 96x96 पिक्सेल आरजीबी रंग में है। बिना लेबल वाला हिस्सा, जो जानवरों और वाहनों की बहुत व्यापक श्रेणियों से लिया गया है (जिसमें कुछ ऐसे भी शामिल हैं जो लेबल किए गए सेट में मौजूद नहीं हैं), अनुपरिवेक्षित शिक्षण के लिए एक बड़ी चुनौती प्रदान करता है, और सभी छवियां ImageNet के समान वितरण से ली गई हैं।
इतिहास और उत्पत्ति
STL-10 को 2011 में स्टैनफोर्ड विश्वविद्यालय (विशेष रूप से स्टैनफोर्ड एआई लैब) के एडम कोट्स, होंगलाक ली और एंड्रयू वाई. एनजी द्वारा गहन शिक्षण और फीचर निष्कर्षण पर उनके शोध के हिस्से के रूप में पेश किया गया था। पेपर 'An Analysis of Single-Layer Networks in Unsupervised Feature Learning' ने औपचारिक रूप से डेटासेट प्रस्तुत किया। लक्ष्य विशाल कम्प्यूटेशनल संसाधनों की आवश्यकता के बिना अनुपरिवेक्षित फीचर लर्निंग एल्गोरिदम का मूल्यांकन करने के लिए एक कॉम्पैक्ट फिर भी यथार्थवादी बेंचमार्क प्रदान करना था, क्योंकि 96x96 पिक्सेल पर यह तेज़ प्रयोग के लिए पर्याप्त छोटा है लेकिन CIFAR-10 की 32x32 छवियों की तुलना में उच्च रिज़ॉल्यूशन है।
डेटासेट का डिज़ाइन सीधे मशीन-लर्निंग और डीप-लर्निंग में अनुसंधान का समर्थन करता है, विशेष रूप से न्यूरल-नेटवर्क आर्किटेक्चर के लिए जो बिना लेबल वाले डेटा से प्रतिनिधित्व सीखते हैं। इसका निर्माण उसी समूह के पहले के काम के बाद हुआ, जिसमें CIFAR-10 और CIFAR-100 डेटासेट शामिल थे, लेकिन STL-10 विशेष रूप से महंगे मानव लेबलिंग की आवश्यकता को कम करने के लिए बिना लेबल वाले विकल्पों के उपयोग पर जोर देता है।
डीप लर्निंग अनुसंधान से संबंध
STL-10 कृत्रिम-बुद्धिमत्ता के अध्ययन में एक मानक बेंचमार्क बन गया है, विशेष रूप से ऑटोएनकोडर, प्रतिबंधित बोल्ट्ज़मैन मशीन और बाद में कंट्रास्टिव लर्निंग दृष्टिकोण जैसे प्री-ट्रेनिंग तरीकों के मूल्यांकन के लिए। 2010 के दशक के अंत और 2020 के दशक की शुरुआत में, जैसे-जैसे स्व-पर्यवेक्षित-शिक्षण ने लोकप्रियता हासिल की, STL-10 अक्सर उपयोग किया जाने वाला मूल्यांकन कार्य बना रहा। इसकी 100,000 बिना लेबल वाली छवियां ImageNet जैसे बड़े पैमाने के बिना लेबल वाले डेटासेट के लिए एक आदर्श प्रॉक्सी के रूप में काम करती हैं, लेकिन प्रबंधनीय स्थानिक आकार और सुगम संख्या में श्रेणियों के साथ।
क्योंकि लेबल किया गया डेटा इतना सीमित है (प्रति वर्ग प्रशिक्षण के लिए 500), डेटासेट एल्गोरिदम को बिना लेबल वाले पूल का प्रभावी ढंग से उपयोग करने के लिए मजबूर करता है, जिससे यह फीचर लर्निंग का एक कठोर परीक्षण बन जाता है। जो मॉडल STL-10 पर उच्च सटीकता प्राप्त करते हैं, वे आम तौर पर मजबूत सामान्यीकरण प्रदर्शित करते हैं, यही कारण है कि यह शैक्षणिक तुलनाओं के लिए एक वैध लक्ष्य बना हुआ है। डेटासेट का उपयोग अक्सर OpenAI या Google DeepMind जैसे समूहों की वास्तुशिल्प प्रगति के साथ कम लागत वाली सेटिंग में नए तरीकों का परीक्षण करने के लिए किया जाता है।
डेटा संरचना और पहुंच
STL-10 को लेबल की एक ASCII सूची (0-9) के साथ बाइनरी फ़ाइलों के एक सेट के रूप में वितरित किया जाता है। इसके प्रकाशन के बाद से, इसे कई रूपों में तैयार किया गया है, जिसमें कई लाइब्रेरीज़ में एकीकरण शामिल है, उदाहरण के लिए, TensorFlow और PyTorch डेटासेट सीधे उपयोग के लिए। बिना लेबल वाले सेट में 10 लेबल वाले वर्गों की तुलना में कई अधिक वर्ग होते हैं, हालांकि आधिकारिक दस्तावेज़ सटीक श्रेणी के नाम प्रदान नहीं करता है। संबंधित छवियां ImageNet के एक बड़े सेट के नमूने हैं, जो जानवरों और दृश्यों पर एक व्यापक वितरण का प्रतिनिधित्व करती हैं, यह नोट किया गया है।
व्यावहारिक लाभों में से एक डाउनलोड या लाइसेंस की आवश्यकता का अभाव है। स्टैनफोर्ड द्वारा मूल होस्टिंग (अन्य विश्वविद्यालयों में एक मिरर के साथ) अनुसंधान के लिए मुफ्त पहुंच देती है। 2020 के दशक तक, यह शैक्षणिक पेपरों में तुलना के लिए एक सामान्य विषय बना हुआ है, हालांकि इसके बड़े फ़ाइल आकार (लगभग 1.5 जीबी असंतुलित बनाम ~170 एमबी) के कारण CIFAR-10 की तुलना में कम लोकप्रिय है।
स्व-पर्यवेक्षित शिक्षण में उपयोग
दृष्टि के लिए ट्रांसफॉर्मर आर्किटेक्चर (जैसे ViT) के युग में, STL-10 स्व-पर्यवेक्षित प्री-ट्रेनिंग के लिए एक मूल्यांकन सूट के रूप में प्रासंगिक बना हुआ है। SimCLR, BYOL और DINO जैसे तरीकों ने STL-10 पर परीक्षण की सूचना दी है, छोटे लेबल वाले सेट पर पर्यवेक्षित बेसलाइन के खिलाफ अपने प्रदर्शन की तुलना की है। डेटासेट वास्तव में एक ऐसा परिदृश्य प्रदान करता है जहां अनुपरिवेक्षित प्री-ट्रेनिंग बहुत लाभ दे सकती है: 5k प्रशिक्षण बनाम 100k बिना लेबल वाली छवियां (लेकिन उच्च रिज़ॉल्यूशन की छवियों के साथ)।
इसके अलावा, STL-10 का उपयोग अक्सर न केवल वर्गीकरण के लिए बल्कि प्रतिनिधित्व सीखने की गुणवत्ता के लिए भी नई तकनीकों को बेंचमार्क करने के लिए किया जाता है, जैसे कि सीखी गई विशेषताओं पर लीनियर प्रोबिंग या KNN वर्गीकरण। बहुत बड़ा बिना लेबल वाला पूल (CIFAR-10 के 50k की तुलना में) बिना लेबल वाले उदाहरणों की संख्या के प्रति संवेदनशीलता दिखाता है, और बड़े डेटासेट में एल्गोरिदम की स्केलेबिलिटी का परीक्षण करने की अनुमति देता है। जबकि ImageNet (1.28M) जैसे पूर्व आधुनिक बेंचमार्क प्राथमिक लक्ष्य के रूप में आगे निकल गए हैं, STL-10 अभी भी अपनी कम्प्यूटेशनल दक्षता के लिए मूल्य रखता है।
सीमाएं और विरासत
2010 के दशक की शुरुआत के डेटासेट के रूप में, STL-10 में कुछ कमियां हैं। इसका 96-पिक्सेल रिज़ॉल्यूशन अपेक्षाकृत मध्यम है, ImageNet के विविध रिज़ॉल्यूशन जितना उच्च नहीं है, लेकिन इसकी छवि विविधता कम है। लेबल किए गए वर्ग 10 तक सीमित हैं, जो एल्गोरिदम को उन श्रेणियों के भीतर सूक्ष्म-पहचान कार्य करने के लिए मजबूर करता है। बिना लेबल वाले सेट की सामग्री लेबल किए गए सेट से पूरी तरह से अलग नहीं है, लेकिन प्रयोग डिज़ाइन से ज्ञात है, इसमें उन्हीं वर्गों (जानवरों) की छवियां हो सकती हैं जो लेबल नहीं हैं।
फिर भी, इसकी रिलीज़ ने आधुनिक तरीकों के विकास में योगदान दिया है। मजबूत लेकिन छोटे लेबल वाले सेट और बड़े बिना लेबल वाले पूल का इसका संयोजन बाद में कमजोर पर्यवेक्षित शिक्षण में रुचि का पूर्वाभास कराता है। बर्कले एआई रिसर्च और एमआईटी के कंप्यूटर साइंस जैसी प्रयोगशालाओं में कृत्रिम-बुद्धिमत्ता में कई प्रमुख प्रगति ने अनुपरिवेक्षित फीचर निष्कर्षण पर पेपरों में इसका उपयोग किया है, जो दृष्टि बेंचमार्क में इसके स्थायी प्रभाव को दर्शाता है। STL-10 का उपयोग अक्सर शैक्षणिक सम्मेलनों में एक मानक कार्य पर संक्षिप्त प्रगति दिखाने के लिए भी किया जाता है। 2023 तक, यह डीप-लर्निंग पाठ्यक्रमों में एक मानक व्याख्यान उदाहरण और कई लाइब्रेरी दस्तावेज़ों में एक स्थिर संदर्भ बना हुआ है।
यह भी देखें
- CIFAR-10 - समान वर्ग श्रेणियों वाला एक छोटा 32x32 रिज़ॉल्यूशन डेटासेट
- ImageNet - एक बहुत बड़ा डेटासेट जो STL-10 की बिना लेबल वाली छवियों के स्रोत से निकटता से संबंधित है
- अनुपरिवेक्षित शिक्षण - लेबल के बिना सीखने का व्यापक प्रतिमान, जो STL-10 का मुख्य उद्देश्य है