ImageNet-1K, ImageNet दृश्य डेटाबेस का एक मानकीकृत उपसमुच्चय है, जिसमें ठीक 1,000 गैर-अतिव्यापी वस्तु वर्ग शामिल हैं। इसे ImageNet लार्ज स्केल विज़ुअल रिकग्निशन चैलेंज (ILSVRC) के लिए वर्गीकरण और स्थानीयकरण बेंचमार्क के रूप में पेश किया गया था, जो 2010 में शुरू हुआ था। यह उपसमुच्चय बड़े ImageNet डेटासेट से लिया गया था, जिसमें 20,000 से अधिक श्रेणियों में 14 मिलियन से अधिक हाथ-एनोटेटेड चित्र हैं, जिसमें गणनीय संज्ञाओं और दृश्य रूप से अलग वर्गों की एक छंटनी सूची का चयन किया गया था। ImageNet-1K मशीन लर्निंग और डीप लर्निंग में एक महत्वपूर्ण संदर्भ बिंदु बन गया, जो 2010 के दशक के दौरान तंत्रिका नेटवर्क आर्किटेक्चर और प्रशिक्षण तकनीकों में प्रगति के लिए प्राथमिक परीक्षण स्थल के रूप में कार्य करता है।
डेटासेट की छवियां तृतीय-पक्ष URL से प्राप्त होती हैं और ImageNet की स्वामित्व वाली नहीं हैं। प्रत्येक छवि पर ठीक एक वर्ग पहचानकर्ता लेबल होता है, जिसे WordNet ID (wnid) के रूप में जाना जाता है, जो WordNet शाब्दिक डेटाबेस में एक सिनसेट से मेल खाता है। श्रेणियां रोजमर्रा की वस्तुओं की एक विस्तृत श्रृंखला में फैली हुई हैं, जानवरों और पौधों से लेकर वाहनों और घरेलू सामानों तक, और इसमें सूक्ष्म भेदभाव का परीक्षण करने के लिए 120 बारीक-दाने वाली कुत्ते की नस्ल कक्षाएं शामिल हैं। ImageNet-1K छवियां अलग-अलग रिज़ॉल्यूशन के साथ RGB प्रारूप में हैं, आमतौर पर मॉडल में डालने से पहले एक निश्चित आकार में पूर्व-संसाधित और सामान्यीकृत की जाती हैं।
इतिहास और निर्माण
एआई शोधकर्ता फेई-फेई ली ने 2006 में ImageNet परियोजना की कल्पना की, जिसका उद्देश्य एआई अनुसंधान का ध्यान एल्गोरिदम से हटाकर बड़े पैमाने पर डेटा पर केंद्रित करना था। 2007 में, उन्होंने प्रिंसटन के प्रोफेसर क्रिस्टियाने फेलबाम से मुलाकात की, जो WordNet के निर्माता हैं, और WordNet की संज्ञा पदानुक्रम को रीढ़ की हड्डी के रूप में उपयोग करके डेटासेट बनाने का निर्णय लिया। यह परियोजना जुलाई 2008 में अमेज़ॅन मैकेनिकल टर्क का उपयोग करके लेबलिंग शुरू हुई, जिसमें 167 देशों के 49,000 श्रमिकों ने 160 मिलियन से अधिक उम्मीदवार छवियों को फ़िल्टर किया। लेबलिंग अप्रैल 2010 में समाप्त हुई, प्रत्येक 14 मिलियन छवियों को तीन बार सत्यापित किया गया।
मूल योजना में 40,000 श्रेणियों की कल्पना की गई थी जिनमें से प्रत्येक में 10,000 छवियां होंगी, लेकिन व्यावहारिक बाधाओं, जिसमें लगभग 2 छवियों प्रति सेकंड की मानव वर्गीकरण गति शामिल है, ने एक कम दायरे को जन्म दिया। पहली सार्वजनिक प्रस्तुति 2009 में फ्लोरिडा में कंप्यूटर विज़न और पैटर्न पहचान सम्मेलन (CVPR) में एक पोस्टर थी। 2009 में, एलेक्स बर्ग ने ऑब्जेक्ट लोकलाइज़ेशन जोड़ने का सुझाव दिया, जिससे PASCAL विज़ुअल ऑब्जेक्ट क्लासेस प्रतियोगिता के साथ सहयोग हुआ और 2010 में 1,000 वर्गों के साथ ILSVRC का शुभारंभ हुआ।
डीप लर्निंग में भूमिका
ImageNet-1K ने 30 सितंबर 2012 को प्रमुखता प्राप्त की, जब AlexNet नामक एक कन्वोल्यूशनल तंत्रिका नेटवर्क ने ImageNet 2012 चैलेंज में 15.3% की शीर्ष-5 त्रुटि हासिल की, जो उपविजेता से 10.8 प्रतिशत अंकों से बेहतर थी। यह सफलता ग्राफिक्स प्रोसेसिंग इकाइयों (GPUs) पर प्रशिक्षण द्वारा संभव हुई, जो डीप लर्निंग क्रांति का एक प्रमुख घटक है। जैसा कि द इकोनॉमिस्ट ने उल्लेख किया, इस परिणाम ने प्रौद्योगिकी उद्योग में ध्यान आकर्षित किया।
बाद के वर्षों में तेजी से प्रगति देखी गई। 2015 में, माइक्रोसॉफ्ट के 100 से अधिक परतों वाले बहुत गहरे CNN ने 3.57% त्रुटि दर के साथ ImageNet 2015 प्रतियोगिता जीती। मानव प्रदर्शन का अनुमान आंद्रेई करपाथी ने 2014 में केंद्रित प्रयास के साथ लगभग 5.1% और अधिकतम प्रयास के साथ संभावित रूप से 2.4% लगाया था, जो दर्शाता है कि मॉडल जल्द ही इस बेंचमार्क पर मानव-स्तरीय वर्गीकरण के करीब पहुंच गए या उससे अधिक हो गए। ImageNet-1K अवशिष्ट नेटवर्क आर्किटेक्चर, बैच सामान्यीकरण और डेटा संवर्धन तकनीकों जैसे नवाचारों के लिए मानक मूल्यांकन सेट बन गया।
डेटासेट संरचना
ImageNet-1K श्रेणियां WordNet 3.0 से फ़िल्टर की गई हैं, जिसमें 80,000 से अधिक संज्ञा सिनसेट हैं। चयन प्रक्रिया ने पूर्ण ImageNet के लिए 21,841 सिनसेट बनाए रखा, और ILSVRC के लिए 1,000-वर्ग उपसमुच्चय चुना गया। प्रत्येक सिनसेट में एक अद्वितीय wnid होता है, जैसे "n02084071" "कुत्ता, घरेलू कुत्ता, कैनिस फेमिलेरिस" के लिए। श्रेणियां 9 स्तरों के पदानुक्रम में व्यवस्थित हैं, व्यापक अवधारणाओं जैसे "स्तनपायी" से लेकर विशिष्ट नस्लों जैसे "जर्मन शेफर्ड" तक।
छवियों को Google, Picsearch, MSN, Yahoo और Flickr सहित ऑनलाइन खोज इंजनों से कई भाषाओं में समानार्थक शब्दों का उपयोग करके स्क्रैप किया गया था। उदाहरण के लिए, जर्मन शेफर्ड श्रेणी ने "Alsatian" और "pastore tedesco" जैसे क्वेरी का उपयोग किया। रिज़ॉल्यूशन व्यापक रूप से भिन्न होते हैं, मछली श्रेणी में 4288 x 2848 से 75 x 56 पिक्सेल तक। व्यवहार में, छवियों को एक स्थिर रिज़ॉल्यूशन में आकार दिया जाता है और सफ़ेद किया जाता है; उदाहरण के लिए, PyTorch पिक्सेल मानों को [0,1] में विभाजित करके, माध्य [0.485, 0.456, 0.406] घटाकर, और मानक विचलन [0.229, 0.224, 0.225] से विभाजित करके सामान्यीकृत करता है।
एनोटेशन और उपयोग
प्रत्येक ImageNet-1K छवि पर एक एकल वर्ग लेबल होता है। पूर्ण ImageNet लगभग 3,000 लोकप्रिय सिनसेट में लगभग 1 मिलियन छवियों के लिए बाउंडिंग बॉक्स एनोटेशन भी प्रदान करता है, जिससे ऑब्जेक्ट लोकलाइज़ेशन कार्य सक्षम होते हैं। डेंस SIFT सुविधाओं को 1,000-वर्ग उपसमुच्चय के लिए जारी किया गया था, जो बैग-ऑफ-विज़ुअल-शब्द दृष्टिकोण के लिए डिज़ाइन किया गया था, हालांकि डीप लर्निंग के उदय के साथ ये कम आम हो गए।
2010 की सारांश के अनुसार, ImageNet में 21,841 गैर-खाली सिनसेट, 14,197,122 छवियां और 1,034,908 बाउंडिंग बॉक्स वाली छवियां थीं। डेटासेट के एनोटेशन स्वतंत्र रूप से उपलब्ध हैं, लेकिन छवियां स्वयं ImageNet की स्वामित्व वाली नहीं हैं। ImageNet-1K अभी भी कृत्रिम बुद्धिमत्ता में प्रीट्रेनिंग और बेंचमार्किंग के लिए व्यापक रूप से उपयोग किया जाता है, बड़े डेटासेट और वैकल्पिक बेंचमार्क के उद्भव के बावजूद।
विरासत और प्रभाव
ImageNet-1K पर AlexNet की सफलता ने डीप लर्निंग बूम को उत्प्रेरित किया, जिसने कंप्यूटर विज़न से परे क्षेत्रों को प्रभावित किया, जिसमें प्राकृतिक भाषा प्रसंस्करण और बड़े भाषा मॉडल विकास शामिल हैं। बेंचमार्क के स्पष्ट मेट्रिक्स और बड़े पैमाने ने इसे मॉडल आर्किटेक्चर, प्रशिक्षण विधियों और हार्डवेयर दक्षता की तुलना करने के लिए एक मानक बना दिया। हालांकि, एनोटेशन शोर और डेटासेट की स्थिर प्रकृति के बारे में चिंताओं ने आलोचनाओं को जन्म दिया है, और कुछ शोधकर्ताओं ने नए बेंचमार्क प्रस्तावित किए हैं। फिर भी, ImageNet-1K मशीन लर्निंग अनुसंधान और शिक्षा में एक मौलिक संसाधन बना हुआ है।