ImageNet एक बड़े पैमाने पर दृश्य डेटाबेस है जिसे दृश्य वस्तु पहचान सॉफ्टवेयर अनुसंधान में उपयोग के लिए डिज़ाइन किया गया है। यह परियोजना 14 मिलियन से अधिक हाथ से एनोटेट की गई छवियां प्रदान करती है जो चित्रित वस्तुओं को दर्शाती हैं, जिनमें से कम से कम एक मिलियन छवियों में बाउंडिंग बॉक्स भी शामिल हैं। इसमें 20,000 से अधिक श्रेणियां शामिल हैं, जिनमें से प्रत्येक में आमतौर पर कई सौ छवियां होती हैं। तीसरे पक्ष के छवि URL के लिए एनोटेशन का डेटाबेस स्वतंत्र रूप से उपलब्ध है, हालांकि वास्तविक छवियां ImageNet की स्वामित्व वाली नहीं हैं। 2010 से, यह परियोजना एक वार्षिक सॉफ्टवेयर प्रतियोगिता, ImageNet लार्ज स्केल विज़ुअल रिकग्निशन चैलेंज (ILSVRC) चला रही है, जहां कार्यक्रम एक हजार गैर-अतिव्यापी वर्गों की छंटनी की गई सूची का उपयोग करके वस्तुओं और दृश्यों को वर्गीकृत और पहचानने के लिए प्रतिस्पर्धा करते हैं।
इतिहास
एआई शोधकर्ता फेई-फेई ली ने 2006 में ImageNet के लिए विचार विकसित करना शुरू किया। उस समय जब अधिकांश एआई अनुसंधान मॉडल और एल्गोरिदम पर केंद्रित था, ली का लक्ष्य एआई एल्गोरिदम को प्रशिक्षित करने के लिए उपलब्ध डेटा का विस्तार और सुधार करना था। 2007 में, ली ने प्रिंसटन के प्रोफेसर क्रिस्टियाने फेलबाम से मुलाकात की, जो WordNet के रचनाकारों में से एक हैं, ताकि परियोजना पर चर्चा की जा सके। इस बैठक ने ली को WordNet के लगभग 22,000 संज्ञाओं से शुरू करके ImageNet बनाने के लिए प्रेरित किया और इसकी कई विशेषताओं को अपनाया। वह 1987 के एक अनुमान से भी प्रेरित थीं कि औसत व्यक्ति लगभग 30,000 विभिन्न प्रकार की वस्तुओं को पहचानता है।
प्रिंसटन में सहायक प्रोफेसर के रूप में, ली ने परियोजना पर काम करने के लिए शोधकर्ताओं की एक टीम इकट्ठी की। उन्होंने छवियों को वर्गीकृत करने में मदद के लिए अमेज़न मैकेनिकल टर्क का उपयोग किया। लेबलिंग जुलाई 2008 में शुरू हुई और अप्रैल 2010 में समाप्त हुई, जिसमें 167 देशों के 49,000 श्रमिकों ने 160 मिलियन से अधिक उम्मीदवार छवियों को फ़िल्टर और लेबल किया। बजट ने प्रत्येक 14 मिलियन छवियों को तीन बार लेबल करने की अनुमति दी। मूल योजना में 40,000 श्रेणियों में प्रति श्रेणी 10,000 छवियों का आह्वान किया गया था, जो कुल 400 मिलियन छवियां बनाती हैं, प्रत्येक को तीन बार सत्यापित किया गया था। हालांकि, मनुष्य अधिकतम 2 छवियों को प्रति सेकंड वर्गीकृत कर सकते हैं, और उस दर पर बिना आराम के श्रम के 19 मानव-वर्ष लेने का अनुमान लगाया गया था।
डेटाबेस को पहली बार 2009 में फ्लोरिडा में कंप्यूटर विज़न और पैटर्न रिकग्निशन सम्मेलन (CVPR) में एक पोस्टर के रूप में प्रस्तुत किया गया था, जिसका शीर्षक था "ImageNet: ए प्रीव्यू ऑफ़ अ लार्ज-स्केल हाइरार्किकल डेटासेट।" 2009 में, एलेक्स बर्ग ने ऑब्जेक्ट लोकलाइज़ेशन को एक कार्य के रूप में जोड़ने का सुझाव दिया। ली ने सहयोग के लिए 2009 में PASCAL विज़ुअल ऑब्जेक्ट क्लासेस प्रतियोगिता से संपर्क किया, जिसके परिणामस्वरूप 2010 में ImageNet लार्ज स्केल विज़ुअल रिकग्निशन चैलेंज शुरू हुआ, जिसमें 1000 वर्ग और ऑब्जेक्ट लोकलाइज़ेशन शामिल थे, जबकि PASCAL VOC के 20 वर्ग और 19,737 छवियां थीं।
डीप लर्निंग के लिए महत्व
30 सितंबर 2012 को, एलेक्सनेट नामक एक कन्वोल्यूशनल न्यूरल नेटवर्क (CNN) ने ImageNet 2012 चैलेंज में 15.3% की शीर्ष-5 त्रुटि हासिल की, जो उपविजेता से 10.8 प्रतिशत अंक से अधिक कम थी। प्रशिक्षण के दौरान ग्राफिक्स प्रोसेसिंग यूनिट (GPU) के उपयोग ने कन्वोल्यूशनल न्यूरल नेटवर्क को संभव बना दिया, जो डीप लर्निंग क्रांति का एक आवश्यक घटक था। द इकोनॉमिस्ट के अनुसार, "अचानक लोगों ने ध्यान देना शुरू कर दिया, न केवल एआई समुदाय के भीतर बल्कि पूरे प्रौद्योगिकी उद्योग में।"
2015 में, एलेक्सनेट को माइक्रोसॉफ्ट के 100 से अधिक परतों वाले बहुत गहरे CNN ने पीछे छोड़ दिया, जिसने परीक्षण सेट पर 3.57% त्रुटि दर के साथ ImageNet 2015 प्रतियोगिता जीती। आंद्रेज करपाथी ने 2014 में अनुमान लगाया कि केंद्रित प्रयास के साथ, वह 5.1% त्रुटि दर तक पहुंच सकते हैं, और उनकी प्रयोगशाला के लगभग 10 लोग कम प्रयास के साथ लगभग 12-13% तक पहुंच गए। यह अनुमान लगाया गया था कि अधिकतम प्रयास के साथ, एक मानव 2.4% तक पहुंच सकता है।
डेटासेट
ImageNet अपनी एनोटेशन प्रक्रिया को क्राउडसोर्स करता है। छवि-स्तरीय एनोटेशन एक छवि में किसी वस्तु वर्ग की उपस्थिति या अनुपस्थिति को दर्शाते हैं, जैसे "इस छवि में बाघ हैं" या "इस छवि में कोई बाघ नहीं हैं।" ऑब्जेक्ट-स्तरीय एनोटेशन संकेतित वस्तु के दृश्य भाग के चारों ओर एक बाउंडिंग बॉक्स प्रदान करते हैं। ImageNet वस्तुओं को वर्गीकृत करने के लिए व्यापक WordNet स्कीमा का एक प्रकार उपयोग करता है, जिसमें बारीक-दानेदार वर्गीकरण प्रदर्शित करने के लिए कुत्तों की नस्लों की 120 श्रेणियां जोड़ी गई हैं।
2012 में, ImageNet मैकेनिकल टर्क का दुनिया का सबसे बड़ा शैक्षणिक उपयोगकर्ता था, जिसमें औसत कार्यकर्ता प्रति मिनट 50 छवियों की पहचान करता था। पूर्ण ImageNet के लिए मूल योजना में लगभग 50,000 सिनसेट्स में लगभग 50 मिलियन स्वच्छ, विविध और पूर्ण-रिज़ॉल्यूशन छवियां होंगी, लेकिन यह हासिल नहीं किया गया था। 30 अप्रैल, 2010 तक सारांश आँकड़ों में 21,841 गैर-खाली सिनसेट्स, 14,197,122 कुल छवियां, 1,034,908 बाउंडिंग बॉक्स एनोटेशन वाली छवियां, SIFT सुविधाओं के साथ 1,000 सिनसेट्स, और SIFT सुविधाओं के साथ 1.2 मिलियन छवियां शामिल थीं।
श्रेणियाँ
ImageNet की श्रेणियों को WordNet अवधारणाओं से फ़िल्टर किया गया था। प्रत्येक अवधारणा, क्योंकि इसमें कई समानार्थी शब्द हो सकते हैं (उदाहरण के लिए, "बिल्ली का बच्चा" और "युवा बिल्ली"), को "पर्यायवाची सेट" या "सिनसेट" कहा जाता है। WordNet 3.0 में 100,000 से अधिक सिनसेट हैं, जिनमें से अधिकांश संज्ञाएं हैं (80,000 से अधिक)। ImageNet ने इन्हें 21,841 सिनसेट्स में फ़िल्टर किया जो गणनीय संज्ञाएं हैं जिन्हें दृश्य रूप से चित्रित किया जा सकता है। WordNet 3.0 में प्रत्येक सिनसेट में एक "WordNet ID" (wnid) होता है, जो भाषण के भाग और एक ऑफसेट का संयोजन होता है। प्रत्येक wnid "n" से शुरू होता है क्योंकि ImageNet में केवल संज्ञाएं शामिल हैं; उदाहरण के लिए, "कुत्ता, घरेलू कुत्ता, कैनिस फेमिलेरिस" के लिए wnid "n02084071" है। श्रेणियां 9 स्तरों में आती हैं, स्तर 1 (जैसे "स्तनपायी") से स्तर 9 (जैसे "जर्मन शेफर्ड") तक।
छवि प्रारूप
छवियों को ऑनलाइन छवि खोज इंजन (Google, Picsearch, MSN, Yahoo, Flickr, आदि) से कई भाषाओं में समानार्थी शब्दों का उपयोग करके स्क्रैप किया गया था, जैसे "जर्मन शेफर्ड," "जर्मन पुलिस कुत्ता," "अल्साटियन," "ओवेजेरो एलेमन," और "पास्टोर टेडेस्को।" ImageNet में विभिन्न रिज़ॉल्यूशन वाली RGB प्रारूप में छवियां शामिल हैं; उदाहरण के लिए, ImageNet 2012 "मछली" श्रेणी में, रिज़ॉल्यूशन 4288 x 2848 से 75 x 56 तक हैं। मशीन लर्निंग में, इन्हें आमतौर पर एक मानक स्थिर रिज़ॉल्यूशन में पूर्व-संसाधित किया जाता है और तंत्रिका नेटवर्क द्वारा आगे की प्रक्रिया से पहले सफेद किया जाता है। उदाहरण के लिए, PyTorch में, ImageNet छवियों को पिक्सेल मानों को 0 और 1 के बीच विभाजित करके, फिर [0.485, 0.456, 0.406] घटाकर, और [0.229, 0.224, 0.225] से विभाजित करके सामान्यीकृत किया जाता है, जो ImageNet के लिए माध्य और मानक विचलन हैं।
लेबल और एनोटेशन
प्रत्येक छवि को ठीक एक wnid के साथ लेबल किया जाता है। ImageNet-1K के लिए घने SIFT सुविधाएं (कच्चे SIFT वर्णनकर्ता, मात्राबद्ध कोडवर्ड, और निर्देशांक) डाउनलोड के लिए उपलब्ध थीं, जो बैग-ऑफ़-विज़ुअल-वर्ड्स मॉडल के लिए डिज़ाइन की गई थीं। लगभग 3,000 लोकप्रिय सिनसेट्स के लिए बाउंडिंग बॉक्स उपलब्ध थे, जिनमें प्रति सिनसेट औसतन 150 छवियां थीं। इसके अतिरिक्त, कुछ छवियों में विशेषता एनोटेशन हैं, और डेटासेट का व्यापक रूप से मशीन लर्निंग अनुसंधान में उपयोग किया गया है, विशेष रूप से कृत्रिम बुद्धिमत्ता मॉडल को प्रशिक्षित करने और मूल्यांकन करने के लिए।
विरासत और प्रभाव
ImageNet का कंप्यूटर विज़न और कृत्रिम बुद्धिमत्ता के क्षेत्र पर गहरा प्रभाव पड़ा है। इसने एक मानकीकृत बेंचमार्क प्रदान किया जिसने वस्तु पहचान और वर्गीकरण में प्रगति को तेज किया। 2012 में एलेक्सनेट की सफलता ने डीप लर्निंग क्रांति को जन्म दिया, जिससे विभिन्न डोमेन में डीप लर्निंग तकनीकों को व्यापक रूप से अपनाया गया। ImageNet की पदानुक्रमित संरचना और बड़े पैमाने ने अन्य डेटासेट के विकास और ट्रांसफॉर्मर-आधारित मॉडल के डिजाइन को भी प्रभावित किया है, जो बाद में जनरेटिव एआई और बड़े भाषा मॉडल में मौलिक बन गए। डेटासेट दृश्य पहचान प्रणालियों को प्रशिक्षित करने और मूल्यांकन करने के लिए एक महत्वपूर्ण संसाधन बना हुआ है, और इसकी विरासत एआई अनुसंधान और अनुप्रयोगों को आकार देती रहती है।