ImageNet Large Scale Visual Recognition Challenge (ILSVRC) 2010, ImageNet परियोजना द्वारा आयोजित एक वार्षिक सॉफ्टवेयर प्रतियोगिता का पहला संस्करण था, जो दृश्य वस्तु पहचान अनुसंसाधन के लिए डिज़ाइन किया गया एक बड़ा दृश्य डेटाबेस है। इस चुनौती के लिए भाग लेने वाले कार्यक्रमों को एक हजार गैर-अतिव्यापी वर्गों की एक छंटनी सूची के भीतर वस्तुओं और दृश्यों को सही ढंग से वर्गीकृत और पहचानना आवश्यक था, जो पिछले बेंचमार्क जैसे कि PASCAL Visual Object Classes (VOC) प्रतियोगिता से एक महत्वपूर्ण पैमाने-अप था, जिसमें 2010 में केवल 20 वर्ग और 19,737 चित्र थे। 2010 की चुनौती ने एक मानकीकृत, बड़े पैमाने पर मूल्यांकन मंच प्रदान करके कंप्यूटर दृष्टि में एक महत्वपूर्ण मोड़ चिह्नित किया, जो बाद में गहन शिक्षण क्रांति को उत्प्रेरित करेगा।
उत्पत्ति और विकास
ImageNet परियोजना की कल्पना AI शोधकर्ता फेई-फेई ली ने 2006 में की थी, ऐसे समय में जब अधिकांश AI अनुसंधान डेटा के बजाय मॉडल और एल्गोरिदम पर केंद्रित था। ली का लक्ष्य AI एल्गोरिदम को प्रशिक्षित करने के लिए उपलब्ध डेटा का विस्तार और सुधार करना था। 2007 में, उन्होंने प्रिंसटन की प्रोफेसर क्रिस्टियाने फेलबाम से मुलाकात की, जो WordNet की निर्माता हैं, जिसके कारण WordNet के लगभग 22,000 संज्ञाओं से शुरू करके ImageNet का निर्माण हुआ। ली 1987 के एक अनुमान से भी प्रेरित थीं कि औसत व्यक्ति लगभग 30,000 विभिन्न प्रकार की वस्तुओं को पहचानता है।
प्रिंसटन में सहायक प्रोफेसर के रूप में, ली ने शोधकर्ताओं की एक टीम इकट्ठी की और छवि वर्गीकरण के लिए Amazon Mechanical Turk का उपयोग किया। लेबलिंग जुलाई 2008 में शुरू हुई और अप्रैल 2010 में समाप्त हुई, जिसमें 167 देशों के 49,000 श्रमिकों ने 160 मिलियन से अधिक उम्मीदवार छवियों को फ़िल्टर और लेबल किया। मूल योजना में 40,000 श्रेणियों में प्रति श्रेणी 10,000 छवियों का आह्वान किया गया था, जो कुल 400 मिलियन छवियां थीं, लेकिन व्यावहारिक बाधाओं के कारण इसे कम कर दिया गया था। डेटाबेस को पहली बार 2009 में फ्लोरिडा में कंप्यूटर विज़न और पैटर्न पहचान सम्मेलन (CVPR) में एक पोस्टर के रूप में प्रस्तुत किया गया था, जिसका शीर्षक था "ImageNet: A Preview of a Large-scale Hierarchical Dataset"।
2009 में, एलेक्स बर्ग ने एक कार्य के रूप में वस्तु स्थानीयकरण जोड़ने का सुझाव दिया, और ली ने सहयोग के लिए PASCAL VOC प्रतियोगिता से संपर्क किया। इसके परिणामस्वरूप ILSVRC 2010 में शुरू हुआ, जिसमें 1,000 वर्ग और वस्तु स्थानीयकरण शामिल था, जो PASCAL VOC के 20 वर्गों से काफी विस्तार था।
डेटासेट संरचना
ImageNet अपनी एनोटेशन प्रक्रिया को क्राउडसोर्स करता है। छवि-स्तरीय एनोटेशन किसी वस्तु वर्ग की उपस्थिति या अनुपस्थिति को दर्शाते हैं, जबकि वस्तु-स्तरीय एनोटेशन वस्तुओं के दृश्य भागों के चारों ओर बाउंडिंग बॉक्स प्रदान करते हैं। डेटासेट WordNet स्कीमा का एक प्रकार उपयोग करता है, जिसमें बारीक-वर्गीकरण के लिए कुत्तों की नस्लों की 120 श्रेणियां जोड़ी गई हैं। 30 अप्रैल, 2010 तक, डेटासेट में 21,841 गैर-रिक्त सिनसेट (पर्यायवाची सेट), 14,197,122 छवियां, 1,034,908 छवियां बाउंडिंग बॉक्स एनोटेशन के साथ, और 1.2 मिलियन छवियां SIFT विशेषताओं के साथ शामिल थीं।
श्रेणियों को WordNet अवधारणाओं से फ़िल्टर किया गया था, जिन्हें सिनसेट कहा जाता है। प्रत्येक सिनसेट में एक WordNet ID (wnid) होता है जो "n" से शुरू होता है क्योंकि ImageNet में केवल संज्ञाएं शामिल हैं। श्रेणियां 9 स्तरों में आती हैं, स्तर 1 (जैसे, "स्तनपायी") से स्तर 9 (जैसे, "जर्मन शेफर्ड") तक। छवियों को Google, Picsearch, MSN, Yahoo, और Flickr जैसे ऑनलाइन खोज इंजनों से कई भाषाओं में पर्यायवाची शब्दों का उपयोग करके स्क्रैप किया गया था। छवियां RGB प्रारूप में हैं जिनमें अलग-अलग रिज़ॉल्यूशन हैं; उदाहरण के लिए, 2012 की "मछली" श्रेणी में, रिज़ॉल्यूशन 4288 x 2848 से 75 x 56 तक हैं। मशीन लर्निंग में, इन्हें आमतौर पर एक मानक रिज़ॉल्यूशन में पूर्व-संसाधित किया जाता है और तंत्रिका नेटवर्क द्वारा प्रसंस्करण से पहले सफेद किया जाता है।
गहन शिक्षण के लिए महत्व
ILSVRC 2010 ने 2012 में एक बड़ी सफलता के लिए मंच तैयार किया। 30 सितंबर, 2012 को, AlexNet नामक एक कन्वोल्यूशनल न्यूरल नेटवर्क (CNN) ने ImageNet 2012 चैलेंज में 15.3% की शीर्ष-5 त्रुटि हासिल की, जो उपविजेता से 10.8 प्रतिशत अंक से अधिक कम थी। यह सफलता प्रशिक्षण के दौरान ग्राफिक्स प्रोसेसिंग यूनिट (GPU) के उपयोग से संभव हुई, जो गहन शिक्षण क्रांति का एक आवश्यक घटक है। द इकोनॉमिस्ट के अनुसार, "अचानक लोगों ने ध्यान देना शुरू कर दिया, न केवल AI समुदाय के भीतर बल्कि पूरे प्रौद्योगिकी उद्योग में।"
2015 में, AlexNet को माइक्रोसॉफ्ट के 100 से अधिक परतों वाले बहुत गहरे CNN ने पीछे छोड़ दिया, जिसने 3.57% त्रुटि दर के साथ ImageNet 2015 प्रतियोगिता जीती। आंद्रेई कारपाथी ने 2014 में अनुमान लगाया था कि केंद्रित प्रयास से, वह 5.1% त्रुटि दर तक पहुंच सकते हैं, और उनकी प्रयोगशाला के लगभग 10 लोग कम प्रयास के साथ लगभग 12-13% तक पहुंच गए। यह अनुमान लगाया गया था कि अधिकतम प्रयास के साथ, एक मानव 2.4% त्रुटि दर प्राप्त कर सकता है।
विरासत
हालांकि ILSVRC 2010 में स्वयं गहन शिक्षण विजेताओं को शामिल नहीं किया गया था, इसने वह बेंचमार्क स्थापित किया जो कंप्यूटर दृष्टि में तेजी से प्रगति को बढ़ावा देगा। चुनौती का बड़े पैमाने पर, मानकीकृत मूल्यांकन तंत्रिका नेटवर्क और गहन शिक्षण तकनीकों के विकास के लिए उत्प्रेरक बन गया, जिसने कृत्रिम बुद्धिमत्ता और संबंधित क्षेत्रों में बाद के अनुसंधान को प्रभावित किया। डेटासेट और चुनौती प्रभावशाली बनी हुई है, 2010 का संस्करण बाद की प्रतियोगिताओं के लिए आधार के रूप में कार्य करता है जिसने मशीन लर्निंग दृष्टिकोणों की शक्ति का प्रदर्शन किया।