ImageNet Large Scale Visual Recognition Challenge (ILSVRC) 2012, एक वार्षिक सॉफ्टवेयर प्रतियोगिता का तीसरा संस्करण था, जिसमें कार्यक्रम ImageNet डेटाबेस से वस्तुओं और दृश्यों को सही ढंग से वर्गीकृत और पहचानने के लिए प्रतिस्पर्धा करते हैं। 2012 की चुनौती को व्यापक रूप से कृत्रिम बुद्धिमत्ता के इतिहास में एक महत्वपूर्ण मोड़ माना जाता है, क्योंकि विजेता प्रविष्टि, एक तंत्रिका नेटवर्क जिसे AlexNet कहा जाता है, ने परीक्षण सेट पर 15.3% की शीर्ष-5 त्रुटि हासिल की, जो उपविजेता से 10.8 प्रतिशत अंक से अधिक कम थी। इस नाटकीय सुधार ने गहन शिक्षण और मशीन लर्निंग तकनीकों की शक्ति का प्रदर्शन किया, जिससे अनुसंधान और निवेश की एक लहर शुरू हुई जो आज भी इस क्षेत्र को आकार दे रही है।
ImageNet परियोजना की शुरुआत AI शोधकर्ता फेई-फेई ली ने 2006 में की थी, जिसका लक्ष्य AI एल्गोरिदम के प्रशिक्षण के लिए उपलब्ध डेटा का विस्तार करना था। ली ने 2007 में प्रिंसटन के प्रोफेसर क्रिस्टियाने फेलबाम से मुलाकात की, जो WordNet के रचनाकारों में से एक हैं, और बाद में WordNet के लगभग 22,000 संज्ञाओं को शुरुआती बिंदु के रूप में उपयोग करके ImageNet का निर्माण किया। डेटाबेस का निर्माण Amazon Mechanical Turk के माध्यम से क्राउडसोर्स्ड एनोटेशन की मदद से किया गया था, जिसमें लेबलिंग जुलाई 2008 में शुरू हुई और अप्रैल 2010 में समाप्त हुई। इस प्रयास में 167 देशों के 49,000 कर्मचारियों ने 160 मिलियन से अधिक उम्मीदवार छवियों को फ़िल्टर और लेबल किया, जिसके परिणामस्वरूप 20,000 से अधिक श्रेणियों में 14 मिलियन से अधिक हाथ से एनोटेट की गई छवियां बनीं।
इतिहास और विकास
ImageNet का विचार ली की इस टिप्पणी से उभरा कि उस समय अधिकांश AI अनुसंधान मॉडल और एल्गोरिदम पर केंद्रित था, डेटा पर नहीं। वह 1987 के एक अनुमान से प्रेरित थीं कि औसत व्यक्ति लगभग 30,000 विभिन्न प्रकार की वस्तुओं को पहचानता है। 2007 में, ली ने परियोजना पर चर्चा करने के लिए क्रिस्टियाने फेलबाम से मुलाकात की, और बैठक के कारण WordNet के संज्ञा synsets से शुरू करके ImageNet बनाने का निर्णय लिया गया। ली ने प्रिंसटन में शोधकर्ताओं की एक टीम इकट्ठी की, जहां वह सहायक प्रोफेसर थीं, और उन्होंने छवियों को वर्गीकृत करने के लिए Amazon Mechanical Turk का उपयोग किया।
मूल योजना में 40,000 श्रेणियों के लिए 400 मिलियन छवियों में प्रति श्रेणी 10,000 छवियों की आवश्यकता थी, प्रत्येक को तीन बार सत्यापित किया गया था। हालांकि, मनुष्य अधिकतम 2 छवियों प्रति सेकंड वर्गीकृत कर सकते हैं, और उस दर पर बिना आराम के 19 मानव-वर्ष श्रम लगने का अनुमान लगाया गया था। टीम ने पहली बार 2009 में फ्लोरिडा में कंप्यूटर विज़न और पैटर्न पहचान सम्मेलन (CVPR) में "ImageNet: A Preview of a Large-scale Hierarchical Dataset" शीर्षक से एक पोस्टर के रूप में डेटाबेस प्रस्तुत किया।
2009 में, एलेक्स बर्ग ने ऑब्जेक्ट लोकलाइजेशन को एक कार्य के रूप में जोड़ने का सुझाव दिया। ली ने सहयोग के लिए PASCAL Visual Object Classes प्रतियोगिता से संपर्क किया, जिसके परिणामस्वरूप 2010 में ImageNet Large Scale Visual Recognition Challenge शुरू हुआ। चुनौती में 1,000 गैर-अतिव्यापी वर्गों की एक छंटनी सूची का उपयोग किया जाता है, जबकि PASCAL VOC के 20 वर्गों और 2010 में 19,737 छवियों की तुलना में।
गहन शिक्षण के लिए महत्व
30 सितंबर 2012 को, AlexNet, एक convolutional तंत्रिका नेटवर्क (CNN), ने ImageNet 2012 चुनौती में 15.3% की शीर्ष-5 त्रुटि हासिल की। यह उपविजेता से 10.8 प्रतिशत अंक से अधिक कम थी। convolutional तंत्रिका नेटवर्क का उपयोग प्रशिक्षण के दौरान ग्राफिक्स प्रोसेसिंग यूनिट (GPU) के उपयोग से संभव हुआ, जो गहन शिक्षण क्रांति का एक आवश्यक घटक था। द इकोनॉमिस्ट के अनुसार, "अचानक लोगों ने ध्यान देना शुरू कर दिया, न केवल AI समुदाय के भीतर बल्कि पूरे प्रौद्योगिकी उद्योग में।"
AlexNet की जीत को अक्सर गहन शिक्षण उछाल के ट्रिगर के रूप में उद्धृत किया जाता है। इसने प्रदर्शित किया कि तंत्रिका नेटवर्क जटिल दृश्य कार्यों पर अत्याधुनिक परिणाम प्राप्त कर सकते हैं, जिससे विभिन्न डोमेन में गहन शिक्षण तकनीकों को तेजी से अपनाया गया, जिसमें जनरेटिव AI और बड़े भाषा मॉडल शामिल हैं। 2015 में, AlexNet को माइक्रोसॉफ्ट के 100 से अधिक परतों वाले बहुत गहरे CNN ने पीछे छोड़ दिया, जिसने परीक्षण सेट पर 3.57% त्रुटि दर के साथ ImageNet 2015 प्रतियोगिता जीती।
आंद्रेज कार्पथी ने 2014 में अनुमान लगाया कि केंद्रित प्रयास से, वह 5.1% त्रुटि दर तक पहुंच सकते हैं, और उनकी प्रयोगशाला के लगभग 10 लोग कम प्रयास के साथ लगभग 12-13% तक पहुंच गए। यह अनुमान लगाया गया था कि अधिकतम प्रयास के साथ, एक मानव 2.4% त्रुटि तक पहुंच सकता है।
डेटासेट संरचना
ImageNet अपनी एनोटेशन प्रक्रिया को क्राउडसोर्स करता है। छवि-स्तरीय एनोटेशन एक छवि में किसी ऑब्जेक्ट वर्ग की उपस्थिति या अनुपस्थिति को इंगित करते हैं, जैसे "इस छवि में बाघ हैं" या "इस छवि में बाघ नहीं हैं।" ऑब्जेक्ट-स्तरीय एनोटेशन संकेतित ऑब्जेक्ट के दृश्य भाग के चारों ओर एक बाउंडिंग बॉक्स प्रदान करते हैं। ImageNet वस्तुओं को वर्गीकृत करने के लिए व्यापक WordNet स्कीमा का एक प्रकार उपयोग करता है, जिसमें बारीक वर्गीकरण प्रदर्शित करने के लिए कुत्तों की नस्लों की 120 श्रेणियां जोड़ी गई हैं।
2012 में, ImageNet Mechanical Turk का दुनिया का सबसे बड़ा शैक्षणिक उपयोगकर्ता था, जिसमें औसत कार्यकर्ता प्रति मिनट 50 छवियों की पहचान करता था। 30 अप्रैल, 2010 को दिए गए सारांश आंकड़ों में कुल 21,841 गैर-खाली synsets, 14,197,122 छवियां, 1,034,908 बाउंडिंग बॉक्स एनोटेशन वाली छवियां, और SIFT विशेषताओं वाली 1.2 मिलियन छवियां दिखाई गईं।
ImageNet की श्रेणियों को WordNet अवधारणाओं से फ़िल्टर किया गया था। प्रत्येक अवधारणा को "synset" (पर्यायवाची सेट) कहा जाता है, और WordNet 3.0 में 100,000 से अधिक synsets थे, जिनमें से अधिकांश संज्ञाएं थीं (80,000+)। ImageNet ने इन्हें 21,841 synsets तक फ़िल्टर किया जो गणनीय संज्ञाएं हैं जिन्हें दृश्य रूप से चित्रित किया जा सकता है। प्रत्येक synset में एक WordNet ID (wnid) होता है, जो "n" से शुरू होता है क्योंकि ImageNet में केवल संज्ञाएं शामिल हैं। श्रेणियां 9 स्तरों में आती हैं, स्तर 1 (जैसे "स्तनपायी") से स्तर 9 (जैसे "जर्मन शेफर्ड") तक।
छवि प्रारूप और पूर्व-प्रसंस्करण
छवियों को कई भाषाओं में पर्यायवाची शब्दों का उपयोग करके ऑनलाइन छवि खोज इंजन (Google, Picsearch, MSN, Yahoo, Flickr) से स्क्रैप किया गया था। ImageNet में अलग-अलग रिज़ॉल्यूशन के साथ RGB प्रारूप में छवियां शामिल हैं। उदाहरण के लिए, ImageNet 2012 में, "मछली" श्रेणी में रिज़ॉल्यूशन 4288 x 2848 से 75 x 56 तक हैं। मशीन लर्निंग में, इन्हें आमतौर पर एक मानक स्थिर रिज़ॉल्यूशन में पूर्व-संसाधित किया जाता है और तंत्रिका नेटवर्क द्वारा आगे की प्रक्रिया से पहले सफेद किया जाता है।
उदाहरण के लिए, PyTorch में, ImageNet छवियों को डिफ़ॉल्ट रूप से पिक्सेल मानों को विभाजित करके सामान्यीकृत किया जाता है ताकि वे 0 और 1 के बीच आएं, फिर [0.485, 0.456, 0.406] घटाकर, फिर [0.229, 0.224, 0.225] से विभाजित किया जाता है। ये ImageNet के लिए माध्य और मानक विचलन हैं, इसलिए यह इनपुट डेटा को सफेद करता है।
लेबल और एनोटेशन
प्रत्येक छवि को ठीक एक wnid के साथ लेबल किया जाता है। ImageNet-1K के लिए घने SIFT विशेषताएं (कच्चे SIFT वर्णनकर्ता, परिमाणित कोडवर्ड, और प्रत्येक वर्णनकर्ता/कोडवर्ड के निर्देशांक) डाउनलोड के लिए उपलब्ध थीं, जो दृश्य शब्दों के बैग के लिए डिज़ाइन की गई थीं। वस्तुओं के बाउंडिंग बॉक्स लगभग 3,000 लोकप्रिय synsets के लिए उपलब्ध थे, जिनमें प्रत्येक synset में औसतन 150 छवियां थीं। कुछ छवियों में विशेषता एनोटेशन भी हैं, हालांकि उपलब्ध स्रोतों में इनका पूरा विवरण निर्दिष्ट नहीं है।