इमेजनेट चैलेंज, जिसे आधिकारिक तौर पर इमेजनेट लार्ज स्केल विज़ुअल रिकग्निशन चैलेंज (ILSVRC) के रूप में जाना जाता है, एक वार्षिक सॉफ्टवेयर प्रतियोगिता है जिसमें प्रोग्राम छवियों में वस्तुओं और दृश्यों को सही ढंग से वर्गीकृत और पहचानने के लिए प्रतिस्पर्धा करते हैं। 2010 में शुरू किया गया, यह बड़े इमेजनेट डेटाबेस से एक हजार गैर-अतिव्यापी वर्गों की एक छंटनी सूची का उपयोग करता है, जिसमें 20,000 से अधिक श्रेणियों में 14 मिलियन से अधिक हाथ से एनोटेट की गई छवियां शामिल हैं। यह चैलेंज कंप्यूटर विज़न में एक महत्वपूर्ण बेंचमार्क बन गया, जिसने 2012 के बाद डीप लर्निंग क्रांति को उत्प्रेरित किया।
इतिहास
AI शोधकर्ता फेई-फेई ली ने 2006 में इमेजनेट अवधारणा विकसित करना शुरू किया, जिसका उद्देश्य AI एल्गोरिदम को प्रशिक्षित करने के लिए उपलब्ध डेटा का विस्तार करना था, ऐसे समय में जब अधिकांश शोध मॉडल पर केंद्रित थे। 2007 में, ली ने प्रिंसटन की प्रोफेसर क्रिस्टियाने फेलबाम से मुलाकात की, जो वर्डनेट की निर्माता थीं, और वर्डनेट में लगभग 22,000 संज्ञाओं से शुरू करके इमेजनेट का निर्माण किया। वह 1987 के एक अनुमान से प्रेरित थीं कि औसत व्यक्ति लगभग 30,000 प्रकार की वस्तुओं को पहचानता है।
प्रिंसटन में सहायक प्रोफेसर के रूप में, ली ने एक टीम इकट्ठी की जिसने छवि वर्गीकरण के लिए अमेज़न मैकेनिकल तुर्क का उपयोग किया। लेबलिंग जुलाई 2008 से अप्रैल 2010 तक चली, जिसमें 167 देशों के 49,000 श्रमिकों ने 160 मिलियन से अधिक उम्मीदवार छवियों को फ़िल्टर और लेबल किया। प्रत्येक 14 मिलियन छवियों को तीन बार लेबल किया गया था। मूल योजना में 40,000 श्रेणियों में प्रति श्रेणी 10,000 छवियों की आवश्यकता थी, लेकिन यह हासिल नहीं हुआ।
डेटाबेस को पहली बार 2009 में फ्लोरिडा में कंप्यूटर विज़न और पैटर्न रिकग्निशन सम्मेलन (CVPR) में एक पोस्टर के रूप में प्रस्तुत किया गया था, जिसका शीर्षक था "इमेजनेट: ए प्रीव्यू ऑफ़ ए लार्ज-स्केल हायरार्किकल डेटासेट।" 2009 में, एलेक्स बर्ग ने ऑब्जेक्ट लोकलाइज़ेशन को एक कार्य के रूप में जोड़ने का सुझाव दिया, जिससे PASCAL विज़ुअल ऑब्जेक्ट क्लासेस प्रतियोगिता के साथ सहयोग हुआ। पहला इमेजनेट चैलेंज 2010 में 1,000 वर्गों और ऑब्जेक्ट लोकलाइज़ेशन के साथ था, जबकि PASCAL VOC में 20 वर्ग और 19,737 छवियां थीं।
डीप लर्निंग के लिए महत्व
30 सितंबर 2012 को, एलेक्सनेट नामक एक कन्वोल्यूशनल न्यूरल नेटवर्क (CNN) ने इमेजनेट 2012 चैलेंज में 15.3% की टॉप-5 त्रुटि हासिल की, जो उपविजेता से 10.8 प्रतिशत अंक से अधिक कम थी। यह सफलता ग्राफिक्स प्रोसेसिंग यूनिट्स (GPUs) पर प्रशिक्षण द्वारा संभव हुई, जो डीप लर्निंग क्रांति का एक आवश्यक घटक था। द इकोनॉमिस्ट के अनुसार, "अचानक लोगों ने ध्यान देना शुरू कर दिया, न केवल AI समुदाय के भीतर बल्कि पूरे प्रौद्योगिकी उद्योग में।"
2015 में, एलेक्सनेट को माइक्रोसॉफ्ट के 100 से अधिक परतों वाले बहुत गहरे CNN ने पीछे छोड़ दिया, जिसने इमेजनेट 2015 प्रतियोगिता में परीक्षण सेट पर 3.57% त्रुटि दर के साथ जीत हासिल की। आंद्रेज कारपाथी ने 2014 में अनुमान लगाया कि केंद्रित प्रयास से वह 5.1% त्रुटि दर तक पहुंच सकते हैं, और अधिकतम प्रयास से एक मानव 2.4% तक पहुंच सकता है।
डेटासेट
इमेजनेट अपनी एनोटेशन प्रक्रिया को क्राउडसोर्स करता है। छवि-स्तरीय एनोटेशन किसी ऑब्जेक्ट वर्ग की उपस्थिति या अनुपस्थिति को इंगित करते हैं, जबकि ऑब्जेक्ट-स्तरीय एनोटेशन बाउंडिंग बॉक्स प्रदान करते हैं। डेटासेट वर्डनेट स्कीमा का एक प्रकार उपयोग करता है, जिसमें बारीक वर्गीकरण के लिए कुत्तों की नस्लों की 120 श्रेणियां जोड़ी गई हैं।
30 अप्रैल 2010 तक, इमेजनेट में 21,841 गैर-खाली सिनसेट, 14,197,122 छवियां, 1,034,908 बाउंडिंग बॉक्स एनोटेशन वाली छवियां, और 1.2 मिलियन SIFT विशेषताओं वाली छवियां थीं। 2012 में, इमेजनेट मैकेनिकल तुर्क का दुनिया का सबसे बड़ा शैक्षणिक उपयोगकर्ता था, जिसमें श्रमिक प्रति मिनट औसतन 50 छवियों की पहचान करते थे।
श्रेणियाँ
श्रेणियाँ वर्डनेट अवधारणाओं से फ़िल्टर की जाती हैं, जिनमें से प्रत्येक को "सिनसेट" (समानार्थी सेट) कहा जाता है। इमेजनेट में 21,841 सिनसेट शामिल हैं जो गणनीय संज्ञाएं हैं जिन्हें दृश्य रूप से चित्रित किया जा सकता है। प्रत्येक सिनसेट में "n" से शुरू होने वाला एक वर्डनेट आईडी (wnid) होता है (जैसे, "कुत्ते" के लिए "n02084071")। श्रेणियाँ 9 स्तरों में आती हैं, स्तर 1 (जैसे, "स्तनपायी") से स्तर 9 (जैसे, "जर्मन शेफर्ड") तक।
छवि प्रारूप
छवियों को कई भाषाओं में समानार्थी शब्दों का उपयोग करके ऑनलाइन खोज इंजनों (गूगल, पिकसर्च, MSN, याहू, फ़्लिकर) से स्क्रैप किया गया था। वे अलग-अलग रिज़ॉल्यूशन के साथ RGB प्रारूप में हैं; उदाहरण के लिए, इमेजनेट 2012 में, "मछली" श्रेणी 4288 x 2848 से 75 x 56 पिक्सेल तक होती है। मशीन लर्निंग में, छवियों को आमतौर पर एक मानक रिज़ॉल्यूशन में पूर्व-संसाधित और सफ़ेद किया जाता है। उदाहरण के लिए, PyTorch में, छवियों को पिक्सेल मानों को [0,1] में विभाजित करके, [0.485, 0.456, 0.406] घटाकर, और [0.229, 0.224, 0.225] से विभाजित करके सामान्यीकृत किया जाता है।
लेबल और एनोटेशन
प्रत्येक छवि को ठीक एक wnid के साथ लेबल किया जाता है। डेंस SIFT विशेषताएं (कच्चे डिस्क्रिप्टर, क्वांटाइज़्ड कोडवर्ड, और निर्देशांक) इमेजनेट-1K के लिए उपलब्ध थीं, जो दृश्य शब्दों के बैग के लिए डिज़ाइन की गई थीं। बाउंडिंग बॉक्स लगभग 3,000 लोकप्रिय सिनसेट के लिए उपलब्ध थे, जिनमें प्रत्येक में औसतन 150 छवियां थीं। कुछ छवियों में विशेषता एनोटेशन भी हैं, हालांकि विवरण सीमित हैं।
विरासत
इमेजनेट चैलेंज Machine learning और Deep learning तकनीकों को आगे बढ़ाने में सहायक रहा है। इसने Neural network आर्किटेक्चर जैसे Residual Network (ResNet) और Batch Normalization और Data Augmentation जैसे प्रशिक्षण विधियों के उपयोग को लोकप्रिय बनाया। प्रतियोगिता की सफलता ने Artificial intelligence में रुचि बढ़ाई और Generative AI और Large language model अनुसंधान में बाद के विकास को प्रभावित किया, हालांकि चैलेंज स्वयं दृश्य कार्यों पर केंद्रित था।