ImageNet एक बड़े पैमाने पर लेबल किए गए चित्रों का डेटासेट है, जो WordNet संज्ञा पदानुक्रम के अनुसार व्यवस्थित है, और विस्तार से, यह नाम आमतौर पर उस वार्षिक ImageNet Large Scale Visual Recognition Challenge (ILSVRC) को दिया जाता है जो इसी पर आधारित है। इसे Fei-Fei Li और सहकर्मियों द्वारा 2006 से प्रिंसटन और स्टैनफोर्ड में बनाया गया और पहली बार 2009 में प्रस्तुत किया गया; यह डेटासेट अंततः लगभग 14 मिलियन चित्रों तक बढ़ गया, जिसमें 20,000 से अधिक श्रेणियाँ शामिल हैं, और प्रतियोगिताओं में उपयोग किया जाने वाला ILSVRC उपसमुच्चय 1,000 वस्तु वर्गों को कवर करता है। ImageNet को व्यापक रूप से उस डेटा पैमाने की आपूर्ति करने का श्रेय दिया जाता है जो Deep learning विधियों को Computer vision के लिए व्यावहारिक बनाने के लिए आवश्यक था, और इसकी 2012 की प्रतियोगिता को अक्सर उस क्षण के रूप में उद्धृत किया जाता है जिसने इस क्षेत्र के आधुनिक पुनरुत्थान को प्रेरित किया।
इतिहास
Fei-Fei Li ने ImageNet परियोजना इस विश्वास के साथ शुरू की कि दृश्य पहचान में प्रगति एल्गोरिदम की तुलना में पर्याप्त बड़े, विविध और अच्छी तरह से लेबल किए गए डेटासेट की अनुपस्थिति से अधिक सीमित थी। WordNet शाब्दिक डेटाबेस से काम करते हुए, टीम ने हर संज्ञा सिनसेट के लिए चित्र एकत्र करने का लक्ष्य रखा, वेब चित्र खोज का उपयोग करके उम्मीदवारों को इकट्ठा किया और लेबल सत्यापित करने के लिए Amazon Mechanical Turk के माध्यम से क्राउडसोर्सिंग की। पूरा डेटासेट 2009 के IEEE Conference on Computer Vision and Pattern Recognition में प्रस्तुत किया गया, और ILSVRC प्रतियोगिता अगले वर्ष शुरू हुई, जिसमें शोध टीमों को लगभग 1.2 मिलियन प्रशिक्षण चित्रों के एक आरक्षित उपसमुच्चय पर वर्गीकरण और पहचान कार्यों में आमने-सामने रखा गया।
2012 की सफलता
2012 का ILSVRC इस डेटासेट का सबसे प्रसिद्ध क्षण है। Alex Krizhevsky, Ilya Sutskever, और Geoffrey Hinton द्वारा प्रस्तुत एक Convolutional neural network, जिसे बाद में AlexNet नाम दिया गया, ने प्रतियोगिता की शीर्ष-5 त्रुटि दर को लगभग 26 प्रतिशत से घटाकर लगभग 15 प्रतिशत कर दिया, जो किसी भी पिछले वर्ष-दर-वर्ष सुधार से कहीं बड़ा अंतर था। यह परिणाम GPU (in AI) हार्डवेयर का उपयोग करके ImageNet के लेबल किए गए डेटा के पैमाने पर एक गहरे नेटवर्क को प्रशिक्षित करने पर निर्भर था, और इसका विस्तृत विवरण ImageNet 2012 (AlexNet moment) घटना पर लेख में दिया गया है। इस जीत ने कंप्यूटर विज़न समुदाय के अधिकांश हिस्से को, जो हाथ से डिज़ाइन की गई विशेषताओं और अन्य Machine learning विधियों का पक्ष लेता था, आश्वस्त किया कि बड़े लेबल किए गए डेटासेट पर प्रशिक्षित गहरे तंत्रिका नेटवर्क पिछले दृष्टिकोणों से व्यापक अंतर से बेहतर प्रदर्शन कर सकते हैं।
विरासत और प्रभाव
2012 के बाद, ILSVRC के विजेता लगभग हर वर्ष गहरे नेटवर्क थे, जिनमें VGG, GoogLeNet, और ResNet जैसी वास्तुकलाओं ने 2015 तक शीर्ष-5 त्रुटि दर को धीरे-धीरे 5 प्रतिशत से नीचे ला दिया, जो उसी कार्य पर मानव एनोटेटरों को आमतौर पर जिम्मेदार ठहराई जाने वाली त्रुटि दर से कम था। ImageNet प्रीट्रेनिंग भी एक मानक तकनीक बन गई: ImageNet पर वर्गीकरण के लिए प्रशिक्षित मॉडलों को अन्य दृष्टि कार्यों के लिए फीचर एक्सट्रैक्टर या फाइन-ट्यूनिंग शुरुआती बिंदु के रूप में पुनः उपयोग किया गया, जो Transfer learning का एक प्रारंभिक बड़े पैमाने का उदाहरण था। एक सामान्य AI benchmark के रूप में डेटासेट की भूमिका ने सुसंगत परिस्थितियों में वास्तुकलाओं की तुलना करना संभव बनाया, एक प्रथा जिसे बाद में भाषा और तर्क मॉडल के लिए बेंचमार्क विरासत में मिले। प्रतियोगिता स्वयं 2017 तक चली, जिसके बाद आयोजकों ने निर्णय लिया कि त्रुटि दरें एनोटेशन के अपने शोर की व्यावहारिक सीमा के करीब संतृप्त हो गई थीं।
आलोचना
ImageNet ने बड़े वेब-स्क्रैप किए गए Training data में निहित समस्याओं के उदाहरण के रूप में भी जांच आकर्षित की है। शोधकर्ताओं ने पाया कि पूरे 14-मिलियन-चित्र सेट में कुछ गैर-वस्तु श्रेणियाँ, विशेष रूप से WordNet से विरासत में मिली "व्यक्ति" शाखा में, आपत्तिजनक या अनुचित लेबल शामिल थे, जिससे ImageNet टीम को 2019 में उस शाखा के बड़े हिस्से को हटाने या धुंधला करने के लिए प्रेरित किया गया। यह घटना Algorithmic bias और इंटरनेट-पैमाने के डेटासेट को जिम्मेदारी से क्यूरेट करने की कठिनाई की चर्चाओं में अक्सर उद्धृत केस स्टडी बन गई, जो बाद में जनरेटिव मॉडल को प्रीट्रेन करने के लिए उपयोग किए जाने वाले पाठ और चित्र कॉर्पोरा पर समान बहसों का पूर्वाभास करती है।