ImageNet एक बड़े पैमाने पर दृश्य डेटाबेस है जिसे दृश्य वस्तु पहचान सॉफ्टवेयर अनुसंधान के लिए डिज़ाइन किया गया है। इस परियोजना में 14 मिलियन से अधिक हाथ से एनोटेट की गई छवियां शामिल हैं जो चित्रित वस्तुओं को दर्शाती हैं, जिनमें से कम से कम एक मिलियन छवियां बाउंडिंग बॉक्स भी प्रदान करती हैं। इसमें 20,000 से अधिक श्रेणियां शामिल हैं, जिनमें से प्रत्येक में आमतौर पर कई सौ छवियां होती हैं। तृतीय-पक्ष छवि URL और उनके एनोटेशन का डेटाबेस स्वतंत्र रूप से उपलब्ध है, हालांकि वास्तविक छवियां ImageNet की स्वामित्व वाली नहीं हैं। 2010 से, ImageNet ने एक वार्षिक प्रतियोगिता, ImageNet Large Scale Visual Recognition Challenge (ILSVRC) की मेजबानी की है, जहां सॉफ्टवेयर प्रोग्राम एक हजार गैर-अतिव्यापी वर्गों की छंटनी की गई सूची का उपयोग करके वस्तुओं और दृश्यों को वर्गीकृत और पहचानने के लिए प्रतिस्पर्धा करते हैं।
यह परियोजना एआई शोधकर्ता फेई-फेई ली की दृष्टि से उत्पन्न हुई, जिन्होंने 2006 में इस विचार पर काम करना शुरू किया, जिसका उद्देश्य एआई एल्गोरिदम को प्रशिक्षित करने के लिए उपलब्ध डेटा का विस्तार और सुधार करना था। उस समय, अधिकांश एआई अनुसंधान मॉडल और एल्गोरिदम पर केंद्रित था, लेकिन ली ने डेटा की बाधा को संबोधित करने की मांग की। 2007 में, ली ने प्रिंसटन की प्रोफेसर क्रिस्टियाने फेलबाम से मुलाकात की, जो WordNet की निर्माता हैं, और बाद में WordNet के लगभग 22,000 संज्ञाओं से शुरू करके ImageNet का निर्माण किया, जिसमें इसकी कई विशेषताओं को शामिल किया गया। ली ने 1987 के एक अनुमान से भी प्रेरणा ली कि औसत व्यक्ति लगभग 30,000 विभिन्न प्रकार की वस्तुओं को पहचानता है। प्रिंसटन में सहायक प्रोफेसर के रूप में, ली ने एक शोध दल इकट्ठा किया और छवि वर्गीकरण में सहायता के लिए Amazon Mechanical Turk का उपयोग किया। लेबलिंग जुलाई 2008 में शुरू हुई और अप्रैल 2010 में समाप्त हुई, जिसमें 167 देशों के 49,000 श्रमिकों ने 160 मिलियन से अधिक उम्मीदवार छवियों को फ़िल्टर और लेबल किया, जो 14 मिलियन छवियों में से प्रत्येक को तीन बार लेबल करने के लिए पर्याप्त बजट था।
डेटाबेस को पहली बार 2009 में फ्लोरिडा में Conference on Computer Vision and Pattern Recognition (CVPR) में एक पोस्टर के रूप में प्रस्तुत किया गया था, जिसका शीर्षक था "ImageNet: A Preview of a Large-scale Hierarchical Dataset." 2009 में, एलेक्स बर्ग ने ऑब्जेक्ट लोकलाइजेशन को एक कार्य के रूप में जोड़ने का सुझाव दिया, जिससे PASCAL Visual Object Classes प्रतियोगिता के साथ सहयोग हुआ और 2010 में ImageNet Large Scale Visual Recognition Challenge की शुरुआत हुई, जिसमें 1000 वर्ग और ऑब्जेक्ट लोकलाइजेशन शामिल हैं, जो 2010 में PASCAL VOC के 20 वर्गों और 19,737 छवियों से कहीं अधिक है।
Dataset Construction
ImageNet अपनी एनोटेशन प्रक्रिया को क्राउडसोर्स करता है। छवि-स्तरीय एनोटेशन एक छवि में किसी ऑब्जेक्ट वर्ग की उपस्थिति या अनुपस्थिति को दर्शाते हैं, जैसे "इस छवि में बाघ हैं" या "इस छवि में बाघ नहीं हैं।" ऑब्जेक्ट-स्तरीय एनोटेशन संकेतित ऑब्जेक्ट के दृश्य भाग के चारों ओर एक बाउंडिंग बॉक्स प्रदान करते हैं। ImageNet वस्तुओं को वर्गीकृत करने के लिए व्यापक WordNet स्कीमा के एक प्रकार का उपयोग करता है, जिसमें बारीक-दानेदार वर्गीकरण के लिए कुत्तों की नस्लों की 120 श्रेणियां जोड़ी गई हैं। 2012 में, ImageNet Mechanical Turk का दुनिया का सबसे बड़ा शैक्षणिक उपयोगकर्ता था, जहां औसत कार्यकर्ता प्रति मिनट 50 छवियों की पहचान करता था। पूर्ण ImageNet की मूल योजना लगभग 50,000 synsets में फैली लगभग 50 मिलियन स्वच्छ, विविध और पूर्ण-रिज़ॉल्यूशन छवियां थी, लेकिन यह हासिल नहीं हुआ।
30 अप्रैल, 2010 तक सारांश आंकड़े:
- गैर-खाली synsets की कुल संख्या: 21,841
- छवियों की कुल संख्या: 14,197,122
- बाउंडिंग बॉक्स एनोटेशन वाली छवियों की संख्या: 1,034,908
- SIFT विशेषताओं वाले synsets की संख्या: 1,000
- SIFT विशेषताओं वाली छवियों की संख्या: 1.2 मिलियन
Categories and Image Format
ImageNet की श्रेणियां WordNet अवधारणाओं से फ़िल्टर की गई थीं। प्रत्येक अवधारणा, जिसमें संभावित रूप से समानार्थी शब्द शामिल हो सकते हैं, को "समानार्थी सेट" या "synset" कहा जाता है। हालांकि WordNet 3.0 में 100,000 से अधिक synsets थे, ज्यादातर संज्ञाएं (80,000+), ImageNet ने गणनीय संज्ञाओं की संख्या को 21,841 synsets पर केंद्रित किया जिन्हें दृश्य रूप से चित्रित किया जा सकता है। प्रत्येक synset में एक WordNet ID (wnid) होता है, जो भाषण के भाग और एक ऑफसेट का संयोजन है; सभी wnids "n" से शुरू होते हैं क्योंकि ImageNet में केवल संज्ञाएं शामिल हैं। उदाहरण के लिए, "dog, domestic dog, Canis familiaris" के लिए wnid "n02084071" है। श्रेणियां 9 स्तरों में फैली हुई हैं, स्तर 1 (जैसे "mammal") से स्तर 9 (जैसे "German shepherd") तक।
छवियों को बहुभाषी समानार्थी शब्दों का उपयोग करके ऑनलाइन छवि खोजों से स्क्रैप किया गया था। वे अलग-अलग रिज़ॉल्यूशन के साथ RGB प्रारूप में आती हैं। उदाहरण के लिए, ImageNet 2012 "fish" श्रेणी में, रिज़ॉल्यूशन 4288 x 2848 से 75 x 56 तक होता है। मशीन लर्निंग में, इन छवियों को आमतौर पर प्रशिक्षण से पहले एक मानक स्थिर रिज़ॉल्यूशन में पूर्व-संसाधित और सफेद किया जाता है। उदाहरण के लिए, PyTorch में, छवियों को पिक्सेल मानों को 0 और 1 के बीच विभाजित करके सामान्यीकृत किया जाता है, फिर माध्य [0.485, 0.456, 0.406] घटाकर और मानक विचलन [0.229, 0.224, 0.225] से विभाजित किया जाता है। ये आंकड़े ImageNet से प्राप्त होते हैं।
Labels and Annotations
प्रत्येक छवि को ठीक एक wnid के साथ लेबल किया जाता है। ImageNet-1K के लिए घने SIFT विशेषताएं (कच्चे SIFT डिस्क्रिप्टर, परिमाणित कोडवर्ड और निर्देशांक सहित) डाउनलोड के लिए उपलब्ध थीं, जो बैग-ऑफ-वर्ड्स दृष्टिकोण के लिए डिज़ाइन की गई थीं। वस्तुओं के लिए बाउंडिंग बॉक्स लगभग 3,000 synsets के लिए उपलब्ध थे, जिनमें से प्रत्येक में औसतन 150 छवियां थीं। कुछ छवियों में विशेषता एनोटेशन होते हैं, हालांकि विवरण पूरी तरह से निर्दिष्ट नहीं हैं। डेटासेट में 1.2 मिलियन छवियों के लिए SIFT विशेषताओं वाले कुछ synsets भी शामिल हैं।
Significance for Deep learning
ImageNet ने गहन शिक्षण क्रांति में एक महत्वपूर्ण भूमिका निभाई है। 30 सितंबर, 2012 को, AlexNet नामक एक convolutional neural network ने ImageNet 2012 Challenge में 15.3% की शीर्ष-5 त्रुटि दर हासिल की, जो उपविजेता से 10.8 प्रतिशत अंक से अधिक कम थी। यह सफलता प्रशिक्षण के दौरान graphics processing units (GPUs) के उपयोग से संभव हुई, जो गहन शिक्षण क्रांति के लिए एक आवश्यक घटक बन गया। The Economist के अनुसार, "अचानक लोगों ने ध्यान देना शुरू कर दिया, न केवल एआई समुदाय के भीतर बल्कि पूरे प्रौद्योगिकी उद्योग में।" 2015 में, AlexNet को माइक्रोसॉफ्ट के 100 से अधिक परतों वाले बहुत गहरे CNN ने पीछे छोड़ दिया, जिसने 3.57% त्रुटि दर के साथ ImageNet 2015 प्रतियोगिता जीती। 2014 में, आंद्रेज कार्पथी ने अनुमान लगाया कि केंद्रित प्रयास से वह 5.1% त्रुटि दर तक पहुंच सकते हैं, और उनकी प्रयोगशाला के लगभग 10 लोग कम प्रयास के साथ लगभग 12-13% तक पहुंच गए। यह अनुमान लगाया गया था कि अधिकतम प्रयास के साथ, एक मानव लगभग 2.4% त्रुटि तक पहुंच सकता है।
ImageNet का प्रभाव प्रतियोगिता से कहीं आगे तक फैला हुआ है। एक बड़े, संरचित और लेबल किए गए डेटासेट की उपलब्धता ने शोधकर्ताओं को अभूतपूर्व पैमाने और विविधता के साथ मॉडल को प्रशिक्षित और बेंचमार्क करने की अनुमति दी। इसने Deep learning नवाचारों जैसे neural networks, residual networks, और Data Augmentation और Batch Normalization जैसी तकनीकों को अपनाने को बढ़ावा दिया। इसने machine learning और artificial intelligence में प्रगति को भी तेज किया, और इसके बेंचमार्क कार्य, जैसे वर्गीकरण और लोकलाइजेशन, computer vision प्रणालियों के मूल्यांकन के लिए मौलिक बन गए हैं। WordNet के माध्यम से डेटासेट का संगठन अन्य बड़े पैमाने के डेटासेट और PyTorch और अन्य फ्रेमवर्क में मानक कार्यप्रवाह को प्रभावित किया है।
ImageNet की सार्वजनिक उपलब्धता का भी व्यापक प्रभाव पड़ा है। इसका उपयोग कई शोध समूहों और कंपनियों द्वारा किया गया है, जिनमें Google DeepMind, OpenAI, और Microsoft शामिल हैं, मॉडल को प्रशिक्षित और मूल्यांकन करने के लिए। इसका प्रभाव Transformer (architecture) आर्किटेक्चर के विकास तक फैला हुआ है जो तब से भाषा मॉडलिंग में मानक बन गए हैं। हाल के वर्षों में, ImageNet कंप्यूटर विज़न अनुसंधान के लिए एक आवश्यक संदर्भ बना हुआ है, हालांकि तृतीय-पक्ष छवियों के उपयोग के कारण डेटासेट ने कॉपीराइट और गोपनीयता के बारे में चर्चाएं भी शुरू की हैं। इन चिंताओं के बावजूद, ImageNet का पैमाना और संरचना विभिन्न डोमेन के साथ समान डेटासेट को प्रेरित करना जारी रखती है, जैसे ImageNet, लेकिन मूल ImageNet और दृश्य पहचान को आगे बढ़ाने में इसकी भूमिका पर ध्यान केंद्रित रहता है।
Sources and Impact
संक्षेप में, ImageNet का निर्माण कृत्रिम बुद्धिमत्ता के इतिहास में एक ऐतिहासिक घटना थी। इसने एक व्यापक और स्केलेबल डेटासेट प्रदान किया जिसने डेटा-संचालित दृष्टिकोणों के महत्व को उजागर किया। गहन शिक्षण उछाल पर इसका प्रभाव अतिरंजित नहीं किया जा सकता, क्योंकि इसने एल्गोरिदम और हार्डवेयर में सफलताओं को सक्षम किया जिसके परिणामस्वरूप generative AI और बड़े मॉडलों का वर्तमान युग आया। 2025 तक, ImageNet अभी भी नए तरीकों और सिद्धांतों के मूल्यांकन के लिए एक बेंचमार्क के रूप में कार्य करता है, जैसे कि ट्रांसफॉर्मर, बड़े भाषा मॉडल, और फाउंडेशन मॉडल। परियोजना का जमीनी दृष्टिकोण - वैश्विक समुदाय के माध्यम से एनोटेशन की क्राउडसोर्सिंग - ने कई बाद के डेटासेट और पहलों के लिए मॉडल भी स्थापित किए।
ImageNet की सफलता ने प्रदर्शित किया कि उच्च-गुणवत्ता, बड़े पैमाने के डेटासेट न केवल फायदेमंद हैं बल्कि एआई प्रगति के लिए अक्सर आवश्यक होते हैं। इसने वितरित कंप्यूटिंग और क्लाउड सेवाओं जैसे Amazon Web Services और Google Cloud में प्रगति को बढ़ावा दिया, साथ ही NVIDIA और AMD** जैसी कंपनियों से हार्डवेयर सुधार भी। प्रतियोगिता स्वयं, ImageNet Large Scale Visual Recognition Challenge, कंप्यूटर विज़न में प्रगति को मापने के लिए एक संस्था बनी हुई है। एआई के चल रहे विकास के बावजूद, ImageNet की विरासत बनी हुई है, शैक्षणिक अनुसंधान से लेकर स्वायत्त वाहनों, चिकित्सा इमेजिंग और मल्टीमॉडल प्रणालियों में व्यावहारिक तैनाती तक, symbolic AI से तंत्रिका नेटवर्क और मशीन लर्निंग की ओर क्षेत्र के प्रक्षेपवक्र को आकार देती है। इसकी रिलीज के बाद के वर्षों में, ImageNet ने COCO और Flickr जैसे बाद के डेटासेट के डिजाइन को प्रभावित किया है, जो समान रूप से मशीन बुद्धि की सीमा को आगे बढ़ाने के लिए बड़े पैमाने पर, एनोटेटेड डेटा प्रदान करने का लक्ष्य रखते हैं।