इमेजनेट डेटासेट निर्मित

अंग्रेज़ी से अनुवादित

ImageNet एक बड़े पैमाने पर दृश्य डेटाबेस है जिसे फेई-फेई ली और उनके सहयोगियों द्वारा बनाया गया है, जिसमें 20,000 से अधिक श्रेणियों में 14 मिलियन से अधिक हाथ से एनोटेट की गई छवियाँ शामिल हैं, और यह अपनी वार्षिक पहचान चुनौती के माध्यम से गहन शिक्षा को आगे बढ़ाने में महत्वपूर्ण रहा है।

ImageNet एक बड़े पैमाने पर दृश्य डेटाबेस है जिसे दृश्य वस्तु पहचान सॉफ्टवेयर अनुसंधान में उपयोग के लिए डिज़ाइन किया गया है। इसमें 14 मिलियन से अधिक हाथ से एनोटेट की गई छवियां शामिल हैं जो दर्शाती हैं कि चित्रों में कौन सी वस्तुएं दिखाई गई हैं, जिनमें से कम से कम एक मिलियन छवियां बाउंडिंग बॉक्स भी प्रदान करती हैं। डेटाबेस में 20,000 से अधिक श्रेणियां शामिल हैं, जिनमें से प्रत्येक में आमतौर पर कई सौ छवियां होती हैं। 2010 से, ImageNet परियोजना एक वार्षिक सॉफ्टवेयर प्रतियोगिता, ImageNet लार्ज स्केल विज़ुअल रिकग्निशन चैलेंज (ILSVRC) चलाती रही है, जहां सॉफ्टवेयर प्रोग्राम वस्तुओं और दृश्यों को सही ढंग से वर्गीकृत और पहचानने के लिए प्रतिस्पर्धा करते हैं। चैलेंज में एक हजार गैर-अतिव्यापी वर्गों की एक छंटनी की गई सूची का उपयोग किया जाता है।

यह परियोजना एआई शोधकर्ता फेई-फेई ली द्वारा परिकल्पित की गई थी, जिन्होंने 2006 में इस विचार पर काम करना शुरू किया था। उस समय जब अधिकांश एआई अनुसंधान मॉडल और एल्गोरिदम पर केंद्रित था, ली का लक्ष्य एआई एल्गोरिदम को प्रशिक्षित करने के लिए उपलब्ध डेटा का विस्तार और सुधार करना था। 2007 में, उन्होंने प्रिंसटन की प्रोफेसर क्रिस्टियाने फेलबाउम से मुलाकात की, जो WordNet के रचनाकारों में से एक हैं, ताकि परियोजना पर चर्चा की जा सके। इसके परिणामस्वरूप WordNet के लगभग 22,000 संज्ञाओं से शुरू करके और इसकी कई विशेषताओं का उपयोग करके ImageNet का निर्माण हुआ। ली 1987 के एक अनुमान से भी प्रेरित थीं कि औसत व्यक्ति लगभग 30,000 विभिन्न प्रकार की वस्तुओं को पहचानता है।

इतिहास और निर्माण

प्रिंसटन में सहायक प्रोफेसर के रूप में, ली ने ImageNet परियोजना पर काम करने के लिए शोधकर्ताओं की एक टीम इकट्ठी की। उन्होंने छवियों के वर्गीकरण में मदद के लिए अमेज़न मैकेनिकल टर्क का उपयोग किया। लेबलिंग जुलाई 2008 में शुरू हुई और अप्रैल 2010 में समाप्त हुई। 160 मिलियन से अधिक उम्मीदवार छवियों को फ़िल्टर और लेबल करने में 167 देशों के 49,000 श्रमिकों को लगा। बजट ने प्रत्येक 14 मिलियन छवियों को तीन बार लेबल करने की अनुमति दी।

मूल योजना में प्रति श्रेणी 10,000 छवियों, 40,000 श्रेणियों के लिए 400 मिलियन छवियों की मांग की गई थी, जिनमें से प्रत्येक को तीन बार सत्यापित किया जाना था। हालांकि, मनुष्य अधिकतम दो छवियों को प्रति सेकंड वर्गीकृत कर सकते हैं, और इस दर पर अनुमान लगाया गया था कि इसमें 19 मानव-वर्ष का श्रम लगेगा (बिना आराम के)। टीम ने पहली बार डेटाबेस को 2009 के कंप्यूटर विज़न और पैटर्न रिकग्निशन सम्मेलन (CVPR) में फ्लोरिडा में एक पोस्टर के रूप में प्रस्तुत किया, जिसका शीर्षक था "ImageNet: ए प्रीव्यू ऑफ़ अ लार्ज-स्केल हायरार्किकल डेटासेट।" पोस्टर को विज़न साइंसेज सोसाइटी 2009 में फिर से उपयोग किया गया।

2009 में, एलेक्स बर्ग ने एक कार्य के रूप में ऑब्जेक्ट लोकलाइज़ेशन जोड़ने का सुझाव दिया। ली ने सहयोग के लिए 2009 में PASCAL विज़ुअल ऑब्जेक्ट क्लासेस प्रतियोगिता से संपर्क किया, जिसके परिणामस्वरूप 2010 में बाद की ImageNet लार्ज स्केल विज़ुअल रिकग्निशन चैलेंज शुरू हुई। चैलेंज में 1000 वर्ग और ऑब्जेक्ट लोकलाइज़ेशन शामिल थे, जबकि PASCAL VOC में 2010 में केवल 20 वर्ग और 19,737 छवियां थीं।

गहन शिक्षण के लिए महत्व

30 सितंबर 2012 को, AlexNet नामक एक कन्वोल्यूशनल न्यूरल नेटवर्क (CNN) ने ImageNet 2012 चैलेंज में 15.3% की शीर्ष-5 त्रुटि हासिल की, जो उपविजेता की तुलना में 10.8 प्रतिशत अंक से अधिक कम थी। प्रशिक्षण के दौरान ग्राफिक्स प्रोसेसिंग यूनिट (GPU) के उपयोग के कारण CNN का उपयोग संभव था, जो गहन शिक्षण क्रांति का एक आवश्यक घटक है। द इकोनॉमिस्ट के अनुसार, "अचानक लोगों ने ध्यान देना शुरू कर दिया, न केवल एआई समुदाय के भीतर बल्कि पूरे प्रौद्योगिकी उद्योग में।"

2015 में, AlexNet को माइक्रोसॉफ्ट के 100 से अधिक परतों वाले बहुत गहरे CNN ने पीछे छोड़ दिया, जिसने परीक्षण सेट पर 3.57% त्रुटि के साथ ImageNet 2015 प्रतियोगिता जीती। आंद्रेज करपाथी ने 2014 में अनुमान लगाया था कि केंद्रित प्रयास के साथ, वह 5.1% त्रुटि दर तक पहुंच सकते हैं, और उनकी प्रयोगशाला के लगभग 10 लोग कम प्रयास के साथ लगभग 12-13% तक पहुंच गए। यह अनुमान लगाया गया था कि अधिकतम प्रयास के साथ, एक मानव 2.4% त्रुटि तक पहुंच सकता है।

डेटासेट संरचना

ImageNet अपनी एनोटेशन प्रक्रिया को क्राउडसोर्स करता है। छवि-स्तरीय एनोटेशन एक छवि में किसी ऑब्जेक्ट वर्ग की उपस्थिति या अनुपस्थिति को दर्शाते हैं, जैसे "इस छवि में बाघ हैं" या "इस छवि में बाघ नहीं हैं।" ऑब्जेक्ट-स्तरीय एनोटेशन संकेतित ऑब्जेक्ट के दृश्य भाग के चारों ओर एक बाउंडिंग बॉक्स प्रदान करते हैं। ImageNet वस्तुओं को वर्गीकृत करने के लिए व्यापक WordNet स्कीमा के एक प्रकार का उपयोग करता है, जिसमें बारीक वर्गीकरण प्रदर्शित करने के लिए कुत्तों की नस्लों की 120 श्रेणियां जोड़ी गई हैं।

2012 में, ImageNet मैकेनिकल टर्क का दुनिया का सबसे बड़ा शैक्षणिक उपयोगकर्ता था, जिसमें औसत कार्यकर्ता प्रति मिनट 50 छवियों की पहचान करता था। पूर्ण ImageNet की मूल योजना में लगभग 50,000 सिनसेट्स में लगभग 50 मिलियन स्वच्छ, विविध और पूर्ण-रिज़ॉल्यूशन छवियां होंगी, लेकिन यह हासिल नहीं हुआ।

30 अप्रैल, 2010 तक, सारांश आंकड़े थे: गैर-खाली सिनसेट्स की कुल संख्या: 21,841; छवियों की कुल संख्या: 14,197,122; बाउंडिंग बॉक्स एनोटेशन वाली छवियों की संख्या: 1,034,908; SIFT विशेषताओं वाले सिनसेट्स की संख्या: 1,000; SIFT विशेषताओं वाली छवियों की संख्या: 1.2 मिलियन।

श्रेणियां

ImageNet की श्रेणियां WordNet अवधारणाओं से फ़िल्टर की गई थीं। प्रत्येक अवधारणा, क्योंकि इसमें कई समानार्थी शब्द हो सकते हैं (उदाहरण के लिए, "बिल्ली का बच्चा" और "युवा बिल्ली"), को "समानार्थी सेट" या "सिनसेट" कहा जाता है। WordNet 3.0 में 100,000 से अधिक सिनसेट थे, जिनमें से अधिकांश संज्ञाएं (80,000+) थीं। ImageNet डेटासेट ने इन्हें 21,841 सिनसेट्स तक फ़िल्टर किया जो गणनीय संज्ञाएं हैं जिन्हें दृश्य रूप से चित्रित किया जा सकता है।

WordNet 3.0 में प्रत्येक सिनसेट में एक "WordNet आईडी" (wnid) होता है, जो भाषण के भाग और एक "ऑफसेट" (एक अद्वितीय पहचान संख्या) का संयोजन होता है। प्रत्येक wnid "n" से शुरू होता है क्योंकि ImageNet में केवल संज्ञाएं शामिल हैं। उदाहरण के लिए, सिनसेट "कुत्ता, घरेलू कुत्ता, कैनिस फैमिलियारिस" का wnid "n02084071" है। श्रेणियां 9 स्तरों में आती हैं, स्तर 1 (जैसे "स्तनपायी") से स्तर 9 (जैसे "जर्मन शेफर्ड") तक।

छवि प्रारूप

छवियों को ऑनलाइन छवि खोज इंजन (Google, Picsearch, MSN, Yahoo, Flickr, आदि) से कई भाषाओं में समानार्थी शब्दों का उपयोग करके स्क्रैप किया गया था। उदाहरण के लिए, जर्मन शेफर्ड के लिए: जर्मन पुलिस कुत्ता, अल्साटियन, ओवेजेरो एलेमन, पास्टर टेडेस्को, 德国牧羊犬। ImageNet में अलग-अलग रिज़ॉल्यूशन के साथ RGB प्रारूप में छवियां शामिल हैं। उदाहरण के लिए, ImageNet 2012 "मछली" श्रेणी में, रिज़ॉल्यूशन 4288 x 2848 से 75 x 56 तक होता है। मशीन लर्निंग में, इन्हें आमतौर पर एक मानक स्थिर रिज़ॉल्यूशन में पूर्व-संसाधित किया जाता है और तंत्रिका नेटवर्क द्वारा आगे की प्रक्रिया से पहले सफेद किया जाता है।

उदाहरण के लिए, PyTorch में, ImageNet छवियों को डिफ़ॉल्ट रूप से पिक्सेल मानों को 0 और 1 के बीच विभाजित करके सामान्यीकृत किया जाता है, फिर [0.485, 0.456, 0.406] घटाकर और [0.229, 0.224, 0.225] से विभाजित किया जाता है। ये ImageNet के लिए माध्य और मानक विचलन हैं, इसलिए यह इनपुट डेटा को सफेद करता है।

लेबल और एनोटेशन

प्रत्येक छवि को बिल्कुल एक wnid के साथ लेबल किया जाता है। ImageNet-1K के लिए घने SIFT विशेषताएं (कच्चे SIFT वर्णनकर्ता, परिमाणित कोडवर्ड, और प्रत्येक वर्णनकर्ता/कोडवर्ड के निर्देशांक) डाउनलोड के लिए उपलब्ध थे, जो दृश्य शब्दों के बैग के लिए डिज़ाइन किए गए थे। वस्तुओं के बाउंडिंग बॉक्स लगभग 3,000 लोकप्रिय सिनसेट्स के लिए उपलब्ध थे, जिनमें प्रत्येक सिनसेट में औसतन 150 छवियां थीं। इसके अतिरिक्त, कुछ छवियों में विशेषता एनोटेशन होते हैं, हालांकि विवरण सीमित हैं।

विरासत और प्रभाव

ImageNet मशीन लर्निंग और कंप्यूटर विज़न अनुसंधान के लिए एक बेंचमार्क बन गया है, जो कृत्रिम बुद्धिमत्ता में प्रगति को बढ़ावा देता है। इसकी वार्षिक चुनौती ने कन्वोल्यूशनल न्यूरल नेटवर्क और अन्य आर्किटेक्चर में नवाचारों को प्रेरित किया है, जो गहन शिक्षण के व्यापक क्षेत्र को प्रभावित करता है। डेटासेट का पैमाना और संरचना बाद की बड़े पैमाने पर डेटा परियोजनाओं और डेटा संवर्धन तकनीकों के विकास को भी सूचित करती है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:computer-vision·dataset·deep-learning·image-recognition
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास