अंग्रेज़ी से अनुवादित

ImageNet फेई-फेई ली और सहयोगियों द्वारा बनाया गया एक बड़ा दृश्य डेटाबेस है, जिसे 2009 में लॉन्च किया गया था, जिसमें 20,000+ श्रेणियों में 14 मिलियन से अधिक हाथ से एनोटेट की गई छवियाँ शामिल हैं, और यह दृश्य पहचान के लिए एक बेंचमार्क बन गया, जिसने [[deep-learning]] में प्रगति को बढ़ावा दिया।

ImageNet एक बड़े पैमाने पर दृश्य डेटाबेस है जिसे दृश्य वस्तु पहचान सॉफ्टवेयर अनुसंधान में उपयोग के लिए डिज़ाइन किया गया है। इसमें 14 मिलियन से अधिक हाथ से एनोटेट की गई छवियां शामिल हैं, जिनमें 20,000 से अधिक श्रेणियां हैं, जिनमें से प्रत्येक में आम तौर पर कई सौ छवियां होती हैं। कम से कम एक मिलियन छवियों में बाउंडिंग बॉक्स एनोटेशन शामिल हैं। एनोटेशन और तृतीय-पक्ष छवि URL का डेटाबेस स्वतंत्र रूप से उपलब्ध है, हालांकि वास्तविक छवियां ImageNet की स्वामित्व में नहीं हैं। 2010 से, परियोजना ने एक वार्षिक सॉफ्टवेयर प्रतियोगिता, ImageNet लार्ज स्केल विज़ुअल रिकग्निशन चैलेंज (ILSVRC) चलाया है, जहां कार्यक्रम एक हज़ार गैर-अतिव्यापी वर्गों की छंटनी की गई सूची का उपयोग करके वस्तुओं और दृश्यों को वर्गीकृत और पहचानने के लिए प्रतिस्पर्धा करते हैं।

यह परियोजना एआई शोधकर्ता फेई-फेई ली की दृष्टि से उत्पन्न हुई, जिन्होंने उस समय एआई एल्गोरिदम को प्रशिक्षित करने के लिए उपलब्ध डेटा का विस्तार करने की मांग की थी जब अधिकांश शोध मॉडल और एल्गोरिदम पर केंद्रित थे। ImageNet तब से गहन शिक्षण क्रांति की आधारशिला बन गया है, जिसने कंप्यूटर दृष्टि में सफलताओं को सक्षम किया और कृत्रिम बुद्धिमत्ता के व्यापक क्षेत्र को प्रभावित किया।

इतिहास

फेई-फेई ली ने 2006 में ImageNet के विचार पर काम करना शुरू किया। 2007 में, उन्होंने प्रिंसटन के प्रोफेसर क्रिस्टियन फेलबाम से मुलाकात की, जो WordNet के निर्माताओं में से एक हैं, परियोजना पर चर्चा करने के लिए। इस बैठक ने ली को WordNet के लगभग 22,000 संज्ञाओं से शुरू करके और इसकी कई विशेषताओं का उपयोग करके ImageNet बनाने के लिए प्रेरित किया। वह 1987 के एक अनुमान से भी प्रेरित थीं कि औसत व्यक्ति लगभग 30,000 विभिन्न प्रकार की वस्तुओं को पहचानता है।

प्रिंसटन में सहायक प्रोफेसर के रूप में, ली ने परियोजना पर काम करने के लिए शोधकर्ताओं की एक टीम इकट्ठी की। उन्होंने छवियों के वर्गीकरण में मदद के लिए अमेज़न मैकेनिकल तुर्क का उपयोग किया। लेबलिंग जुलाई 2008 में शुरू हुई और अप्रैल 2010 में समाप्त हुई, जिसमें 167 देशों के 49,000 श्रमिक शामिल थे जिन्होंने 160 मिलियन से अधिक उम्मीदवार छवियों को फ़िल्टर और लेबल किया। बजट ने प्रत्येक 14 मिलियन छवियों को तीन बार लेबल करने की अनुमति दी।

मूल योजना में 40,000 श्रेणियों में प्रति श्रेणी 10,000 छवियां शामिल थीं, जिनकी कुल 400 मिलियन छवियां थीं, प्रत्येक को तीन बार सत्यापित किया गया था। हालांकि, मनुष्य अधिकतम दो छवियों को प्रति सेकंड वर्गीकृत कर सकते हैं, और उस दर पर यह अनुमान लगाया गया था कि बिना आराम के 19 मानव-वर्ष लगेंगे। पूरी योजना हासिल नहीं हुई थी।

डेटाबेस को पहली बार 2009 में फ्लोरिडा में कंप्यूटर विज़न और पैटर्न पहचान सम्मेलन (CVPR) में एक पोस्टर के रूप में प्रस्तुत किया गया था, जिसका शीर्षक था "ImageNet: ए प्रीव्यू ऑफ़ ए लार्ज-स्केल पदानुक्रमित डेटासेट।" पोस्टर का पुन: उपयोग विज़न साइंसेज सोसाइटी 2009 में किया गया था।

2009 में, एलेक्स बर्ग ने एक कार्य के रूप में ऑब्जेक्ट लोकलाइज़ेशन जोड़ने का सुझाव दिया। ली ने सहयोग के लिए PASCAL विज़ुअल ऑब्जेक्ट क्लासेस प्रतियोगिता से संपर्क किया, जिसके परिणामस्वरूप 2010 में ImageNet लार्ज स्केल विज़ुअल रिकग्निशन चैलेंज शुरू हुआ। चुनौती में 1000 वर्ग और ऑब्जेक्ट लोकलाइज़ेशन थे, जबकि PASCAL VOC में 2010 में केवल 20 वर्ग और 19,737 छवियां थीं।

गहन शिक्षण के लिए महत्व

30 सितंबर 2012 को, एलेक्सनेट नामक एक कन्वोल्यूशनल न्यूरल नेटवर्क (CNN) ने ImageNet 2012 चैलेंज में 15.3% की शीर्ष-5 त्रुटि हासिल की, जो उपविजेता से 10.8 प्रतिशत अंक कम थी। प्रशिक्षण के दौरान ग्राफिक्स प्रोसेसिंग इकाइयों (GPU) के उपयोग ने इसे संभव बनाया, जो गहन शिक्षण क्रांति का एक आवश्यक घटक था। द इकोनॉमिस्ट के अनुसार, "अचानक लोगों ने ध्यान देना शुरू कर दिया, न केवल एआई समुदाय के भीतर बल्कि पूरे प्रौद्योगिकी उद्योग में।"

2015 में, एलेक्सनेट को माइक्रोसॉफ्ट के 100 से अधिक परतों वाले बहुत गहरे CNN ने पीछे छोड़ दिया, जिसने परीक्षण सेट पर 3.57% त्रुटि के साथ ImageNet 2015 प्रतियोगिता जीती। आंद्रेई करपाठी ने 2014 में अनुमान लगाया था कि केंद्रित प्रयास के साथ, वह 5.1% त्रुटि दर तक पहुंच सकते हैं, और उनकी प्रयोगशाला के लगभग 10 लोग कम प्रयास के साथ लगभग 12-13% तक पहुंच गए। यह अनुमान लगाया गया था कि अधिकतम प्रयास के साथ, एक मानव 2.4% तक पहुंच सकता है।

इन परिणामों ने गहन शिक्षण और तंत्रिका नेटवर्क आर्किटेक्चर की शक्ति का प्रदर्शन किया, जिससे प्रौद्योगिकी उद्योग में मशीन लर्निंग तकनीकों को अपनाने में तेजी आई।

डेटासेट

ImageNet अपनी एनोटेशन प्रक्रिया को क्राउडसोर्स करता है। छवि-स्तरीय एनोटेशन एक छवि में किसी ऑब्जेक्ट वर्ग की उपस्थिति या अनुपस्थिति को इंगित करते हैं, जैसे "इस छवि में बाघ हैं" या "इस छवि में कोई बाघ नहीं हैं।" ऑब्जेक्ट-स्तरीय एनोटेशन संकेतित ऑब्जेक्ट के दृश्य भाग के चारों ओर एक बाउंडिंग बॉक्स प्रदान करते हैं। ImageNet वस्तुओं को वर्गीकृत करने के लिए व्यापक WordNet स्कीमा के एक प्रकार का उपयोग करता है, जिसमें बारीक-दानेदार वर्गीकरण प्रदर्शित करने के लिए कुत्तों की नस्लों की 120 श्रेणियां जोड़ी जाती हैं।

2012 में, ImageNet मैकेनिकल तुर्क का दुनिया का सबसे बड़ा शैक्षणिक उपयोगकर्ता था। औसत कार्यकर्ता प्रति मिनट 50 छवियों की पहचान करता था।

30 अप्रैल, 2010 को दिए गए सारांश आँकड़े:

  • गैर-रिक्त synsets की कुल संख्या: 21,841
  • छवियों की कुल संख्या: 14,197,122
  • बाउंडिंग बॉक्स एनोटेशन वाली छवियों की संख्या: 1,034,908
  • SIFT सुविधाओं वाले synsets की संख्या: 1,000
  • SIFT सुविधाओं वाली छवियों की संख्या: 1.2 मिलियन

श्रेणियाँ

ImageNet की श्रेणियों को WordNet अवधारणाओं से फ़िल्टर किया गया था। प्रत्येक अवधारणा, क्योंकि इसमें कई समानार्थक शब्द हो सकते हैं (उदाहरण के लिए, "बिल्ली" और "युवा बिल्ली"), को "synonym set" या "synset" कहा जाता है। WordNet 3.0 में 100,000 से अधिक synsets थे, जिनमें से अधिकांश संज्ञाएं (80,000+) थीं। ImageNet डेटासेट ने इन्हें 21,841 synsets तक फ़िल्टर किया जो गणनीय संज्ञाएं हैं जिन्हें दृश्य रूप से चित्रित किया जा सकता है।

WordNet 3.0 में प्रत्येक synset में एक "WordNet ID" (wnid) होता है, जो भाषण के भाग और एक "ऑफसेट" (एक अद्वितीय पहचान संख्या) का संयोजन होता है। प्रत्येक wnid "n" से शुरू होता है क्योंकि ImageNet में केवल संज्ञाएं शामिल हैं। उदाहरण के लिए, synset "कुत्ता, घरेलू कुत्ता, कैनिस परिचित" का wnid "n02084071" है।

ImageNet में श्रेणियां 9 स्तरों में आती हैं, स्तर 1 (जैसे "स्तनपायी") से स्तर 9 (जैसे "जर्मन शेफर्ड") तक।

छवि प्रारूप

छवियों को कई भाषाओं में समानार्थक शब्दों का उपयोग करके ऑनलाइन छवि खोज इंजन (Google, Picsearch, MSN, Yahoo, Flickr, आदि) से स्क्रैप किया गया था। उदाहरण के लिए, जर्मन शेफर्ड के लिए, खोज शर्तों में "जर्मन पुलिस कुत्ता," "अल्साटियन," "ओवेजेरो एलेमन," "पास्टर जर्मन," और "德国牧羊犬" शामिल थे।

ImageNet में अलग-अलग रिज़ॉल्यूशन वाली RGB प्रारूप में छवियां शामिल हैं। उदाहरण के लिए, ImageNet 2012 में, "मछली" श्रेणी में 4288 x 2848 से 75 x 56 तक के रिज़ॉल्यूशन हैं। मशीन लर्निंग में, इन्हें आम तौर पर एक मानक स्थिर रिज़ॉल्यूशन में पूर्व-संसाधित किया जाता है और तंत्रिका नेटवर्क द्वारा आगे की प्रक्रिया से पहले सफ़ेद किया जाता है। उदाहरण के लिए, PyTorch में, ImageNet छवियों को पिक्सेल मानों को 0 और 1 के बीच विभाजित करके, फिर [0.485, 0.456, 0.406] से घटाकर, और [0.229, 0.224, 0.225] से विभाजित करके सामान्यीकृत किया जाता है। ये ImageNet के लिए माध्य और मानक विचलन हैं, इसलिए यह इनपुट डेटा को सफ़ेद करता है।

लेबल और एनोटेशन

प्रत्येक छवि को ठीक एक wnid के साथ लेबल किया जाता है। ImageNet-1K के लिए घने SIFT सुविधाएं (कच्चे SIFT वर्णनकर्ता, मात्राबद्ध कोडवर्ड, और प्रत्येक वर्णनकर्ता/कोडवर्ड के निर्देशांक) डाउनलोड के लिए उपलब्ध थीं, जो दृश्य शब्दों के बैग के लिए डिज़ाइन की गई थीं। वस्तुओं के बाउंडिंग बॉक्स लगभग 3,000 लोकप्रिय synsets के लिए उपलब्ध थे, जिनमें प्रत्येक synset में औसतन 150 छवियां थीं। इसके अलावा, कुछ छवियों में विशेषता एनोटेशन हैं, हालांकि इनकी पूरी सीमा यहां विस्तृत नहीं है।

विरासत

ImageNet के निर्माण ने एआई में डेटा-केंद्रित दृष्टिकोणों की ओर एक बदलाव को चिह्नित किया, जिसने बाद के डेटासेट और बेंचमार्क को प्रभावित किया। इसकी वार्षिक चुनौती कंप्यूटर दृष्टि में प्रगति को मापने के लिए एक मानक बन गई, और इसकी सफलता ने जनरेटिव एआई और अन्य एआई अनुप्रयोगों के विकास को उत्प्रेरित किया। डेटासेट मॉडल को प्रशिक्षित करने और मूल्यांकन करने के लिए एक मूलभूत संसाधन बना हुआ है, और इसका प्रभाव स्वायत्त-ड्राइविंग और चिकित्सा-इमेजिंग जैसे क्षेत्रों तक फैला हुआ है।

अपनी उपलब्धियों के बावजूद, ImageNet ने पूर्वाग्रह और एनोटेशन गुणवत्ता के बारे में भी सवाल उठाए हैं, जिससे एआई समुदाय में डेटासेट क्यूरेशन और नैतिकता के बारे में चर्चा हुई है। फिर भी, आधुनिक एआई के विकास में इसकी भूमिका निर्विवाद है, और यह अनुसंधान और उद्योग में व्यापक रूप से उपयोग किया जा रहा है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:computer-vision·dataset·deep-learning·artificial-intelligence
इस पृष्ठ को अंतिम बार संपादित किया गया 9 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास