अंग्रेज़ी से अनुवादित

ImageNet एक बड़ा श्रेणीबद्ध दृश्य डेटाबेस है जिसमें 14 मिलियन से अधिक हाथ से एनोटेट की गई छवियाँ हैं, जिनका उपयोग दृश्य वस्तु पहचान अनुसंधान के लिए किया जाता है, और यह वार्षिक ImageNet Large Scale Visual Recognition Challenge (ILSVRC) के लिए सबसे प्रसिद्ध है।

ImageNet एक बड़े पैमाने पर दृश्य डेटाबेस है जिसे दृश्य वस्तु पहचान सॉफ्टवेयर अनुसंधान में उपयोग के लिए डिज़ाइन किया गया है। यह परियोजना 14 मिलियन से अधिक हाथ से एनोटेट की गई छवियां प्रदान करती है जो चित्रित वस्तुओं को दर्शाती हैं, जिनमें से कम से कम एक मिलियन छवियों में बाउंडिंग बॉक्स भी शामिल हैं। इसमें 20,000 से अधिक श्रेणियां शामिल हैं, जिनमें से प्रत्येक में आमतौर पर कई सौ छवियां होती हैं। तीसरे पक्ष के छवि URL के लिए एनोटेशन का डेटाबेस स्वतंत्र रूप से उपलब्ध है, हालांकि वास्तविक छवियां ImageNet की स्वामित्व वाली नहीं हैं। 2010 से, यह परियोजना एक वार्षिक सॉफ्टवेयर प्रतियोगिता, ImageNet लार्ज स्केल विज़ुअल रिकग्निशन चैलेंज (ILSVRC) चला रही है, जहां कार्यक्रम एक हजार गैर-अतिव्यापी वर्गों की छंटनी की गई सूची का उपयोग करके वस्तुओं और दृश्यों को वर्गीकृत और पहचानने के लिए प्रतिस्पर्धा करते हैं।

इतिहास

एआई शोधकर्ता फेई-फेई ली ने 2006 में ImageNet के लिए विचार विकसित करना शुरू किया। उस समय जब अधिकांश एआई अनुसंधान मॉडल और एल्गोरिदम पर केंद्रित था, ली का लक्ष्य एआई एल्गोरिदम को प्रशिक्षित करने के लिए उपलब्ध डेटा का विस्तार और सुधार करना था। 2007 में, ली ने प्रिंसटन के प्रोफेसर क्रिस्टियाने फेलबाम से मुलाकात की, जो WordNet के रचनाकारों में से एक हैं, ताकि परियोजना पर चर्चा की जा सके। इस बैठक ने ली को WordNet के लगभग 22,000 संज्ञाओं से शुरू करके ImageNet बनाने के लिए प्रेरित किया और इसकी कई विशेषताओं को अपनाया। वह 1987 के एक अनुमान से भी प्रेरित थीं कि औसत व्यक्ति लगभग 30,000 विभिन्न प्रकार की वस्तुओं को पहचानता है।

प्रिंसटन में सहायक प्रोफेसर के रूप में, ली ने परियोजना पर काम करने के लिए शोधकर्ताओं की एक टीम इकट्ठी की। उन्होंने छवियों को वर्गीकृत करने में मदद के लिए अमेज़न मैकेनिकल टर्क का उपयोग किया। लेबलिंग जुलाई 2008 में शुरू हुई और अप्रैल 2010 में समाप्त हुई, जिसमें 167 देशों के 49,000 श्रमिकों ने 160 मिलियन से अधिक उम्मीदवार छवियों को फ़िल्टर और लेबल किया। बजट ने प्रत्येक 14 मिलियन छवियों को तीन बार लेबल करने की अनुमति दी। मूल योजना में 40,000 श्रेणियों में प्रति श्रेणी 10,000 छवियों का आह्वान किया गया था, जो कुल 400 मिलियन छवियां बनाती हैं, प्रत्येक को तीन बार सत्यापित किया गया था। हालांकि, मनुष्य अधिकतम 2 छवियों को प्रति सेकंड वर्गीकृत कर सकते हैं, और उस दर पर बिना आराम के श्रम के 19 मानव-वर्ष लेने का अनुमान लगाया गया था।

डेटाबेस को पहली बार 2009 में फ्लोरिडा में कंप्यूटर विज़न और पैटर्न रिकग्निशन सम्मेलन (CVPR) में एक पोस्टर के रूप में प्रस्तुत किया गया था, जिसका शीर्षक था "ImageNet: ए प्रीव्यू ऑफ़ अ लार्ज-स्केल हाइरार्किकल डेटासेट।" 2009 में, एलेक्स बर्ग ने ऑब्जेक्ट लोकलाइज़ेशन को एक कार्य के रूप में जोड़ने का सुझाव दिया। ली ने सहयोग के लिए 2009 में PASCAL विज़ुअल ऑब्जेक्ट क्लासेस प्रतियोगिता से संपर्क किया, जिसके परिणामस्वरूप 2010 में ImageNet लार्ज स्केल विज़ुअल रिकग्निशन चैलेंज शुरू हुआ, जिसमें 1000 वर्ग और ऑब्जेक्ट लोकलाइज़ेशन शामिल थे, जबकि PASCAL VOC के 20 वर्ग और 19,737 छवियां थीं।

डीप लर्निंग के लिए महत्व

30 सितंबर 2012 को, एलेक्सनेट नामक एक कन्वोल्यूशनल न्यूरल नेटवर्क (CNN) ने ImageNet 2012 चैलेंज में 15.3% की शीर्ष-5 त्रुटि हासिल की, जो उपविजेता से 10.8 प्रतिशत अंक से अधिक कम थी। प्रशिक्षण के दौरान ग्राफिक्स प्रोसेसिंग यूनिट (GPU) के उपयोग ने कन्वोल्यूशनल न्यूरल नेटवर्क को संभव बना दिया, जो डीप लर्निंग क्रांति का एक आवश्यक घटक था। द इकोनॉमिस्ट के अनुसार, "अचानक लोगों ने ध्यान देना शुरू कर दिया, न केवल एआई समुदाय के भीतर बल्कि पूरे प्रौद्योगिकी उद्योग में।"

2015 में, एलेक्सनेट को माइक्रोसॉफ्ट के 100 से अधिक परतों वाले बहुत गहरे CNN ने पीछे छोड़ दिया, जिसने परीक्षण सेट पर 3.57% त्रुटि दर के साथ ImageNet 2015 प्रतियोगिता जीती। आंद्रेज करपाथी ने 2014 में अनुमान लगाया कि केंद्रित प्रयास के साथ, वह 5.1% त्रुटि दर तक पहुंच सकते हैं, और उनकी प्रयोगशाला के लगभग 10 लोग कम प्रयास के साथ लगभग 12-13% तक पहुंच गए। यह अनुमान लगाया गया था कि अधिकतम प्रयास के साथ, एक मानव 2.4% तक पहुंच सकता है।

डेटासेट

ImageNet अपनी एनोटेशन प्रक्रिया को क्राउडसोर्स करता है। छवि-स्तरीय एनोटेशन एक छवि में किसी वस्तु वर्ग की उपस्थिति या अनुपस्थिति को दर्शाते हैं, जैसे "इस छवि में बाघ हैं" या "इस छवि में कोई बाघ नहीं हैं।" ऑब्जेक्ट-स्तरीय एनोटेशन संकेतित वस्तु के दृश्य भाग के चारों ओर एक बाउंडिंग बॉक्स प्रदान करते हैं। ImageNet वस्तुओं को वर्गीकृत करने के लिए व्यापक WordNet स्कीमा का एक प्रकार उपयोग करता है, जिसमें बारीक-दानेदार वर्गीकरण प्रदर्शित करने के लिए कुत्तों की नस्लों की 120 श्रेणियां जोड़ी गई हैं।

2012 में, ImageNet मैकेनिकल टर्क का दुनिया का सबसे बड़ा शैक्षणिक उपयोगकर्ता था, जिसमें औसत कार्यकर्ता प्रति मिनट 50 छवियों की पहचान करता था। पूर्ण ImageNet के लिए मूल योजना में लगभग 50,000 सिनसेट्स में लगभग 50 मिलियन स्वच्छ, विविध और पूर्ण-रिज़ॉल्यूशन छवियां होंगी, लेकिन यह हासिल नहीं किया गया था। 30 अप्रैल, 2010 तक सारांश आँकड़ों में 21,841 गैर-खाली सिनसेट्स, 14,197,122 कुल छवियां, 1,034,908 बाउंडिंग बॉक्स एनोटेशन वाली छवियां, SIFT सुविधाओं के साथ 1,000 सिनसेट्स, और SIFT सुविधाओं के साथ 1.2 मिलियन छवियां शामिल थीं।

श्रेणियाँ

ImageNet की श्रेणियों को WordNet अवधारणाओं से फ़िल्टर किया गया था। प्रत्येक अवधारणा, क्योंकि इसमें कई समानार्थी शब्द हो सकते हैं (उदाहरण के लिए, "बिल्ली का बच्चा" और "युवा बिल्ली"), को "पर्यायवाची सेट" या "सिनसेट" कहा जाता है। WordNet 3.0 में 100,000 से अधिक सिनसेट हैं, जिनमें से अधिकांश संज्ञाएं हैं (80,000 से अधिक)। ImageNet ने इन्हें 21,841 सिनसेट्स में फ़िल्टर किया जो गणनीय संज्ञाएं हैं जिन्हें दृश्य रूप से चित्रित किया जा सकता है। WordNet 3.0 में प्रत्येक सिनसेट में एक "WordNet ID" (wnid) होता है, जो भाषण के भाग और एक ऑफसेट का संयोजन होता है। प्रत्येक wnid "n" से शुरू होता है क्योंकि ImageNet में केवल संज्ञाएं शामिल हैं; उदाहरण के लिए, "कुत्ता, घरेलू कुत्ता, कैनिस फेमिलेरिस" के लिए wnid "n02084071" है। श्रेणियां 9 स्तरों में आती हैं, स्तर 1 (जैसे "स्तनपायी") से स्तर 9 (जैसे "जर्मन शेफर्ड") तक।

छवि प्रारूप

छवियों को ऑनलाइन छवि खोज इंजन (Google, Picsearch, MSN, Yahoo, Flickr, आदि) से कई भाषाओं में समानार्थी शब्दों का उपयोग करके स्क्रैप किया गया था, जैसे "जर्मन शेफर्ड," "जर्मन पुलिस कुत्ता," "अल्साटियन," "ओवेजेरो एलेमन," और "पास्टोर टेडेस्को।" ImageNet में विभिन्न रिज़ॉल्यूशन वाली RGB प्रारूप में छवियां शामिल हैं; उदाहरण के लिए, ImageNet 2012 "मछली" श्रेणी में, रिज़ॉल्यूशन 4288 x 2848 से 75 x 56 तक हैं। मशीन लर्निंग में, इन्हें आमतौर पर एक मानक स्थिर रिज़ॉल्यूशन में पूर्व-संसाधित किया जाता है और तंत्रिका नेटवर्क द्वारा आगे की प्रक्रिया से पहले सफेद किया जाता है। उदाहरण के लिए, PyTorch में, ImageNet छवियों को पिक्सेल मानों को 0 और 1 के बीच विभाजित करके, फिर [0.485, 0.456, 0.406] घटाकर, और [0.229, 0.224, 0.225] से विभाजित करके सामान्यीकृत किया जाता है, जो ImageNet के लिए माध्य और मानक विचलन हैं।

लेबल और एनोटेशन

प्रत्येक छवि को ठीक एक wnid के साथ लेबल किया जाता है। ImageNet-1K के लिए घने SIFT सुविधाएं (कच्चे SIFT वर्णनकर्ता, मात्राबद्ध कोडवर्ड, और निर्देशांक) डाउनलोड के लिए उपलब्ध थीं, जो बैग-ऑफ़-विज़ुअल-वर्ड्स मॉडल के लिए डिज़ाइन की गई थीं। लगभग 3,000 लोकप्रिय सिनसेट्स के लिए बाउंडिंग बॉक्स उपलब्ध थे, जिनमें प्रति सिनसेट औसतन 150 छवियां थीं। इसके अतिरिक्त, कुछ छवियों में विशेषता एनोटेशन हैं, और डेटासेट का व्यापक रूप से मशीन लर्निंग अनुसंधान में उपयोग किया गया है, विशेष रूप से कृत्रिम बुद्धिमत्ता मॉडल को प्रशिक्षित करने और मूल्यांकन करने के लिए।

विरासत और प्रभाव

ImageNet का कंप्यूटर विज़न और कृत्रिम बुद्धिमत्ता के क्षेत्र पर गहरा प्रभाव पड़ा है। इसने एक मानकीकृत बेंचमार्क प्रदान किया जिसने वस्तु पहचान और वर्गीकरण में प्रगति को तेज किया। 2012 में एलेक्सनेट की सफलता ने डीप लर्निंग क्रांति को जन्म दिया, जिससे विभिन्न डोमेन में डीप लर्निंग तकनीकों को व्यापक रूप से अपनाया गया। ImageNet की पदानुक्रमित संरचना और बड़े पैमाने ने अन्य डेटासेट के विकास और ट्रांसफॉर्मर-आधारित मॉडल के डिजाइन को भी प्रभावित किया है, जो बाद में जनरेटिव एआई और बड़े भाषा मॉडल में मौलिक बन गए। डेटासेट दृश्य पहचान प्रणालियों को प्रशिक्षित करने और मूल्यांकन करने के लिए एक महत्वपूर्ण संसाधन बना हुआ है, और इसकी विरासत एआई अनुसंधान और अनुप्रयोगों को आकार देती रहती है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:computer-vision·dataset·deep-learning·image-recognition
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास