अंग्रेज़ी से अनुवादित

ImageNet-21K是完整的ImageNet数据集,包含超过21,000个视觉类别(同义词集)和1400万张人工标注图像,用于机器学习中视觉物体识别模型的训练和评估。

ImageNet-21K पूर्ण ImageNet डेटासेट को संदर्भित करता है, जो दृश्य वस्तु पहचान सॉफ्टवेयर अनुसंधान के लिए डिज़ाइन किया गया एक बड़ा दृश्य डेटाबेस है। इसमें 21,000 से अधिक श्रेणियों में व्यवस्थित 14 मिलियन से अधिक हाथ से एनोटेट की गई छवियाँ शामिल हैं, जिन्हें WordNet शाब्दिक डेटाबेस से प्राप्त सिनसेट के रूप में जाना जाता है। डेटासेट तृतीय-पक्ष छवि URL के एनोटेशन के रूप में स्वतंत्र रूप से उपलब्ध है, हालाँकि वास्तविक छवियाँ ImageNet के स्वामित्व में नहीं हैं। 2010 से, ImageNet ने एक वार्षिक प्रतियोगिता, ImageNet Large Scale Visual Recognition Challenge (ILSVRC) की मेजबानी की है, जो 1,000 गैर-अतिव्यापी वर्गों के एक छोटे उपसमुच्चय का उपयोग करती है, जिसे आमतौर पर ImageNet-1K कहा जाता है।

इतिहास

AI शोधकर्ता फेई-फेई ली ने 2006 में ImageNet के विचार को विकसित करना शुरू किया, जिसका उद्देश्य AI एल्गोरिदम को प्रशिक्षित करने के लिए उपलब्ध डेटा का विस्तार करना था। 2007 में, उनकी मुलाकात प्रिंसटन की प्रोफेसर क्रिस्टियाने फेलबाउम से हुई, जो WordNet की निर्माता हैं, और बाद में उन्होंने WordNet के लगभग 22,000 संज्ञाओं से शुरू करके ImageNet का निर्माण किया। ली एक 1987 के अनुमान से भी प्रेरित थीं कि औसत व्यक्ति लगभग 30,000 प्रकार की वस्तुओं को पहचानता है।

प्रिंसटन में सहायक प्रोफेसर के रूप में, ली ने एक टीम इकट्ठी की और छवि वर्गीकरण के लिए Amazon Mechanical Turk का उपयोग किया। लेबलिंग जुलाई 2008 में शुरू हुई और अप्रैल 2010 में समाप्त हुई, जिसमें 167 देशों के 49,000 श्रमिकों ने 160 मिलियन से अधिक उम्मीदवार छवियों को फ़िल्टर और लेबल किया। प्रत्येक 14 मिलियन छवियों को तीन बार लेबल किया गया था। मूल योजना में 40,000 श्रेणियों में प्रति श्रेणी 10,000 छवियाँ, कुल 400 मिलियन छवियाँ शामिल थीं, लेकिन यह हासिल नहीं हो सका। पहली सार्वजनिक प्रस्तुति फ्लोरिडा में 2009 के कंप्यूटर विज़न और पैटर्न पहचान सम्मेलन (CVPR) में एक पोस्टर थी।

2009 में, एलेक्स बर्ग ने ऑब्जेक्ट लोकलाइज़ेशन जोड़ने का सुझाव दिया, जिससे PASCAL विज़ुअल ऑब्जेक्ट क्लासेस प्रतियोगिता के साथ सहयोग हुआ और 2010 में ILSVRC का शुभारंभ हुआ, जिसमें 1,000 वर्ग और ऑब्जेक्ट लोकलाइज़ेशन शामिल थे, जबकि PASCAL VOC में 20 वर्ग थे।

डीप लर्निंग के लिए महत्व

30 सितंबर 2012 को, AlexNet नामक एक कन्वोल्यूशनल न्यूरल नेटवर्क (CNN) ने ImageNet 2012 चैलेंज में 15.3% की टॉप-5 त्रुटि हासिल की, जो उपविजेता से 10.8 प्रतिशत अंक से अधिक कम थी। यह सफलता प्रशिक्षण के दौरान ग्राफिक्स प्रोसेसिंग यूनिट (GPU) के उपयोग से संभव हुई, जो Deep learning क्रांति में एक प्रमुख कारक था। द इकोनॉमिस्ट के अनुसार, "अचानक लोगों ने ध्यान देना शुरू कर दिया, न केवल AI समुदाय के भीतर बल्कि पूरे प्रौद्योगिकी उद्योग में।"

2015 में, AlexNet को माइक्रोसॉफ्ट के 100 से अधिक परतों वाले बहुत गहरे CNN ने पीछे छोड़ दिया, जिसने 3.57% त्रुटि दर के साथ ImageNet 2015 प्रतियोगिता जीती। आंद्रेज कारपाथी ने 2014 में अनुमान लगाया कि केंद्रित प्रयास से वह 5.1% त्रुटि तक पहुँच सकते हैं, और उनकी प्रयोगशाला के लगभग 10 लोग कम प्रयास से लगभग 12-13% तक पहुँचे। यह अनुमान लगाया गया था कि अधिकतम प्रयास से, एक मानव 2.4% त्रुटि प्राप्त कर सकता है।

डेटासेट

ImageNet अपनी एनोटेशन प्रक्रिया को क्राउडसोर्स करता है। छवि-स्तरीय एनोटेशन किसी ऑब्जेक्ट वर्ग की उपस्थिति या अनुपस्थिति को इंगित करते हैं, जबकि ऑब्जेक्ट-स्तरीय एनोटेशन दृश्यमान वस्तुओं के चारों ओर बाउंडिंग बॉक्स प्रदान करते हैं। डेटासेट WordNet स्कीमा के एक प्रकार का उपयोग करता है, जिसमें बारीक-दानेदार वर्गीकरण के लिए 120 कुत्ते की नस्ल श्रेणियाँ जोड़ी गई हैं। 2012 में, ImageNet Mechanical Turk का दुनिया का सबसे बड़ा शैक्षणिक उपयोगकर्ता था, जिसमें श्रमिक प्रति मिनट औसतन 50 छवियों की पहचान करते थे।

30 अप्रैल 2010 तक, डेटासेट में 21,841 गैर-रिक्त सिनसेट, 14,197,122 छवियाँ, 1,034,908 बाउंडिंग बॉक्स एनोटेशन वाली छवियाँ, और 1.2 मिलियन SIFT सुविधाओं वाली छवियाँ (1,000 सिनसेट के लिए) थीं।

श्रेणियाँ

श्रेणियों को WordNet अवधारणाओं से फ़िल्टर किया गया था, जिनमें से प्रत्येक को "सिनसेट" (पर्यायवाची सेट) कहा जाता है। WordNet 3.0 में 100,000 से अधिक सिनसेट हैं, जिनमें से अधिकांश संज्ञाएँ (80,000+) हैं, और ImageNet ने इन्हें 21,841 गणनीय संज्ञाओं तक फ़िल्टर किया जिन्हें दृश्य रूप से चित्रित किया जा सकता है। प्रत्येक सिनसेट में एक WordNet ID (wnid) होता है, जो "n" से शुरू होता है क्योंकि केवल संज्ञाएँ शामिल हैं; उदाहरण के लिए, "कुत्ता, घरेलू कुत्ता, Canis familiaris" के लिए wnid "n02084071" है। श्रेणियाँ 9 स्तरों तक फैली हुई हैं, स्तर 1 (जैसे, "स्तनपायी") से स्तर 9 (जैसे, "जर्मन शेफर्ड") तक।

छवि प्रारूप

छवियों को कई भाषाओं में पर्यायवाची शब्दों का उपयोग करके ऑनलाइन खोज इंजनों (Google, Picsearch, MSN, Yahoo, Flickr) से स्क्रैप किया गया था। वे RGB प्रारूप में हैं और विभिन्न रिज़ॉल्यूशन के साथ हैं; उदाहरण के लिए, 2012 संस्करण में, "मछली" श्रेणी 4288 x 2848 से 75 x 56 पिक्सेल तक है। Machine learning में, छवियों को आमतौर पर एक स्थिर रिज़ॉल्यूशन पर पूर्व-संसाधित और सफ़ेद किया जाता है। PyTorch में, ImageNet छवियों को पिक्सेल मानों को [0,1] में विभाजित करके, [0.485, 0.456, 0.406] घटाकर, और [0.229, 0.224, 0.225] से विभाजित करके सामान्यीकृत किया जाता है, जो डेटासेट के माध्य और मानक विचलन हैं।

लेबल और एनोटेशन

प्रत्येक छवि को ठीक एक wnid के साथ लेबल किया जाता है। डेंस SIFT सुविधाएँ (कच्चे डिस्क्रिप्टर, परिमाणित कोडवर्ड, और निर्देशांक) ImageNet-1K के लिए उपलब्ध हैं, जो बैग-ऑफ-विज़ुअल-वर्ड्स मॉडल के लिए डिज़ाइन की गई हैं। बाउंडिंग बॉक्स लगभग 3,000 लोकप्रिय सिनसेट के लिए उपलब्ध हैं, जिनमें प्रति सिनसेट औसतन 150 छवियाँ हैं। कुछ छवियों में विशेषता एनोटेशन भी हैं।

प्रभाव और विरासत

ImageNet-21K Artificial intelligence और Computer vision अनुसंधान को आगे बढ़ाने में सहायक रहा है। ILSVRC चैलेंज, विशेष रूप से 2012 का AlexNet परिणाम, ने Neural network और Deep learning विधियों के व्यापक रूप से अपनाने को उत्प्रेरित किया। डेटासेट का पैमाना और पदानुक्रमित संरचना ने बड़े मॉडलों के प्रशिक्षण को सक्षम किया है, जिसने Generative AI और अन्य क्षेत्रों में बाद के विकास को प्रभावित किया है। हालाँकि बेंचमार्किंग के लिए पूर्ण 21K डेटासेट का उपयोग 1K उपसमुच्चय की तुलना में कम आम है, यह प्रीट्रेनिंग और बारीक-दानेदार वर्गीकरण पर अनुसंधान के लिए एक मूल्यवान संसाधन बना हुआ है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:computer-vision·dataset·deep-learning·machine-learning
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास