अंग्रेज़ी से अनुवादित

ImageNet-1K, ImageNet डेटाबेस का एक मानकीकृत उपसमुच्चय है, जिसमें 1,000 वस्तु श्रेणियाँ शामिल हैं, जिनका उपयोग 2010 से ImageNet Large Scale Visual Recognition Challenge (ILSVRC) में किया जा रहा है। यह गहन शिक्षण छवि वर्गीकरण मॉडल के लिए एक बेंचमार्क बन गया है।

ImageNet-1K, ImageNet दृश्य डेटाबेस का एक मानकीकृत उपसमुच्चय है, जिसमें ठीक 1,000 गैर-अतिव्यापी वस्तु वर्ग शामिल हैं। इसे ImageNet लार्ज स्केल विज़ुअल रिकग्निशन चैलेंज (ILSVRC) के लिए वर्गीकरण और स्थानीयकरण बेंचमार्क के रूप में पेश किया गया था, जो 2010 में शुरू हुआ था। यह उपसमुच्चय बड़े ImageNet डेटासेट से लिया गया था, जिसमें 20,000 से अधिक श्रेणियों में 14 मिलियन से अधिक हाथ-एनोटेटेड चित्र हैं, जिसमें गणनीय संज्ञाओं और दृश्य रूप से अलग वर्गों की एक छंटनी सूची का चयन किया गया था। ImageNet-1K मशीन लर्निंग और डीप लर्निंग में एक महत्वपूर्ण संदर्भ बिंदु बन गया, जो 2010 के दशक के दौरान तंत्रिका नेटवर्क आर्किटेक्चर और प्रशिक्षण तकनीकों में प्रगति के लिए प्राथमिक परीक्षण स्थल के रूप में कार्य करता है।

डेटासेट की छवियां तृतीय-पक्ष URL से प्राप्त होती हैं और ImageNet की स्वामित्व वाली नहीं हैं। प्रत्येक छवि पर ठीक एक वर्ग पहचानकर्ता लेबल होता है, जिसे WordNet ID (wnid) के रूप में जाना जाता है, जो WordNet शाब्दिक डेटाबेस में एक सिनसेट से मेल खाता है। श्रेणियां रोजमर्रा की वस्तुओं की एक विस्तृत श्रृंखला में फैली हुई हैं, जानवरों और पौधों से लेकर वाहनों और घरेलू सामानों तक, और इसमें सूक्ष्म भेदभाव का परीक्षण करने के लिए 120 बारीक-दाने वाली कुत्ते की नस्ल कक्षाएं शामिल हैं। ImageNet-1K छवियां अलग-अलग रिज़ॉल्यूशन के साथ RGB प्रारूप में हैं, आमतौर पर मॉडल में डालने से पहले एक निश्चित आकार में पूर्व-संसाधित और सामान्यीकृत की जाती हैं।

इतिहास और निर्माण

एआई शोधकर्ता फेई-फेई ली ने 2006 में ImageNet परियोजना की कल्पना की, जिसका उद्देश्य एआई अनुसंधान का ध्यान एल्गोरिदम से हटाकर बड़े पैमाने पर डेटा पर केंद्रित करना था। 2007 में, उन्होंने प्रिंसटन के प्रोफेसर क्रिस्टियाने फेलबाम से मुलाकात की, जो WordNet के निर्माता हैं, और WordNet की संज्ञा पदानुक्रम को रीढ़ की हड्डी के रूप में उपयोग करके डेटासेट बनाने का निर्णय लिया। यह परियोजना जुलाई 2008 में अमेज़ॅन मैकेनिकल टर्क का उपयोग करके लेबलिंग शुरू हुई, जिसमें 167 देशों के 49,000 श्रमिकों ने 160 मिलियन से अधिक उम्मीदवार छवियों को फ़िल्टर किया। लेबलिंग अप्रैल 2010 में समाप्त हुई, प्रत्येक 14 मिलियन छवियों को तीन बार सत्यापित किया गया।

मूल योजना में 40,000 श्रेणियों की कल्पना की गई थी जिनमें से प्रत्येक में 10,000 छवियां होंगी, लेकिन व्यावहारिक बाधाओं, जिसमें लगभग 2 छवियों प्रति सेकंड की मानव वर्गीकरण गति शामिल है, ने एक कम दायरे को जन्म दिया। पहली सार्वजनिक प्रस्तुति 2009 में फ्लोरिडा में कंप्यूटर विज़न और पैटर्न पहचान सम्मेलन (CVPR) में एक पोस्टर थी। 2009 में, एलेक्स बर्ग ने ऑब्जेक्ट लोकलाइज़ेशन जोड़ने का सुझाव दिया, जिससे PASCAL विज़ुअल ऑब्जेक्ट क्लासेस प्रतियोगिता के साथ सहयोग हुआ और 2010 में 1,000 वर्गों के साथ ILSVRC का शुभारंभ हुआ।

डीप लर्निंग में भूमिका

ImageNet-1K ने 30 सितंबर 2012 को प्रमुखता प्राप्त की, जब AlexNet नामक एक कन्वोल्यूशनल तंत्रिका नेटवर्क ने ImageNet 2012 चैलेंज में 15.3% की शीर्ष-5 त्रुटि हासिल की, जो उपविजेता से 10.8 प्रतिशत अंकों से बेहतर थी। यह सफलता ग्राफिक्स प्रोसेसिंग इकाइयों (GPUs) पर प्रशिक्षण द्वारा संभव हुई, जो डीप लर्निंग क्रांति का एक प्रमुख घटक है। जैसा कि द इकोनॉमिस्ट ने उल्लेख किया, इस परिणाम ने प्रौद्योगिकी उद्योग में ध्यान आकर्षित किया।

बाद के वर्षों में तेजी से प्रगति देखी गई। 2015 में, माइक्रोसॉफ्ट के 100 से अधिक परतों वाले बहुत गहरे CNN ने 3.57% त्रुटि दर के साथ ImageNet 2015 प्रतियोगिता जीती। मानव प्रदर्शन का अनुमान आंद्रेई करपाथी ने 2014 में केंद्रित प्रयास के साथ लगभग 5.1% और अधिकतम प्रयास के साथ संभावित रूप से 2.4% लगाया था, जो दर्शाता है कि मॉडल जल्द ही इस बेंचमार्क पर मानव-स्तरीय वर्गीकरण के करीब पहुंच गए या उससे अधिक हो गए। ImageNet-1K अवशिष्ट नेटवर्क आर्किटेक्चर, बैच सामान्यीकरण और डेटा संवर्धन तकनीकों जैसे नवाचारों के लिए मानक मूल्यांकन सेट बन गया।

डेटासेट संरचना

ImageNet-1K श्रेणियां WordNet 3.0 से फ़िल्टर की गई हैं, जिसमें 80,000 से अधिक संज्ञा सिनसेट हैं। चयन प्रक्रिया ने पूर्ण ImageNet के लिए 21,841 सिनसेट बनाए रखा, और ILSVRC के लिए 1,000-वर्ग उपसमुच्चय चुना गया। प्रत्येक सिनसेट में एक अद्वितीय wnid होता है, जैसे "n02084071" "कुत्ता, घरेलू कुत्ता, कैनिस फेमिलेरिस" के लिए। श्रेणियां 9 स्तरों के पदानुक्रम में व्यवस्थित हैं, व्यापक अवधारणाओं जैसे "स्तनपायी" से लेकर विशिष्ट नस्लों जैसे "जर्मन शेफर्ड" तक।

छवियों को Google, Picsearch, MSN, Yahoo और Flickr सहित ऑनलाइन खोज इंजनों से कई भाषाओं में समानार्थक शब्दों का उपयोग करके स्क्रैप किया गया था। उदाहरण के लिए, जर्मन शेफर्ड श्रेणी ने "Alsatian" और "pastore tedesco" जैसे क्वेरी का उपयोग किया। रिज़ॉल्यूशन व्यापक रूप से भिन्न होते हैं, मछली श्रेणी में 4288 x 2848 से 75 x 56 पिक्सेल तक। व्यवहार में, छवियों को एक स्थिर रिज़ॉल्यूशन में आकार दिया जाता है और सफ़ेद किया जाता है; उदाहरण के लिए, PyTorch पिक्सेल मानों को [0,1] में विभाजित करके, माध्य [0.485, 0.456, 0.406] घटाकर, और मानक विचलन [0.229, 0.224, 0.225] से विभाजित करके सामान्यीकृत करता है।

एनोटेशन और उपयोग

प्रत्येक ImageNet-1K छवि पर एक एकल वर्ग लेबल होता है। पूर्ण ImageNet लगभग 3,000 लोकप्रिय सिनसेट में लगभग 1 मिलियन छवियों के लिए बाउंडिंग बॉक्स एनोटेशन भी प्रदान करता है, जिससे ऑब्जेक्ट लोकलाइज़ेशन कार्य सक्षम होते हैं। डेंस SIFT सुविधाओं को 1,000-वर्ग उपसमुच्चय के लिए जारी किया गया था, जो बैग-ऑफ-विज़ुअल-शब्द दृष्टिकोण के लिए डिज़ाइन किया गया था, हालांकि डीप लर्निंग के उदय के साथ ये कम आम हो गए।

2010 की सारांश के अनुसार, ImageNet में 21,841 गैर-खाली सिनसेट, 14,197,122 छवियां और 1,034,908 बाउंडिंग बॉक्स वाली छवियां थीं। डेटासेट के एनोटेशन स्वतंत्र रूप से उपलब्ध हैं, लेकिन छवियां स्वयं ImageNet की स्वामित्व वाली नहीं हैं। ImageNet-1K अभी भी कृत्रिम बुद्धिमत्ता में प्रीट्रेनिंग और बेंचमार्किंग के लिए व्यापक रूप से उपयोग किया जाता है, बड़े डेटासेट और वैकल्पिक बेंचमार्क के उद्भव के बावजूद।

विरासत और प्रभाव

ImageNet-1K पर AlexNet की सफलता ने डीप लर्निंग बूम को उत्प्रेरित किया, जिसने कंप्यूटर विज़न से परे क्षेत्रों को प्रभावित किया, जिसमें प्राकृतिक भाषा प्रसंस्करण और बड़े भाषा मॉडल विकास शामिल हैं। बेंचमार्क के स्पष्ट मेट्रिक्स और बड़े पैमाने ने इसे मॉडल आर्किटेक्चर, प्रशिक्षण विधियों और हार्डवेयर दक्षता की तुलना करने के लिए एक मानक बना दिया। हालांकि, एनोटेशन शोर और डेटासेट की स्थिर प्रकृति के बारे में चिंताओं ने आलोचनाओं को जन्म दिया है, और कुछ शोधकर्ताओं ने नए बेंचमार्क प्रस्तावित किए हैं। फिर भी, ImageNet-1K मशीन लर्निंग अनुसंधान और शिक्षा में एक मौलिक संसाधन बना हुआ है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:computer-vision·dataset·deep-learning·benchmark
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास