इमेजनेट लार्ज स्केल विज़ुअल रिकग्निशन चैलेंज (ILSVRC)

अंग्रेज़ी से अनुवादित

इमेजनेट लार्ज स्केल विज़ुअल रिकग्निशन चैलेंज (ILSVRC) एक वार्षिक प्रतियोगिता थी (2010-2017) जिसमें सॉफ्टवेयर प्रोग्राम छवियों में वस्तुओं को वर्गीकृत और पहचानने के लिए प्रतिस्पर्धा करते थे, जिससे गहन शिक्षण (deep learning) और कंप्यूटर विज़न में महत्वपूर्ण प्रगति हुई।

इमेजनेट लार्ज स्केल विज़ुअल रिकग्निशन चैलेंज (ILSVRC) एक वार्षिक सॉफ्टवेयर प्रतियोगिता थी जो 2010 से 2017 तक इमेजनेट परियोजना के भाग के रूप में आयोजित की गई थी। इसने एल्गोरिदम को 1,000 गैर-अतिव्यापी वस्तु वर्गों के एक चयनित सेट के भीतर वस्तुओं और दृश्यों को सही ढंग से वर्गीकृत और पहचानने का कार्य सौंपा। इस चैलेंज को व्यापक रूप से कंप्यूटर विज़न में डीप लर्निंग क्रांति को उत्प्रेरित करने का श्रेय दिया जाता है, विशेष रूप से 2012 के बाद जब एक कन्वोल्यूशनल न्यूरल नेटवर्क ने सटीकता में नाटकीय सुधार हासिल किया।

यह प्रतियोगिता इमेजनेट परियोजना से विकसित हुई, जो दृश्य वस्तु पहचान अनुसंधान के लिए डिज़ाइन किया गया एक बड़ा दृश्य डेटाबेस है। एआई शोधकर्ता फेई-फेई ली द्वारा शुरू किए गए इमेजनेट में 20,000 से अधिक श्रेणियों में फैली 14 मिलियन से अधिक हाथ से एनोटेट की गई छवियां शामिल हैं, जिनमें से कम से कम एक मिलियन छवियों में बाउंडिंग बॉक्स एनोटेशन भी उपलब्ध हैं। ILSVRC ने कंप्यूटर विज़न एल्गोरिदम के मूल्यांकन और तुलना के लिए एक मानकीकृत बेंचमार्क प्रदान करने के लिए इन छवियों और श्रेणियों के एक उपसमुच्चय का उपयोग किया।

इतिहास

फेई-फेई ली ने 2006 में इमेजनेट की अवधारणा शुरू की, जिसका उद्देश्य एआई एल्गोरिदम को प्रशिक्षित करने के लिए उपलब्ध डेटा का विस्तार करना था, ऐसे समय में जब अधिकांश शोध मॉडल और एल्गोरिदम पर केंद्रित थे। 2007 में, उन्होंने प्रिंसटन की प्रोफेसर क्रिस्टियाने फेलबाम से मुलाकात की, जो वर्डनेट की निर्माता हैं, जिसके कारण वर्डनेट के लगभग 22,000 संज्ञाओं के आधार पर इमेजनेट का निर्माण हुआ। ली 1987 के एक अनुमान से भी प्रेरित थीं कि औसत व्यक्ति लगभग 30,000 विभिन्न प्रकार की वस्तुओं को पहचानता है।

प्रिंसटन में सहायक प्रोफेसर के रूप में, ली ने एक टीम इकट्ठी की और छवि वर्गीकरण के लिए अमेज़न मैकेनिकल टर्क का उपयोग किया। लेबलिंग जुलाई 2008 से अप्रैल 2010 तक चली, जिसमें 167 देशों के 49,000 श्रमिकों ने 160 मिलियन से अधिक उम्मीदवार छवियों को फ़िल्टर और लेबल किया। प्रत्येक 14 मिलियन छवियों को तीन बार लेबल किया गया था। मूल योजना में 40,000 श्रेणियों में प्रति श्रेणी 10,000 छवियों की आवश्यकता थी, लेकिन यह अव्यावहारिक साबित हुई; मनुष्य अधिकतम 2 छवियों प्रति सेकंड वर्गीकृत कर सकते हैं, जिसके लिए अनुमानित 19 मानव-वर्षों के श्रम की आवश्यकता होती।

डेटाबेस को पहली बार 2009 में फ्लोरिडा में कंप्यूटर विज़न और पैटर्न रिकग्निशन सम्मेलन (CVPR) में एक पोस्टर के रूप में प्रस्तुत किया गया था, जिसका शीर्षक था "इमेजनेट: ए प्रीव्यू ऑफ़ अ लार्ज-स्केल हायरार्किकल डेटासेट।" 2009 में, एलेक्स बर्ग ने ऑब्जेक्ट लोकलाइज़ेशन को एक कार्य के रूप में जोड़ने का सुझाव दिया, जिससे PASCAL विज़ुअल ऑब्जेक्ट क्लासेस प्रतियोगिता के साथ सहयोग हुआ। पहला ILSVRC 2010 में आयोजित किया गया था, जिसमें 1,000 वर्ग और ऑब्जेक्ट लोकलाइज़ेशन शामिल थे, जबकि PASCAL VOC के 20 वर्ग और 19,737 छवियां थीं।

डीप लर्निंग के लिए महत्व

30 सितंबर 2012 को, एलेक्सनेट नामक एक कन्वोल्यूशनल न्यूरल नेटवर्क (CNN) ने इमेजनेट 2012 चैलेंज में 15.3% की शीर्ष-5 त्रुटि हासिल की, जो उपविजेता से 10.8 प्रतिशत अंक से अधिक कम थी। यह सफलता प्रशिक्षण के दौरान ग्राफिक्स प्रोसेसिंग यूनिट (GPU) के उपयोग से संभव हुई, जो डीप लर्निंग क्रांति का एक आवश्यक घटक है। द इकोनॉमिस्ट के अनुसार, "अचानक लोगों ने ध्यान देना शुरू कर दिया, न केवल एआई समुदाय के भीतर बल्कि पूरे प्रौद्योगिकी उद्योग में।"

2015 में, एलेक्सनेट को माइक्रोसॉफ्ट के 100 से अधिक परतों वाले बहुत गहरे CNN ने पीछे छोड़ दिया, जिसने परीक्षण सेट पर 3.57% त्रुटि के साथ इमेजनेट 2015 प्रतियोगिता जीती। आंद्रेज करपाथी ने 2014 में अनुमान लगाया कि केंद्रित प्रयास से, वह 5.1% त्रुटि दर तक पहुंच सकते हैं, और उनकी प्रयोगशाला के लगभग 10 लोग कम प्रयास में लगभग 12-13% तक पहुंच गए। यह अनुमान लगाया गया था कि अधिकतम प्रयास से, एक मानव 2.4% त्रुटि प्राप्त कर सकता है।

चैलेंज का प्रभाव कंप्यूटर विज़न से परे फैला, जिसने न्यूरल नेटवर्क आर्किटेक्चर, प्रशिक्षण तकनीकों और हार्डवेयर त्वरण में नवाचारों को बढ़ावा दिया। इसने मशीन लर्निंग फ्रेमवर्क और कृत्रिम बुद्धिमत्ता के व्यापक क्षेत्र के विकास को भी प्रभावित किया।

डेटासेट

इमेजनेट अपनी एनोटेशन प्रक्रिया को क्राउडसोर्स करता है। छवि-स्तरीय एनोटेशन एक छवि में किसी वस्तु वर्ग की उपस्थिति या अनुपस्थिति को दर्शाते हैं, जबकि ऑब्जेक्ट-स्तरीय एनोटेशन वस्तु के दृश्य भाग के चारों ओर एक बाउंडिंग बॉक्स प्रदान करते हैं। इमेजनेट वस्तुओं को वर्गीकृत करने के लिए वर्डनेट स्कीमा के एक प्रकार का उपयोग करता है, जिसमें बारीक वर्गीकरण के लिए कुत्तों की नस्लों की 120 श्रेणियां जोड़ी गई हैं।

2012 में, इमेजनेट मैकेनिकल टर्क का दुनिया का सबसे बड़ा शैक्षणिक उपयोगकर्ता था, जिसमें औसत कार्यकर्ता प्रति मिनट 50 छवियों की पहचान करता था। पूर्ण इमेजनेट की मूल योजना में लगभग 50,000 सिनसेट में लगभग 50 मिलियन स्वच्छ, विविध और पूर्ण-रिज़ॉल्यूशन छवियां होंगी, लेकिन यह हासिल नहीं किया गया।

30 अप्रैल, 2010 तक, सारांश आँकड़े थे:

  • गैर-रिक्त सिनसेट की कुल संख्या: 21,841
  • छवियों की कुल संख्या: 14,197,122
  • बाउंडिंग बॉक्स एनोटेशन वाली छवियों की संख्या: 1,034,908
  • SIFT सुविधाओं वाले सिनसेट की संख्या: 1,000
  • SIFT सुविधाओं वाली छवियों की संख्या: 1.2 मिलियन

श्रेणियाँ

इमेजनेट की श्रेणियां वर्डनेट अवधारणाओं से फ़िल्टर की गई थीं। प्रत्येक अवधारणा, जिसमें कई समानार्थी शब्द शामिल हो सकते हैं (जैसे, "बिल्ली" और "युवा बिल्ली"), को "समानार्थी सेट" या "सिनसेट" कहा जाता है। वर्डनेट 3.0 में 100,000 से अधिक सिनसेट हैं, जिनमें से अधिकांश संज्ञाएं हैं (80,000+)। इमेजनेट ने इन्हें 21,841 सिनसेट तक फ़िल्टर किया जो गणनीय संज्ञाएं हैं जिन्हें दृश्य रूप से चित्रित किया जा सकता है।

वर्डनेट 3.0 में प्रत्येक सिनसेट में एक "वर्डनेट आईडी" (wnid) होता है, जो भाषण के भाग और एक ऑफसेट का संयोजन होता है। प्रत्येक wnid "n" से शुरू होता है क्योंकि इमेजनेट में केवल संज्ञाएं शामिल हैं। उदाहरण के लिए, सिनसेट "कुत्ता, घरेलू कुत्ता, कैनिस फैमिलियारिस" का wnid "n02084071" है। श्रेणियां 9 स्तरों में आती हैं, स्तर 1 (जैसे "स्तनपायी") से स्तर 9 (जैसे "जर्मन शेफर्ड") तक।

छवि प्रारूप

छवियों को कई भाषाओं में समानार्थी शब्दों का उपयोग करके ऑनलाइन छवि खोज इंजन (गूगल, पिकसर्च, एमएसएन, याहू, फ़्लिकर, आदि) से स्क्रैप किया गया था। उदाहरण के लिए, जर्मन शेफर्ड के लिए, उन्होंने "जर्मन पुलिस कुत्ता," "अल्सेशियन," "ओवेजेरो एलेमन," "पास्टोर टेडेस्को," और "德国牧羊犬" जैसे शब्दों का उपयोग किया।

इमेजनेट में अलग-अलग रिज़ॉल्यूशन के साथ आरजीबी प्रारूप में छवियां शामिल हैं। उदाहरण के लिए, इमेजनेट 2012 "मछली" श्रेणी में, रिज़ॉल्यूशन 4288 x 2848 से 75 x 56 तक हैं। मशीन लर्निंग में, इन्हें आमतौर पर एक मानक स्थिर रिज़ॉल्यूशन में पूर्व-संसाधित किया जाता है और न्यूरल नेटवर्क द्वारा आगे की प्रक्रिया से पहले सफेद किया जाता है। उदाहरण के लिए, पायटॉर्च में, इमेजनेट छवियों को पिक्सेल मानों को 0 और 1 के बीच विभाजित करके, फिर [0.485, 0.456, 0.406] घटाकर, और [0.229, 0.224, 0.225] से विभाजित करके सामान्यीकृत किया जाता है, जो इमेजनेट के लिए माध्य और मानक विचलन हैं।

लेबल और एनोटेशन

प्रत्येक छवि को ठीक एक wnid के साथ लेबल किया जाता है। इमेजनेट-1K के लिए घने SIFT सुविधाएं (कच्चे SIFT डिस्क्रिप्टर, परिमाणित कोडवर्ड और निर्देशांक) डाउनलोड के लिए उपलब्ध थीं, जो दृश्य शब्दों के बैग के लिए डिज़ाइन की गई थीं। वस्तुओं के बाउंडिंग बॉक्स लगभग 3,000 लोकप्रिय सिनसेट के लिए उपलब्ध थे, जिनमें प्रति सिनसेट औसतन 150 छवियां थीं। इसके अतिरिक्त, कुछ छवियों में विशेषता एनोटेशन हैं, हालांकि चैलेंज मुख्य रूप से वर्गीकरण और लोकलाइज़ेशन कार्यों पर केंद्रित था।

ILSVRC 2017 में समाप्त हुआ, लेकिन इसकी विरासत इमेजनेट डेटासेट के रूप में बनी हुई है, जो कंप्यूटर विज़न मॉडल के मूल्यांकन के लिए एक मानक बेंचमार्क बना हुआ है। प्रतियोगिता का बड़े पैमाने पर, वास्तविक दुनिया के डेटा और कठोर मूल्यांकन पर जोर देने से क्षेत्र में तेजी से प्रगति हुई, जिसने जनरेटिव एआई और मशीन लर्निंग के अन्य क्षेत्रों में बाद के विकास को प्रभावित किया।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:computer-vision·deep-learning·competition·dataset
इस पृष्ठ को अंतिम बार संपादित किया गया 9 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास