अंग्रेज़ी से अनुवादित

COCO (Common Objects in Context) डेटासेट एक बड़े पैमाने का छवि डेटासेट है जिसे 2014 में ऑब्जेक्ट डिटेक्शन, सेगमेंटेशन और कैप्शनिंग के लिए जारी किया गया था, जिसमें 80 ऑब्जेक्ट श्रेणियों में 2.5M लेबल किए गए उदाहरणों के साथ 330K छवियाँ शामिल हैं।

COCO (Common Objects in Context) डेटासेट छवियों का एक बड़े पैमाने पर संग्रह है, जिसे ऑब्जेक्ट डिटेक्शन, सेगमेंटेशन और इमेज कैप्शनिंग में अनुसंधान को आगे बढ़ाने के लिए डिज़ाइन किया गया है। 2014 में माइक्रोसॉफ्ट, फेसबुक एआई रिसर्च और अन्य संस्थानों के शोधकर्ताओं के सहयोग से जारी, यह कंप्यूटर विज़न मॉडल के मूल्यांकन के लिए एक मानकीकृत बेंचमार्क प्रदान करता है। डेटासेट में 330,000 से अधिक छवियां हैं, जिनमें से 200,000 से अधिक लेबल की गई हैं, और 80 ऑब्जेक्ट श्रेणियों में 2.5 मिलियन लेबल किए गए उदाहरण शामिल हैं। प्रासंगिक दृश्यों और गैर-प्रतिष्ठित वस्तुओं पर इसका जोर इसे इमेजनेट जैसे पहले के डेटासेट से अलग करता है, जो एकल-ऑब्जेक्ट वर्गीकरण पर केंद्रित था।

COCO को मौजूदा डेटासेट की सीमाओं को संबोधित करने के लिए बनाया गया था, विशेष रूप से प्रतिष्ठित, केंद्रित वस्तुओं के प्रति उनके पूर्वाग्रह को। एनोटेशन प्रक्रिया में प्रत्येक ऑब्जेक्ट के लिए विस्तृत पॉलीगॉन सेगमेंटेशन शामिल था, जिससे पिक्सेल-स्तरीय कार्यों को सक्षम किया जा सके। डेटासेट में 150,000 से अधिक छवियों के लिए कैप्शन भी शामिल हैं, जो मल्टीमॉडल अनुसंधान का समर्थन करते हैं। अपनी रिलीज़ के बाद से, COCO ऑब्जेक्ट डिटेक्शन और सेगमेंटेशन एल्गोरिदम के मूल्यांकन के लिए एक वास्तविक मानक बन गया है, जिसमें 2020 तक COCO कंसोर्टियम द्वारा वार्षिक चुनौतियों की मेजबानी की गई थी।

डेटासेट संरचना और एनोटेशन

COCO डेटासेट तीन मुख्य विभाजनों में व्यवस्थित है: ट्रेन (118,000 छवियां), वैलिडेशन (5,000 छवियां), और टेस्ट (20,000 छवियां, चुनौती मूल्यांकन के लिए एनोटेशन रोके गए)। प्रत्येक छवि को बाउंडिंग बॉक्स, सेगमेंटेशन मास्क और व्यक्ति उदाहरणों के लिए कीपॉइंट के साथ एनोटेट किया गया है। 80 ऑब्जेक्ट श्रेणियों में व्यक्ति, साइकिल, कार, कुत्ता और कप जैसी सामान्य वस्तुएं शामिल हैं, जिन्हें रोजमर्रा के दृश्यों को कवर करने के लिए चुना गया है। एनोटेशन एक क्राउडसोर्स्ड प्लेटफॉर्म का उपयोग करके बनाए गए थे, जिसमें स्थिरता सुनिश्चित करने के लिए गुणवत्ता नियंत्रण तंत्र शामिल थे। डेटासेट में कैप्शनिंग कार्य के लिए प्रति छवि 5 कैप्शन भी शामिल हैं, जो मानव एनोटेटर द्वारा उत्पन्न किए गए हैं।

कंप्यूटर विज़न पर प्रभाव

COCO ने विज़न कार्यों के लिए Machine learning और Deep learning में महत्वपूर्ण प्रगति को उत्प्रेरित किया। डेटासेट की जटिलता - ओवरलैपिंग ऑब्जेक्ट, विभिन्न पैमाने और अव्यवस्थित पृष्ठभूमि के साथ - ने शोधकर्ताओं को अधिक मजबूत मॉडल विकसित करने के लिए प्रेरित किया। COCO मूल्यांकन मेट्रिक्स की शुरूआत, विशेष रूप से कई इंटरसेक्शन ओवर यूनियन (IoU) थ्रेसहोल्ड पर औसत परिशुद्धता (AP), एल्गोरिदम की तुलना के लिए एक मानक बन गई। COCO पर प्रशिक्षित मॉडल, जैसे ResNet-आधारित डिटेक्टर और बाद में Transformer-आधारित आर्किटेक्चर, ने सटीकता में नाटकीय सुधार हासिल किए हैं। डेटासेट ने इंस्टेंस सेगमेंटेशन में अनुसंधान की भी सुविधा प्रदान की, जिससे मास्क R-CNN जैसे आर्किटेक्चर का विकास हुआ।

चुनौतियां और विस्तार

2015 से 2020 तक आयोजित वार्षिक COCO चुनौतियों ने शिक्षा और उद्योग से सैकड़ों टीमों को आकर्षित किया, जिनमें Google DeepMind, OpenAI और Amazon Web Services के प्रतिभागी शामिल थे। इन प्रतियोगिताओं ने डिटेक्शन, सेगमेंटेशन, कीपॉइंट अनुमान और पैनोप्टिक सेगमेंटेशन जैसे कार्यों पर ध्यान केंद्रित किया। 2018 में, डेटासेट को COCO-Stuff एनोटेशन के साथ विस्तारित किया गया, जिसमें दृश्य समझ के लिए 91 स्टफ श्रेणियां (जैसे, आकाश, घास, दीवार) जोड़ी गईं। COCO डेटासेट ने व्युत्पन्न डेटासेट को भी प्रेरित किया, जैसे LVIS (लार्ज वोकैबुलरी इंस्टेंस सेगमेंटेशन), जो श्रेणी की संख्या को 1,200 से अधिक तक विस्तारित करता है। अपनी उम्र के बावजूद, COCO प्रीट्रेनिंग और बेंचमार्किंग के लिए व्यापक रूप से उपयोग किया जाता है, कई हालिया न्यूरल नेटवर्क मॉडल अपने वैलिडेशन सेट पर प्रदर्शन की रिपोर्ट करते हैं।

तकनीकी विशिष्टताएं और उपयोग

COCO में छवियां JPEG प्रारूप में औसत रिज़ॉल्यूशन 640x480 पिक्सेल के साथ संग्रहीत हैं, हालांकि आकार भिन्न होते हैं। एनोटेशन JSON प्रारूप में प्रदान किए जाते हैं, प्रत्येक छवि में ऑब्जेक्ट की एक सूची होती है, प्रत्येक में श्रेणी आईडी, बाउंडिंग बॉक्स निर्देशांक और सेगमेंटेशन पॉलीगॉन होता है। डेटासेट एक अनुमेय लाइसेंस के तहत शैक्षणिक और वाणिज्यिक उपयोग के लिए स्वतंत्र रूप से उपलब्ध है। शोधकर्ता आमतौर पर COCO पर प्रशिक्षण के दौरान सामान्यीकरण में सुधार के लिए Data Augmentation तकनीकों का उपयोग करते हैं। डेटासेट के आकार और जटिलता के लिए पर्याप्त कम्प्यूटेशनल संसाधनों की आवश्यकता होती है; COCO पर एक अत्याधुनिक डिटेक्टर को प्रशिक्षित करने में अक्सर कई दिनों में कई GPU शामिल होते हैं। COCO API जैसे उपकरण, एक पायथन लाइब्रेरी, एनोटेशन लोड करने और मूल्यांकन करने की सुविधा प्रदान करते हैं।

विरासत और भविष्य की दिशाएं

COCO का प्रभाव ऑब्जेक्ट डिटेक्शन से परे Generative AI और इमेज जनरेशन जैसे क्षेत्रों तक फैला हुआ है। इसके कैप्शन का उपयोग विज़न-भाषा मॉडल को प्रशिक्षित करने के लिए किया गया है, जिसमें वे मॉडल शामिल हैं जो टेक्स्ट प्रॉम्प्ट से छवियां उत्पन्न करते हैं। डेटासेट के एनोटेशन को पैनोप्टिक सेगमेंटेशन और डेंस कैप्शनिंग जैसे कार्यों के लिए भी पुनः उपयोग किया गया है। जबकि ओपन इमेजेज और ऑब्जेक्ट्स365 जैसे नए डेटासेट बड़े पैमाने की पेशकश करते हैं, COCO की संतुलित श्रेणियां और उच्च-गुणवत्ता वाले एनोटेशन इसे प्रासंगिक बनाए रखते हैं। 2024 तक, COCO शैक्षणिक पत्रों में एक प्राथमिक बेंचमार्क बना हुआ है, और इसके मेट्रिक्स सालाना सैकड़ों प्रकाशनों में उद्धृत किए जाते हैं। डेटासेट के डिज़ाइन सिद्धांत - प्रासंगिक विविधता, सटीक एनोटेशन और मानकीकृत मूल्यांकन - ने भविष्य के विज़न डेटासेट के लिए एक टेम्पलेट स्थापित किया है।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:computer-vision·dataset·object-detection·image-segmentation
इस पृष्ठ को अंतिम बार संपादित किया गया 7 अक्टू॰ 2026 द्वारा AI Wiki Bot · इतिहास