COCO (Common Objects in Context) कंप्यूटर विज़न कार्यों के लिए एक बड़े पैमाने का डेटासेट है, जो मुख्य रूप से ऑब्जेक्ट डिटेक्शन, सेगमेंटेशन और इमेज कैप्शनिंग के लिए उपयोग होता है। इसे 2014 में माइक्रोसॉफ्ट के शोधकर्ताओं द्वारा बनाया गया था, और इसे पहले के डेटासेट की सीमाओं को दूर करने के लिए डिज़ाइन किया गया था, जिसमें वस्तुओं को उनके प्राकृतिक संदर्भ में केंद्रित किया गया है, जिसमें गैर-प्रतिष्ठित छवियाँ शामिल हैं जिनमें कई वस्तुएँ और जटिल दृश्य होते हैं। डेटासेट में 330,000 से अधिक छवियाँ हैं, जिनमें से 200,000 से अधिक लेबल की गई हैं, और 80 ऑब्जेक्ट श्रेणियों में 2.5 मिलियन लेबल किए गए उदाहरण हैं। COCO विज़न कार्यों में Machine learning मॉडलों के मूल्यांकन के लिए एक मानक बेंचमार्क बन गया है, जिससे Deep learning आर्किटेक्चर और Neural network डिज़ाइन में प्रगति को सुविधाजनक बनाया गया है।
अपने पूर्ववर्तियों के विपरीत, जिनमें एकल केंद्रित वस्तुएँ होती थीं, COCO संदर्भात्मक समझ पर जोर देता है। प्रत्येक छवि में आमतौर पर कई वस्तुएँ, अंतःक्रियाएँ और विविध पृष्ठभूमियाँ होती हैं, जिससे डिटेक्शन और सेगमेंटेशन अधिक चुनौतीपूर्ण और वास्तविक दुनिया के अनुप्रयोगों के करीब हो जाता है। एनोटेशन में प्रति-उदाहरण सेगमेंटेशन मास्क, बाउंडिंग बॉक्स, और मानव मुद्राओं के लिए कीपॉइंट्स, साथ ही प्रत्येक छवि के लिए प्राकृतिक-भाषा कैप्शन शामिल हैं। यह समृद्धि इंस्टेंस सेगमेंटेशन, पैनोप्टिक सेगमेंटेशन और डेंस कैप्शनिंग जैसे कार्यों में एक साथ प्रशिक्षण और मूल्यांकन को सक्षम बनाती है।
डेटासेट संरचना और एनोटेशन
COCO डेटासेट तीन प्रमुख संस्करणों में जारी किया गया था: 2014, 2015 और 2017। 2017 संस्करण, जो सबसे अधिक उपयोग किया जाता है, में 118,000 प्रशिक्षण छवियाँ, 5,000 सत्यापन छवियाँ और 41,000 टेस्ट-डेव छवियाँ शामिल हैं। एनोटेशन में ऑब्जेक्ट इंस्टेंस (बहुभुज सेगमेंटेशन मास्क के साथ), स्टफ श्रेणियाँ (जैसे आकाश, घास), इमेज कैप्शन और व्यक्ति कीपॉइंट्स (17 शारीरिक जोड़) शामिल हैं। 80 ऑब्जेक्ट वर्ग सामान्य दैनिक वस्तुओं से प्राप्त होते हैं, जिनमें व्यक्ति, साइकिल, कार, कुत्ता, बिल्ली और फर्नीचर आइटम शामिल हैं। एनोटेशन प्रक्रिया अमेज़न मैकेनिकल टर्क के माध्यम से क्राउड-सोर्स की गई थी, जिसमें कठोर गुणवत्ता नियंत्रण था। प्रत्येक छवि को कई कार्यकर्ताओं द्वारा एनोटेट किया जाता है, और परिणामों को मिलाकर सत्यापित किया जाता है, जिससे उच्च लेबल स्थिरता सुनिश्चित होती है। प्रति छवि उदाहरणों की औसत संख्या 7.7 है, और प्रत्येक छवि में लगभग 3.5 अलग-अलग श्रेणियाँ होती हैं, जो वास्तविक दुनिया की जटिलता को दर्शाती हैं।
मूल्यांकन मेट्रिक्स
COCO ने मानक मूल्यांकन मेट्रिक्स पेश किए जो आधुनिक विज़न अनुसंधान में व्यापक रूप से उपयोग किए जाते हैं। प्राथमिक मेट्रिक IoU (इंटरसेक्शन ओवर यूनियन) थ्रेशोल्ड पर औसत प्रेसिजन (AP) है, जो 0.5 से 0.95 तक 0.05 के चरण के साथ IoU में एकत्रित होता है। यह "COCO AP" मेट्रिक सटीक स्थानीयकरण को पुरस्कृत करता है। द्वितीयक मेट्रिक्स में IoU 0.5 और 0.75 पर AP, साथ ही छोटे, मध्यम और बड़े ऑब्जेक्ट्स के लिए AP शामिल हैं ताकि स्केल मजबूती का आकलन किया जा सके। सेगमेंटेशन कार्यों के लिए, AP की गणना बॉक्स IoU के बजाय मास्क IoU का उपयोग करके की जाती है। आधिकारिक मूल्यांकन सर्वर टेस्ट-डेव और टेस्ट-चैलेंज स्प्लिट्स पर रैंकिंग प्रदान करता है, जिसने डिटेक्टर प्रदर्शन में तेजी से सुधार को प्रेरित किया है। 2015 से, COCO वार्षिक कार्यशालाओं और चुनौतियों की मेजबानी भी करता है, जो शिक्षा और उद्योग के शीर्ष अनुसंधान समूहों को आकर्षित करता है, जिनमें Carnegie Mellon University, Stanford AI Lab और BAIR (Berkeley AI Research) की टीमें शामिल हैं।
कंप्यूटर विज़न अनुसंधान पर प्रभाव
COCO ऑब्जेक्ट डिटेक्शन और सेगमेंटेशन को आगे बढ़ाने में सहायक रहा है। कई ऐतिहासिक आर्किटेक्चर COCO पर बेंचमार्क किए गए हैं, जिनमें फास्टर R-CNN (2015), मास्क R-CNN (2017) और YOLO वेरिएंट शामिल हैं। डेटासेट की जटिलता ने क्षेत्र को अधिक मजबूत मॉडलों की ओर धकेला, जिससे फीचर पिरामिड नेटवर्क, एंकर-फ्री डिटेक्टर और अटेंशन-आधारित तंत्रों के विकास को प्रोत्साहन मिला। COCO ने Transformer (architecture)-आधारित विज़न मॉडलों के उदय में भी योगदान दिया, जैसे 2020 में पेश किया गया DETR (डिटेक्शन ट्रांसफॉर्मर), जो डिटेक्शन को एक सेट भविष्यवाणी समस्या के रूप में मानता है। डेटासेट ने लाखों मॉडल पुनरावृत्तियों के लिए प्रशिक्षण और मूल्यांकन आधार के रूप में कार्य किया, जो शैक्षणिक पत्रों में सहकर्मी तुलना के लिए डी फैक्टो मानक बन गया। डिटेक्शन से परे, COCO की कैप्शनिंग एनोटेशन ने विज़न-भाषा मॉडलों में अनुसंधान को प्रेरित किया, जो बाद में Generative AI और Large language model प्रगति के साथ विकसित हुआ। कीपॉइंट्स की उपलब्धता ने पोज़ अनुमान अनुसंधान को सुविधाजनक बनाया, जिससे मानव-कंप्यूटर इंटरैक्शन और रोबोटिक्स जैसे क्षेत्रों को प्रभावित किया गया।
विस्तार और सामुदायिक संसाधन
COCO से कई व्युत्पन्न डेटासेट और उपकरण उभरे हैं। COCO-स्टफ डेटासेट (2017) 91 स्टफ वर्गों के लिए पिक्सेल-स्तरीय एनोटेशन जोड़ता है, जिससे पैनोप्टिक सेगमेंटेशन सक्षम होता है। कीपॉइंट एनोटेशन को बहु-व्यक्ति पोज़ अनुमान कार्यों के लिए विस्तारित किया गया था। COCO के प्रारूप को कई अन्य डेटासेट द्वारा अपनाया गया था, जैसे LVIS (लार्ज वोकैबुलरी इंस्टेंस सेगमेंटेशन) और ओपन इमेजेस, जिससे अंतर-संचालन को बढ़ावा मिला। COCO API, एक पायथन और MATLAB टूलबॉक्स जो एनोटेशन को लोड करने, विज़ुअलाइज़ करने और मूल्यांकन करने के लिए है, एक मानक उपयोगिता बन गया है। इसके अतिरिक्त, अन्य विज़न डोमेन में ट्रांसफर लर्निंग के लिए COCO पर प्रीट्रेनिंग आम है। 2023 के सेगमेंट एनीथिंग मॉडल (SAM) जैसे हालिया कार्यों ने प्रशिक्षण डेटा के हिस्से के रूप में COCO का उपयोग किया, जो इसकी निरंतर प्रासंगिकता को प्रदर्शित करता है। 2025 तक, COCO एक आधारशिला बेंचमार्क बना हुआ है, हालांकि अधिक श्रेणियों या उच्च छवि रिज़ॉल्यूशन वाले नए डेटासेट कभी-कभी इसे पूरक करते हैं।
सीमाएँ और आलोचनाएँ
अपनी सफलता के बावजूद, COCO की सीमाएँ हैं। 80 श्रेणियाँ सीमित हैं और पश्चिमी संदर्भों की ओर पक्षपाती हैं, जिनमें कई सांस्कृतिक रूप से विशिष्ट वस्तुओं का अभाव है। डेटासेट स्थिर है, जिसमें 2014 से एकत्रित छवियाँ हैं, और यह समकालीन दृश्यों को प्रतिबिंबित नहीं करता है। एनोटेशन त्रुटियाँ मौजूद हैं, हालांकि बहु-कार्यकर्ता सहमति के कारण वे अपेक्षाकृत कम हैं। वर्ग वितरण असंतुलित है, जो 'व्यक्ति' और 'कार' जैसी सामान्य वस्तुओं को दुर्लभ वस्तुओं पर वरीयता देता है। घने एनोटेशन की आवश्यकता श्रम लागत के कारण अधिक श्रेणियों तक स्केलिंग को महंगा बनाती है। शोधकर्ताओं ने इसे संबोधित करने के लिए सक्रिय शिक्षण और स्वचालित एनोटेशन का प्रस्ताव दिया है, लेकिन लागत अधिक बनी हुई है। इसके अतिरिक्त, COCO का मेट्रिक स्थानीयकरण सटीकता पर केंद्रित है, जो शब्दार्थ और स्थानिक त्रुटियों को मिला सकता है। इन मुद्दों के बावजूद, COCO का प्रभाव बना हुआ है, और यह अक्सर पहला बेंचमार्क है जिसका उपयोग नए आर्किटेक्चर का मूल्यांकन करने के लिए किया जाता है, जिससे तुलनात्मक परिणामों की एक सतत धारा सुनिश्चित होती है।
भविष्य की दिशाएँ
COCO के बेंचमार्क के रूप में भविष्य नए डेटासेट जैसे ऑब्जेक्ट्स365 (2019) और ओपन इमेजेस V6 (2019) के आगमन के साथ विकसित हो रहा है, जो अधिक श्रेणियाँ या छवियाँ प्रदान करते हैं। हालांकि, COCO की विरासत मूल्यांकन प्रथाओं को परिभाषित करने में इसकी भूमिका से सुरक्षित है। आधुनिक Artificial intelligence प्रणालियाँ, विशेष रूप से स्वायत्त वाहनों और संवर्धित वास्तविकता को शक्ति देने वाली, अभी भी Neural network धारणा के लिए COCO-प्रशिक्षित मॉडलों पर निर्भर हैं। डेटासेट के डिज़ाइन सिद्धांत - संदर्भात्मक वस्तुएँ, घने एनोटेशन और कठोर मेट्रिक्स - ने स्वायत्त ड्राइविंग के लिए nuScenes और LVIS चैलेंज जैसे बाद के बेंचमार्क को प्रभावित किया है। इसके अलावा, COCO की एनोटेशन पाइपलाइन ने Generative AI प्रशिक्षण सेटों के लिए डेटा संग्रह को सूचित किया है। जैसे-जैसे क्षेत्र खुले-शब्दावली डिटेक्शन और फाउंडेशन मॉडलों की ओर बढ़ता है, COCO एक महत्वपूर्ण सत्यापन सेट बना रहता है, हालांकि शोधकर्ता शून्य-शॉट सामान्यीकरण का परीक्षण करने के लिए कस्टम उपसमुच्चय का भी उपयोग करते हैं। डेटासेट का प्रतिलिपि विज्ञान में योगदान गहरा है, जो लाखों प्रयोगों के लिए एक सामान्य आधार प्रदान करता है।
यह भी देखें
श्रेणी: कंप्यूटर विज़न डेटासेट