COCO डिटेक्शन कंप्यूटर विज़न में एक बेंचमार्क कार्य है जो ऑब्जेक्ट डिटेक्शन मॉडल की किसी छवि के भीतर वस्तुओं को पहचानने और स्थानीयकृत करने की क्षमता का मूल्यांकन करता है। यह कार्य कॉमन ऑब्जेक्ट्स इन कॉन्टेक्स्ट (COCO) डेटासेट द्वारा परिभाषित किया गया है, जिसमें 200,000 से अधिक छवियाँ हैं जिनमें 1.5 मिलियन से अधिक ऑब्जेक्ट इंस्टेंस बाउंडिंग बॉक्स और श्रेणी लेबल के साथ एनोटेट किए गए हैं। डिटेक्शन कार्य विशेष रूप से एक मॉडल से आवश्यकता करता है कि वह छवि में मौजूद 80 परिभाषित श्रेणियों के प्रत्येक ऑब्जेक्ट इंस्टेंस के लिए एक बाउंडिंग बॉक्स और एक क्लास लेबल आउटपुट करे। यह ऑब्जेक्ट डिटेक्शन में प्रगति मापने के लिए सबसे व्यापक रूप से उपयोग किए जाने वाले बेंचमार्क में से एक है, साथ ही इंस्टेंस सेगमेंटेशन और कीपॉइंट डिटेक्शन जैसे कार्यों के साथ जो समान अंतर्निहित डेटासेट का उपयोग करते हैं।
बेंचमार्क का मूल्यांकन मीट्रिक माध्य औसत परिशुद्धता (mAP) है, जिसे कई इंटरसेक्शन-ओवर-यूनियन (IoU) थ्रेसहोल्ड पर गणना की जाती है। प्राथमिक मीट्रिक, जिसे अक्सर mAP@[0.5:0.95] के रूप में दर्शाया जाता है, 0.5 से 0.95 तक IoU थ्रेसहोल्ड पर 0.05 के चरणों में परिशुद्धता का औसत लेता है। यह सख्त मीट्रिक सटीक स्थानीयकरण को पुरस्कृत करता है, न कि केवल मोटे डिटेक्शन को। COCO डिटेक्शन चैलेंज 2015 में इसकी शुरुआत के बाद से गहन शिक्षण-आधारित डिटेक्शन आर्किटेक्चर में नवाचार का एक केंद्रीय चालक रहा है, जिसमें लीडरबोर्ड प्रारंभिक कन्वोल्यूशनल मॉडल से आधुनिक ट्रांसफॉर्मर-आधारित डिटेक्टरों तक तेजी से सुधार को ट्रैक करते हैं।
डेटासेट और एनोटेशन
COCO डेटासेट पहली बार 2014 में माइक्रोसॉफ्ट रिसर्च की एक टीम द्वारा जारी किया गया था, जिसका नेतृत्व त्सुंग-यी लिन और अन्य ने किया था। इसे PASCAL VOC जैसे पहले के डेटासेट की सीमाओं को संबोधित करने के लिए डिज़ाइन किया गया था, जिसमें प्रति छवि अधिक वस्तुएँ, छोटी वस्तुएँ, और प्रासंगिक संबंधों के साथ अधिक जटिल दृश्य शामिल थे। 80 ऑब्जेक्ट श्रेणियाँ व्यक्ति, साइकिल, कार, कुत्ता, और कप जैसी रोज़मर्रा की वस्तुओं के साथ-साथ ट्रैफिक लाइट, फायर हाइड्रेंट, और स्नोबोर्ड जैसी अधिक विशिष्ट कक्षाओं को कवर करती हैं। एनोटेशन अक्ष-संरेखित बाउंडिंग बॉक्स के रूप में प्रदान किए जाते हैं, जिसमें प्रत्येक बॉक्स को उसके ऊपरी-बाएँ कोने के निर्देशांक, चौड़ाई, और ऊँचाई द्वारा परिभाषित किया जाता है। डेटासेट को ट्रेन (लगभग 118,000 छवियाँ), वैलिडेशन (5,000 छवियाँ), और टेस्ट सेट में विभाजित किया गया है, जिसमें टेस्ट सेट एनोटेशन चैलेंज मूल्यांकन के लिए वापस रखे गए हैं।
डिटेक्शन मॉडल का विकास
COCO डिटेक्शन पर प्रारंभिक अत्याधुनिक दृष्टिकोण दो-चरणीय डिटेक्टरों पर निर्भर थे, विशेष रूप से 2015 में शाओकिंग रेन, कैमिंग हे, और सहयोगियों द्वारा पेश किए गए फास्टर R-CNN परिवार पर। ये मॉडल पहले एक क्षेत्र प्रस्ताव नेटवर्क का उपयोग करके उम्मीदवार क्षेत्रों का प्रस्ताव करते हैं, फिर प्रत्येक प्रस्ताव को वर्गीकृत और परिष्कृत करते हैं। 2015 में ResNet आर्किटेक्चर की शुरुआत ने एक बैकबोन प्रदान किया जिसने फीचर निष्कर्षण में काफी सुधार किया, 2017 तक COCO mAP को लगभग 21% से बढ़ाकर 37% से अधिक कर दिया। YOLO और SSD जैसे एक-चरणीय डिटेक्टरों ने गति लाभ की पेशकश की लेकिन शुरू में सटीकता में पीछे रहे। 2017 में फीचर पिरामिड नेटवर्क (FPN) को अपनाने से बहु-पैमाने फीचर फ्यूजन की अनुमति मिली, जिससे अंतर कम हुआ। 2018 तक, फास्टर R-CNN का एक विस्तार, Mask R-CNN जैसे मॉडल ने इंस्टेंस सेगमेंटेशन करते हुए 39% से अधिक mAP हासिल किया।
ट्रांसफॉर्मर-आधारित डिटेक्टर
2020 में मेटा AI (तब फेसबुक AI रिसर्च) की एक टीम द्वारा डिटेक्शन ट्रांसफॉर्मर (DETR) की शुरुआत के साथ एक बड़ा बदलाव आया। DETR ने ऑब्जेक्ट डिटेक्शन को एक सेट भविष्यवाणी समस्या के रूप में पुनः तैयार किया, जिसमें ट्रांसफॉर्मर एनकोडर-डिकोडर आर्किटेक्चर और एक द्विपक्षीय मिलान हानि का उपयोग करके सीधे एक निश्चित संख्या में भविष्यवाणियाँ आउटपुट की गईं। इसने एंकर बॉक्स और गैर-अधिकतम दमन जैसे हस्त-निर्मित घटकों की आवश्यकता को समाप्त कर दिया। हालाँकि DETR शुरू में धीमी अभिसरण था, बाद के वेरिएंट जैसे कि डिफॉर्मेबल DETR (2021) ने प्रशिक्षण दक्षता और सटीकता में सुधार किया। 2023 तक, DINO और RT-DETR जैसे ट्रांसफॉर्मर-आधारित डिटेक्टरों ने COCO बेंचमार्क पर कन्वोल्यूशनल समकक्षों को लगातार पीछे छोड़ दिया, टेस्ट-डेव सेट पर 50% से अधिक mAP मान प्राप्त किए। ये मॉडल वैश्विक संदर्भ को पकड़ने के लिए मल्टी-हेड अटेंशन तंत्र का लाभ उठाते हैं, जो विशेष रूप से छोटी और अस्पष्ट वस्तुओं का पता लगाने के लिए फायदेमंद है।
प्रशिक्षण और डेटा ऑगमेंटेशन
COCO डिटेक्शन पर उच्च प्रदर्शन प्राप्त करने के लिए सावधानीपूर्वक प्रशिक्षण रणनीतियों की आवश्यकता होती है। मानक अभ्यास में ImageNet पर पूर्व-प्रशिक्षित वजन के साथ बैकबोन को आरंभ करना, फिर COCO पर फाइन-ट्यूनिंग करना शामिल है। डेटा ऑगमेंटेशन एक महत्वपूर्ण भूमिका निभाता है; सामान्य तकनीकों में यादृच्छिक क्षैतिज फ़्लिपिंग, यादृच्छिक स्केलिंग, और रंग जिटर शामिल हैं। YOLOv4 द्वारा लोकप्रिय किए गए Mosaic और MixUp जैसे अधिक उन्नत तरीके, मजबूती में सुधार के लिए कई छवियों को जोड़ते हैं। प्रशिक्षण आमतौर पर Adam या SGD ऑप्टिमाइज़र का उपयोग लर्निंग रेट शेड्यूल के साथ करता है जिसमें वार्मअप और कोसाइन डिके शामिल हैं। बैच नॉर्मलाइज़ेशन कन्वोल्यूशनल बैकबोन में मानक है, जबकि लेयर नॉर्मलाइज़ेशन ट्रांसफॉर्मर-आधारित हेड्स में उपयोग किया जाता है। प्रशिक्षण प्रक्रिया कम्प्यूटेशनल रूप से गहन है, जिसमें अक्सर कई दिनों के लिए कई GPU की आवश्यकता होती है। उदाहरण के लिए, 8 V100 GPU पर प्रशिक्षित एक विशिष्ट DETR मॉडल को अभिसरण करने में लगभग 3 दिन लगते हैं।
प्रभाव और संबंधित बेंचमार्क
COCO डिटेक्शन ऑब्जेक्ट डिटेक्शन अनुसंधान का मूल्यांकन करने के लिए वास्तविक मानक बन गया है, जिसमें हजारों पेपर अपने वैलिडेशन सेट पर परिणाम रिपोर्ट करते हैं। इसका प्रभाव संबंधित कार्यों तक फैला हुआ है: वही डेटासेट इंस्टेंस सेगमेंटेशन (COCO सेगमेंटेशन), कीपॉइंट डिटेक्शन (COCO कीपॉइंट्स), और पैनोप्टिक सेगमेंटेशन का समर्थन करता है। बेंचमार्क ने स्वायत्त ड्राइविंग, रोबोटिक्स, और चिकित्सा इमेजिंग जैसे क्षेत्रों में व्यावहारिक अनुप्रयोगों को भी प्रेरित किया है, जहाँ सटीक स्थानीयकरण महत्वपूर्ण है। मशीन लर्निंग समुदाय COCO को एक संदर्भ बिंदु के रूप में उपयोग करना जारी रखता है, हालाँकि LVIS और Objects365 जैसे नए डेटासेट अधिक श्रेणियाँ या बड़े पैमाने की पेशकश करते हैं। चैलेंज सक्रिय बना हुआ है, जिसमें CVPR और ECCV जैसे प्रमुख सम्मेलनों में वार्षिक कार्यशालाएँ होती हैं, और लीडरबोर्ड शैक्षणिक और औद्योगिक अनुसंधान टीमों दोनों के लिए एक सामान्य लक्ष्य है।
सीमाएँ और आलोचनाएँ
अपनी लोकप्रियता के बावजूद, COCO डिटेक्शन में ज्ञात सीमाएँ हैं। 80 श्रेणियाँ निश्चित हैं और कई वास्तविक दुनिया की वस्तुओं को कवर नहीं करती हैं, और डेटासेट में अच्छी तरह से केंद्रित, स्पष्ट रूप से दिखाई देने वाली वस्तुओं के प्रति पूर्वाग्रह है। mAP मीट्रिक कॉन्फिडेंस थ्रेसहोल्ड में छोटे बदलावों के प्रति संवेदनशील हो सकता है, और टेस्ट सेट एनोटेशन सार्वजनिक नहीं हैं, जो वैलिडेशन सेट पर ओवरफिटिंग का कारण बन सकता है। कुछ शोधकर्ताओं ने नोट किया है कि COCO पर प्रदर्शन हमेशा अन्य डोमेन, जैसे हवाई या पानी के नीचे की इमेजरी में अनुवाद नहीं करता है। इसके अतिरिक्त, बेंचमार्क स्पष्ट रूप से अनुमान गति या कम्प्यूटेशनल लागत को मापता नहीं है, हालाँकि कई पेपर इन्हें अलग से रिपोर्ट करते हैं। इन मुद्दों ने Open Images और अधिक हाल के EgoObjects जैसे वैकल्पिक बेंचमार्क के निर्माण को प्रेरित किया है, जिनका उद्देश्य इनमें से कुछ अंतरालों को संबोधित करना है।