अंग्रेज़ी से अनुवादित

COCO test-dev, COCO डेटासेट का ब्लाइंड टेस्ट विभाजन है, जिसका उपयोग चुनौतियों में ऑब्जेक्ट डिटेक्शन और सेगमेंटेशन मॉडल का मूल्यांकन करने के लिए किया जाता है, जिसमें एनोटेशन सार्वजनिक रिलीज़ से वंचित रहते हैं।

COCO test-dev, कॉमन ऑब्जेक्ट्स इन कॉन्टेक्स्ट (COCO) डेटासेट का एक निर्धारित परीक्षण उप-विभाजन है, जिसे COCO डिटेक्शन और सेगमेंटेशन चैलेंजेस में मॉडलों के मूल्यांकन के लिए बनाया गया है। मानक परीक्षण उप-विभाजन के विपरीत, test-dev एक "ब्लाइंड" सेट है: इसकी ग्राउंड-ट्रुथ एनोटेशन सार्वजनिक रूप से जारी नहीं की जाती हैं। शोधकर्ता अपने मॉडल की भविष्यवाणियाँ मूल्यांकन सर्वर पर प्रस्तुत करते हैं, जो माध्य औसत परिशुद्धता (mAP) जैसी मीट्रिक्स की गणना करता है और स्कोर लौटाता है। यह प्रोटोकॉल परीक्षण सेट पर ओवरफिटिंग को रोकने और प्रतिस्पर्धी विधियों के बीच उचित तुलना सुनिश्चित करने के लिए डिज़ाइन किया गया है।

COCO डेटासेट 2014 में त्सुंग-यी लिन, माइकल मेयर, सर्ज बेलोंगी, जेम्स हेस, पिएत्रो पेरोना, देवा रामानन, पियोत्र डॉलर और सी. लॉरेंस ज़िटनिक द्वारा प्रस्तुत किया गया था। इसमें 200,000 से अधिक छवियाँ हैं, जिनमें 80 श्रेणियों में 1.5 मिलियन से अधिक वस्तु उदाहरण लेबल किए गए हैं। यह डेटासेट Computer vision अनुसंधान में वस्तु पहचान, इंस्टेंस सेगमेंटेशन और कीपॉइंट डिटेक्शन जैसे कार्यों के लिए व्यापक रूप से उपयोग किया जाता है। test-dev उप-विभाजन में लगभग 20,000 छवियाँ शामिल हैं, जो पूर्ण परीक्षण सेट का एक उप-समूह है, जिसमें स्वयं लगभग 40,000 छवियाँ होती हैं। शेष परीक्षण छवियाँ "test-challenge" उप-विभाजन के लिए उपयोग की जाती हैं, जो चैलेंज मूल्यांकन के लिए आरक्षित है और इसमें कोई सार्वजनिक एनोटेशन भी नहीं हैं।

मूल्यांकन प्रोटोकॉल

COCO चैलेंजेस में भाग लेने वाले, जैसे कि 2015 से कंप्यूटर विज़न और पैटर्न रिकग्निशन सम्मेलन (CVPR) में आयोजित COCO डिटेक्शन चैलेंज, test-dev उप-विभाजन के लिए परिणाम प्रस्तुत करते हैं। मूल्यांकन सर्वर मानक मीट्रिक्स की गणना करता है: 0.5 से 0.95 तक IoU थ्रेसहोल्ड पर 0.05 के चरणों में औसत परिशुद्धता (AP), IoU 0.5 पर AP, IoU 0.75 पर AP, और विभिन्न संख्या में डिटेक्शन के लिए औसत रिकॉल (AR)। प्राथमिक मीट्रिक IoU 0.50:0.95 पर AP है, जिसे अक्सर COCO AP कहा जाता है। यह मीट्रिक पारंपरिक PASCAL VOC मीट्रिक की तुलना में अधिक कठोर है, जो केवल 0.5 के एकल IoU थ्रेसहोल्ड का उपयोग करता है।

test-dev की ब्लाइंड प्रकृति का अर्थ है कि शोधकर्ता सीधे परीक्षण सेट पर पुनरावृत्ति नहीं कर सकते। इसके बजाय, वे आमतौर पर विकास और हाइपरपैरामीटर ट्यूनिंग के लिए एक आरक्षित सत्यापन सेट (val2014 या val2017) का उपयोग करते हैं। test-dev उप-विभाजन केवल अंतिम रिपोर्टिंग के लिए उपयोग किया जाता है, जो बेंचमार्क की अखंडता को बनाए रखने में मदद करता है। वर्षों से, COCO मूल्यांकन सर्वर वस्तु पहचान में Machine learning मॉडलों की तुलना के लिए एक मानक बन गया है, और कई अत्याधुनिक सिस्टम test-dev पर अपने प्रदर्शन की रिपोर्ट करते हैं।

ऐतिहासिक संदर्भ

COCO को PASCAL VOC और ImageNet जैसे पहले के डेटासेटों की सीमाओं को संबोधित करने के लिए बनाया गया था, जिनमें कम वस्तु श्रेणियाँ थीं या वर्गीकरण पर ध्यान केंद्रित किया गया था, न कि स्थानीयकरण पर। test-dev उप-विभाजन चैलेंज-आधारित मूल्यांकन का समर्थन करने के लिए डेटासेट के डिज़ाइन के हिस्से के रूप में पेश किया गया था। पहला COCO चैलेंज 2015 में आयोजित किया गया था, और बाद के संस्करण 2020 तक वार्षिक रूप से हुए, जिसमें अंतिम आधिकारिक चैलेंज 2020 ECCW कार्यशाला में हुआ। इस अवधि के दौरान, test-dev डिटेक्शन और सेगमेंटेशन एल्गोरिदम की तुलना के लिए वास्तविक मानक बन गया।

डेटासेट के कई संस्करण रहे हैं: COCO 2014, COCO 2015 और COCO 2017। प्रत्येक संस्करण के लिए test-dev उप-विभाजन मौजूद है, लेकिन 2017 संस्करण हाल के अनुसंधान में सबसे अधिक उपयोग किया जाता है। 2017 test-dev में 20,288 छवियाँ हैं, और इसकी एनोटेशन वापस ले ली गई हैं। COCO 2017 के लिए मूल्यांकन सर्वर अभी भी चालू है, जिससे शोधकर्ता भविष्यवाणियाँ प्रस्तुत कर सकते हैं और मीट्रिक्स प्राप्त कर सकते हैं।

अनुसंधान पर प्रभाव

COCO test-dev वस्तु पहचान और इंस्टेंस सेगमेंटेशन में प्रगति लाने में सहायक रहा है। कई प्रभावशाली मॉडलों ने इस उप-विभाजन पर परिणाम रिपोर्ट किए हैं, जिनमें Faster R-CNN, Mask R-CNN और YOLO वेरिएंट शामिल हैं। उदाहरण के लिए, काइमिंग हे और सहकर्मियों द्वारा 2017 में पेश किए गए Mask R-CNN ने test-dev पर 37.1 का AP प्राप्त किया, जो उस समय एक नई अत्याधुनिक स्थिति स्थापित करता था। EfficientDet और Swin Transformer जैसे बाद के मॉडलों ने AP को 50 से ऊपर धकेल दिया है। एक मानकीकृत ब्लाइंड परीक्षण सेट की उपलब्धता ने उचित तुलना सक्षम की है और फीचर पिरामिड नेटवर्क, एंकर-फ्री डिटेक्टरों और ट्रांसफॉर्मर-आधारित डिटेक्टरों जैसी तकनीकों के विकास को तेज किया है।

डिटेक्शन से परे, test-dev का उपयोग पैनोप्टिक सेगमेंटेशन के मूल्यांकन के लिए भी किया जाता है, एक कार्य जो 2018 में पेश किया गया था और जो सिमेंटिक और इंस्टेंस सेगमेंटेशन को जोड़ता है। COCO पैनोप्टिक चैलेंज 80 थिंग श्रेणियों और 91 स्टफ श्रेणियों के साथ एक अलग test-dev उप-विभाजन का उपयोग करता है। इस विस्तार ने बेंचमार्क की उपयोगिता को व्यापक बना दिया है।

सीमाएँ और विकल्प

व्यापक उपयोग के बावजूद, test-dev की सीमाएँ हैं। आधुनिक डेटासेट के पैमाने की तुलना में छवियों की कम संख्या (लगभग 20,000) शोरगुल वाली मीट्रिक्स का कारण बन सकती है, विशेष रूप से दुर्लभ श्रेणियों के लिए। इसके अतिरिक्त, ब्लाइंड मूल्यांकन प्रोटोकॉल के लिए सर्वर पर भविष्यवाणियाँ प्रस्तुत करने की आवश्यकता होती है, जो इंटरनेट एक्सेस के बिना शोधकर्ताओं या स्थानीय हार्डवेयर पर मूल्यांकन करने वालों के लिए बाधा बन सकती है। इन मुद्दों को संबोधित करने के लिए, कुछ शोधकर्ताओं ने वैकल्पिक बेंचमार्क बनाए हैं, जैसे कि LVIS (लार्ज वोकैबुलरी इंस्टेंस सेगमेंटेशन), जिसमें बड़ा श्रेणी सेट और एक अलग मूल्यांकन प्रोटोकॉल है। हालाँकि, COCO test-dev क्षेत्र में एक मानक संदर्भ बिंदु बना हुआ है।

COCO डेटासेट स्वयं COCO कंसोर्टियम द्वारा होस्ट किया गया है, और मूल्यांकन सर्वर मिशिगन विश्वविद्यालय की टीम और अन्य योगदानकर्ताओं द्वारा बनाए रखा जाता है। 2025 तक, सर्वर अभी भी सक्रिय है, हालाँकि आधिकारिक चैलेंजेस समाप्त हो चुके हैं। शोधकर्ता पत्रों में परिणाम रिपोर्ट करने के लिए test-dev का उपयोग जारी रखते हैं, और यह Deep learning और Artificial intelligence अनुसंधान में एक सामान्य बेंचमार्क बना हुआ है।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:computer-vision·dataset·benchmark·evaluation
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास