COCO इंस्टेंस सेगमेंटेशन कंप्यूटर विज़न में एक बेंचमार्क कार्य है, जिसे माइक्रोसॉफ्ट COCO (कॉमन ऑब्जेक्ट्स इन कॉन्टेक्स्ट) डेटासेट द्वारा परिभाषित किया गया है। लक्ष्य किसी छवि में वस्तु के प्रत्येक उदाहरण का पता लगाना और एक पिक्सेल-स्तरीय मास्क उत्पन्न करना है जो प्रत्येक उदाहरण की सटीक रूपरेखा तैयार करता है, जो एक ही वर्ग की अलग-अलग वस्तुओं के बीच अंतर करता है। यह कार्य 80 "थिंग" वर्गों को कवर करता है, जो गणनीय वस्तुएं हैं जैसे व्यक्ति, कार और कुत्ता, जबकि "स्टफ" वर्गों जैसे आकाश या घास के विपरीत है। इसका व्यापक रूप से डीप लर्निंग मॉडल के प्रदर्शन का मूल्यांकन करने के लिए उपयोग किया जाता है, जिन कार्यों में स्थानीयकरण और बारीक स्थानिक समझ दोनों की आवश्यकता होती है।
COCO डेटासेट पहली बार 2014 में माइक्रोसॉफ्ट की एक टीम द्वारा जारी किया गया था, जिसमें इंस्टेंस सेगमेंटेशन एनोटेशन 2015 के संस्करण में जोड़े गए थे। डेटासेट में 200,000 से अधिक छवियां हैं, जिनमें 1.5 मिलियन से अधिक वस्तु उदाहरण बहुभुजों के साथ लेबल किए गए हैं जो उनकी सीमाओं को परिभाषित करते हैं। आधिकारिक मूल्यांकन मीट्रिक माध्य औसत परिशुद्धता (AP) है, जो 0.5 से 0.95 तक 0.05 के चरणों में इंटरसेक्शन ओवर यूनियन (IoU) थ्रेसहोल्ड पर औसत है, जिसमें छोटी, मध्यम और बड़ी वस्तुओं के लिए अतिरिक्त मीट्रिक शामिल हैं। यह मीट्रिक, जिसे अक्सर COCO AP कहा जाता है, इंस्टेंस सेगमेंटेशन मॉडल की तुलना के लिए वास्तविक मानक बन गया है।
मॉडलों का विकास
इंस्टेंस सेगमेंटेशन के शुरुआती दृष्टिकोण ऑब्जेक्ट डिटेक्शन फ्रेमवर्क पर आधारित थे। Mask R-CNN आर्किटेक्चर, जिसे 2017 में फेसबुक एआई रिसर्च में काइमिंग हे और सहयोगियों द्वारा पेश किया गया था, ने Faster R-CNN डिटेक्टर का विस्तार किया, जिसमें बाउंडिंग बॉक्स रिग्रेशन के समानांतर सेगमेंटेशन मास्क की भविष्यवाणी करने वाली एक शाखा जोड़ी गई। Mask R-CNN ने पिछले तरीकों की तुलना में महत्वपूर्ण सुधार हासिल किए और एक मजबूत आधार रेखा स्थापित की, जो COCO टेस्ट सेट पर लगभग 35 AP तक पहुंच गया। इसकी सफलता ने मल्टी-स्केल फीचर निष्कर्षण के लिए फीचर पिरामिड नेटवर्क के साथ ResNet बैकबोन के उपयोग को लोकप्रिय बनाया।
बाद के मॉडलों ने सटीकता और दक्षता में सुधार किया। YOLACT, जिसे 2019 में पेश किया गया था, ने एक वास्तविक समय दृष्टिकोण प्रस्तावित किया जो प्रोटोटाइप मास्क उत्पन्न करता है और उन्हें प्रति-उदाहरण गुणांक के साथ जोड़ता है, जो कुछ सटीकता की कीमत पर तेज़ अनुमान प्राप्त करता है। 2020 में, Cascade Mask R-CNN संस्करण ने डिटेक्टरों के कैस्केड को लागू करके AP में सुधार किया। DETR मॉडल, जिसे 2020 में फेसबुक एआई द्वारा पेश किया गया था, ने ऑब्जेक्ट डिटेक्शन को एक सेट भविष्यवाणी समस्या के रूप में मानने के लिए ट्रांसफॉर्मर एनकोडर-डिकोडर आर्किटेक्चर का उपयोग किया, जिससे एंकर बॉक्स और नॉन-मैक्सिमम सप्रेशन जैसे हाथ से बनाए गए घटकों को समाप्त कर दिया गया। DETR और इसके उत्तराधिकारी, जैसे Mask2Former (2021), ने इंस्टेंस, पैनोप्टिक और सिमेंटिक सेगमेंटेशन कार्यों को एक एकल मास्क-वर्गीकरण फ्रेमवर्क के तहत एकीकृत किया।
मूल्यांकन और मीट्रिक
COCO इंस्टेंस सेगमेंटेशन के लिए प्राथमिक मीट्रिक औसत परिशुद्धता (AP) है, जो सभी भविष्यवाणी किए गए मास्क को आत्मविश्वास द्वारा क्रमबद्ध करके और विभिन्न IoU थ्रेसहोल्ड पर परिशुद्धता और पुनर्प्राप्ति को मापकर गणना की जाती है। आधिकारिक COCO मूल्यांकन IoU 0.50 और 0.75 पर AP को अलग-अलग रिपोर्ट करता है, साथ ही विभिन्न वस्तु आकारों के लिए AP: छोटा (क्षेत्र 32^2 पिक्सेल से कम), मध्यम (32^2 और 96^2 के बीच), और बड़ा (96^2 से अधिक)। चुनौती प्रति छवि निश्चित संख्या में डिटेक्शन के साथ औसत पुनर्प्राप्ति (AR) भी ट्रैक करती है। ये मीट्रिक सूक्ष्म तुलना की अनुमति देते हैं, क्योंकि मॉडल बड़ी वस्तुओं का पता लगाने में उत्कृष्ट हो सकते हैं जबकि छोटी वस्तुओं के साथ संघर्ष कर सकते हैं।
COCO टेस्ट-डेव सेट वार्षिक चुनौती के लिए उपयोग किया जाता है, लेकिन शोधकर्ता तेज़ पुनरावृत्ति के लिए अक्सर वैलिडेशन सेट (val2017) पर परिणाम रिपोर्ट करते हैं। डेटासेट को train2017 (लगभग 118,000 छवियां) और val2017 (5,000 छवियां) में विभाजित किया गया है। आधिकारिक मूल्यांकन सर्वर सुसंगत मूल्यांकन सुनिश्चित करता है, लेकिन कई पेपर मीट्रिक की गणना के लिए स्थानीय रूप से pycocotools लाइब्रेरी का भी उपयोग करते हैं।
अनुप्रयोग और प्रभाव
इंस्टेंस सेगमेंटेशन उन अनुप्रयोगों के लिए महत्वपूर्ण है जिन्हें सटीक वस्तु सीमाओं की आवश्यकता होती है, जैसे स्वायत्त ड्राइविंग, रोबोटिक्स, चिकित्सा इमेजिंग और संवर्धित वास्तविकता। स्वायत्त ड्राइविंग में, पैदल यात्रियों, वाहनों और सड़क वस्तुओं को सेगमेंट करने से धारणा प्रणालियों को दृश्यों को समझने में मदद मिलती है। रोबोटिक्स में, पिक्सेल-स्तरीय मास्क विशिष्ट वस्तुओं की पकड़ और हेरफेर को सक्षम करते हैं। COCO बेंचमार्क ने इन क्षेत्रों में तेजी से प्रगति को बढ़ावा दिया है, जिसमें अत्याधुनिक मॉडल 2017 में लगभग 35 AP से 2024 तक 60 AP से अधिक तक सुधर गए हैं, मुख्य रूप से तंत्रिका नेटवर्क आर्किटेक्चर, डेटा ऑगमेंटेशन तकनीकों और प्रशिक्षण रणनीतियों में प्रगति के कारण।
यह कार्य संबंधित समस्याओं के लिए एक आधार के रूप में भी कार्य करता है। पैनोप्टिक सेगमेंटेशन इंस्टेंस और सिमेंटिक सेगमेंटेशन को जोड़ता है, जिसके लिए मॉडल को हर पिक्सेल को एक वर्ग और एक इंस्टेंस आईडी दोनों के साथ लेबल करने की आवश्यकता होती है। COCO डेटासेट को पैनोप्टिक एनोटेशन शामिल करने के लिए विस्तारित किया गया है, और Mask2Former जैसे मॉडल दोनों कार्यों को संभालते हैं। इसके अतिरिक्त, इंस्टेंस सेगमेंटेशन का उपयोग जनरेटिव मॉडल में छवि संपादन के लिए किया जाता है, जहां सटीक मास्क लक्षित संशोधनों की अनुमति देते हैं।
चुनौतियां और सीमाएं
प्रगति के बावजूद, COCO इंस्टेंस सेगमेंटेशन चुनौतीपूर्ण बना हुआ है। छोटी वस्तुएं सीमित पिक्सेल जानकारी के कारण विशेष रूप से कठिन हैं, और अस्पष्ट या ओवरलैपिंग उदाहरण मॉडल को भ्रमित कर सकते हैं। 80 थिंग वर्ग असंतुलित हैं, जिसमें व्यक्ति और कार जैसे सामान्य वर्ग हावी हैं, जबकि हेयर ड्रायर और टूथब्रश जैसे दुर्लभ वर्गों के कुछ उदाहरण हैं। डेटासेट में पूर्वाग्रह भी हैं, जैसे पश्चिमी संदर्भों से छवियों की प्रधानता, जो मॉडल सामान्यीकरण को प्रभावित कर सकती है। 2025 तक, शोधकर्ता बेहतर लॉस फंक्शन, दक्षता के लिए मॉडल प्रूनिंग और बड़े, अधिक विविध डेटासेट के विकास के माध्यम से इन मुद्दों का समाधान करना जारी रखते हैं।
एक और सीमा अत्याधुनिक मॉडलों को प्रशिक्षित करने की उच्च कम्प्यूटेशनल लागत है, जिसके लिए अक्सर कई GPU और दिनों के प्रशिक्षण की आवश्यकता होती है। इसने कुशल आर्किटेक्चर और प्रूनिंग तकनीकों में रुचि पैदा की है। COCO बेंचमार्क प्रगति को मापने के लिए एक प्रमुख उपकरण बना हुआ है, लेकिन कुछ लोग तर्क देते हैं कि यह संतृप्त हो रहा है, जिससे LVIS (लार्ज वोकैबुलरी इंस्टेंस सेगमेंटेशन) जैसे अधिक चुनौतीपूर्ण बेंचमार्क का निर्माण हुआ है, जिसमें 1,200 से अधिक वर्ग हैं।
यह भी देखें
- U-Net - सिमेंटिक सेगमेंटेशन के लिए एक लोकप्रिय आर्किटेक्चर
- डेटा ऑगमेंटेशन - मॉडल सामान्यीकरण में सुधार के लिए उपयोग की जाने वाली तकनीकें
- रिज़िड्यूअल नेटवर्क - सेगमेंटेशन मॉडल में आमतौर पर उपयोग किए जाने वाले बैकबोन आर्किटेक्चर
- लॉस फंक्शन - मास्क लॉस और बाउंडिंग बॉक्स लॉस सहित