अंग्रेज़ी से अनुवादित

COCO इंस्टेंस सेगमेंटेशन COCO डेटासेट से एक कंप्यूटर विज़न कार्य है, जिसमें 80 थिंग क्लासेस के लिए पिक्सेल-स्तरीय मास्क की आवश्यकता होती है, और इसका उपयोग ऑब्जेक्ट डिटेक्शन और सेगमेंटेशन मॉडल को बेंचमार्क करने के लिए किया जाता है।

COCO इंस्टेंस सेगमेंटेशन कंप्यूटर विज़न में एक बेंचमार्क कार्य है, जिसे माइक्रोसॉफ्ट COCO (कॉमन ऑब्जेक्ट्स इन कॉन्टेक्स्ट) डेटासेट द्वारा परिभाषित किया गया है। लक्ष्य किसी छवि में वस्तु के प्रत्येक उदाहरण का पता लगाना और एक पिक्सेल-स्तरीय मास्क उत्पन्न करना है जो प्रत्येक उदाहरण की सटीक रूपरेखा तैयार करता है, जो एक ही वर्ग की अलग-अलग वस्तुओं के बीच अंतर करता है। यह कार्य 80 "थिंग" वर्गों को कवर करता है, जो गणनीय वस्तुएं हैं जैसे व्यक्ति, कार और कुत्ता, जबकि "स्टफ" वर्गों जैसे आकाश या घास के विपरीत है। इसका व्यापक रूप से डीप लर्निंग मॉडल के प्रदर्शन का मूल्यांकन करने के लिए उपयोग किया जाता है, जिन कार्यों में स्थानीयकरण और बारीक स्थानिक समझ दोनों की आवश्यकता होती है।

COCO डेटासेट पहली बार 2014 में माइक्रोसॉफ्ट की एक टीम द्वारा जारी किया गया था, जिसमें इंस्टेंस सेगमेंटेशन एनोटेशन 2015 के संस्करण में जोड़े गए थे। डेटासेट में 200,000 से अधिक छवियां हैं, जिनमें 1.5 मिलियन से अधिक वस्तु उदाहरण बहुभुजों के साथ लेबल किए गए हैं जो उनकी सीमाओं को परिभाषित करते हैं। आधिकारिक मूल्यांकन मीट्रिक माध्य औसत परिशुद्धता (AP) है, जो 0.5 से 0.95 तक 0.05 के चरणों में इंटरसेक्शन ओवर यूनियन (IoU) थ्रेसहोल्ड पर औसत है, जिसमें छोटी, मध्यम और बड़ी वस्तुओं के लिए अतिरिक्त मीट्रिक शामिल हैं। यह मीट्रिक, जिसे अक्सर COCO AP कहा जाता है, इंस्टेंस सेगमेंटेशन मॉडल की तुलना के लिए वास्तविक मानक बन गया है।

मॉडलों का विकास

इंस्टेंस सेगमेंटेशन के शुरुआती दृष्टिकोण ऑब्जेक्ट डिटेक्शन फ्रेमवर्क पर आधारित थे। Mask R-CNN आर्किटेक्चर, जिसे 2017 में फेसबुक एआई रिसर्च में काइमिंग हे और सहयोगियों द्वारा पेश किया गया था, ने Faster R-CNN डिटेक्टर का विस्तार किया, जिसमें बाउंडिंग बॉक्स रिग्रेशन के समानांतर सेगमेंटेशन मास्क की भविष्यवाणी करने वाली एक शाखा जोड़ी गई। Mask R-CNN ने पिछले तरीकों की तुलना में महत्वपूर्ण सुधार हासिल किए और एक मजबूत आधार रेखा स्थापित की, जो COCO टेस्ट सेट पर लगभग 35 AP तक पहुंच गया। इसकी सफलता ने मल्टी-स्केल फीचर निष्कर्षण के लिए फीचर पिरामिड नेटवर्क के साथ ResNet बैकबोन के उपयोग को लोकप्रिय बनाया।

बाद के मॉडलों ने सटीकता और दक्षता में सुधार किया। YOLACT, जिसे 2019 में पेश किया गया था, ने एक वास्तविक समय दृष्टिकोण प्रस्तावित किया जो प्रोटोटाइप मास्क उत्पन्न करता है और उन्हें प्रति-उदाहरण गुणांक के साथ जोड़ता है, जो कुछ सटीकता की कीमत पर तेज़ अनुमान प्राप्त करता है। 2020 में, Cascade Mask R-CNN संस्करण ने डिटेक्टरों के कैस्केड को लागू करके AP में सुधार किया। DETR मॉडल, जिसे 2020 में फेसबुक एआई द्वारा पेश किया गया था, ने ऑब्जेक्ट डिटेक्शन को एक सेट भविष्यवाणी समस्या के रूप में मानने के लिए ट्रांसफॉर्मर एनकोडर-डिकोडर आर्किटेक्चर का उपयोग किया, जिससे एंकर बॉक्स और नॉन-मैक्सिमम सप्रेशन जैसे हाथ से बनाए गए घटकों को समाप्त कर दिया गया। DETR और इसके उत्तराधिकारी, जैसे Mask2Former (2021), ने इंस्टेंस, पैनोप्टिक और सिमेंटिक सेगमेंटेशन कार्यों को एक एकल मास्क-वर्गीकरण फ्रेमवर्क के तहत एकीकृत किया।

मूल्यांकन और मीट्रिक

COCO इंस्टेंस सेगमेंटेशन के लिए प्राथमिक मीट्रिक औसत परिशुद्धता (AP) है, जो सभी भविष्यवाणी किए गए मास्क को आत्मविश्वास द्वारा क्रमबद्ध करके और विभिन्न IoU थ्रेसहोल्ड पर परिशुद्धता और पुनर्प्राप्ति को मापकर गणना की जाती है। आधिकारिक COCO मूल्यांकन IoU 0.50 और 0.75 पर AP को अलग-अलग रिपोर्ट करता है, साथ ही विभिन्न वस्तु आकारों के लिए AP: छोटा (क्षेत्र 32^2 पिक्सेल से कम), मध्यम (32^2 और 96^2 के बीच), और बड़ा (96^2 से अधिक)। चुनौती प्रति छवि निश्चित संख्या में डिटेक्शन के साथ औसत पुनर्प्राप्ति (AR) भी ट्रैक करती है। ये मीट्रिक सूक्ष्म तुलना की अनुमति देते हैं, क्योंकि मॉडल बड़ी वस्तुओं का पता लगाने में उत्कृष्ट हो सकते हैं जबकि छोटी वस्तुओं के साथ संघर्ष कर सकते हैं।

COCO टेस्ट-डेव सेट वार्षिक चुनौती के लिए उपयोग किया जाता है, लेकिन शोधकर्ता तेज़ पुनरावृत्ति के लिए अक्सर वैलिडेशन सेट (val2017) पर परिणाम रिपोर्ट करते हैं। डेटासेट को train2017 (लगभग 118,000 छवियां) और val2017 (5,000 छवियां) में विभाजित किया गया है। आधिकारिक मूल्यांकन सर्वर सुसंगत मूल्यांकन सुनिश्चित करता है, लेकिन कई पेपर मीट्रिक की गणना के लिए स्थानीय रूप से pycocotools लाइब्रेरी का भी उपयोग करते हैं।

अनुप्रयोग और प्रभाव

इंस्टेंस सेगमेंटेशन उन अनुप्रयोगों के लिए महत्वपूर्ण है जिन्हें सटीक वस्तु सीमाओं की आवश्यकता होती है, जैसे स्वायत्त ड्राइविंग, रोबोटिक्स, चिकित्सा इमेजिंग और संवर्धित वास्तविकता। स्वायत्त ड्राइविंग में, पैदल यात्रियों, वाहनों और सड़क वस्तुओं को सेगमेंट करने से धारणा प्रणालियों को दृश्यों को समझने में मदद मिलती है। रोबोटिक्स में, पिक्सेल-स्तरीय मास्क विशिष्ट वस्तुओं की पकड़ और हेरफेर को सक्षम करते हैं। COCO बेंचमार्क ने इन क्षेत्रों में तेजी से प्रगति को बढ़ावा दिया है, जिसमें अत्याधुनिक मॉडल 2017 में लगभग 35 AP से 2024 तक 60 AP से अधिक तक सुधर गए हैं, मुख्य रूप से तंत्रिका नेटवर्क आर्किटेक्चर, डेटा ऑगमेंटेशन तकनीकों और प्रशिक्षण रणनीतियों में प्रगति के कारण।

यह कार्य संबंधित समस्याओं के लिए एक आधार के रूप में भी कार्य करता है। पैनोप्टिक सेगमेंटेशन इंस्टेंस और सिमेंटिक सेगमेंटेशन को जोड़ता है, जिसके लिए मॉडल को हर पिक्सेल को एक वर्ग और एक इंस्टेंस आईडी दोनों के साथ लेबल करने की आवश्यकता होती है। COCO डेटासेट को पैनोप्टिक एनोटेशन शामिल करने के लिए विस्तारित किया गया है, और Mask2Former जैसे मॉडल दोनों कार्यों को संभालते हैं। इसके अतिरिक्त, इंस्टेंस सेगमेंटेशन का उपयोग जनरेटिव मॉडल में छवि संपादन के लिए किया जाता है, जहां सटीक मास्क लक्षित संशोधनों की अनुमति देते हैं।

चुनौतियां और सीमाएं

प्रगति के बावजूद, COCO इंस्टेंस सेगमेंटेशन चुनौतीपूर्ण बना हुआ है। छोटी वस्तुएं सीमित पिक्सेल जानकारी के कारण विशेष रूप से कठिन हैं, और अस्पष्ट या ओवरलैपिंग उदाहरण मॉडल को भ्रमित कर सकते हैं। 80 थिंग वर्ग असंतुलित हैं, जिसमें व्यक्ति और कार जैसे सामान्य वर्ग हावी हैं, जबकि हेयर ड्रायर और टूथब्रश जैसे दुर्लभ वर्गों के कुछ उदाहरण हैं। डेटासेट में पूर्वाग्रह भी हैं, जैसे पश्चिमी संदर्भों से छवियों की प्रधानता, जो मॉडल सामान्यीकरण को प्रभावित कर सकती है। 2025 तक, शोधकर्ता बेहतर लॉस फंक्शन, दक्षता के लिए मॉडल प्रूनिंग और बड़े, अधिक विविध डेटासेट के विकास के माध्यम से इन मुद्दों का समाधान करना जारी रखते हैं।

एक और सीमा अत्याधुनिक मॉडलों को प्रशिक्षित करने की उच्च कम्प्यूटेशनल लागत है, जिसके लिए अक्सर कई GPU और दिनों के प्रशिक्षण की आवश्यकता होती है। इसने कुशल आर्किटेक्चर और प्रूनिंग तकनीकों में रुचि पैदा की है। COCO बेंचमार्क प्रगति को मापने के लिए एक प्रमुख उपकरण बना हुआ है, लेकिन कुछ लोग तर्क देते हैं कि यह संतृप्त हो रहा है, जिससे LVIS (लार्ज वोकैबुलरी इंस्टेंस सेगमेंटेशन) जैसे अधिक चुनौतीपूर्ण बेंचमार्क का निर्माण हुआ है, जिसमें 1,200 से अधिक वर्ग हैं।

यह भी देखें

  • U-Net - सिमेंटिक सेगमेंटेशन के लिए एक लोकप्रिय आर्किटेक्चर
  • डेटा ऑगमेंटेशन - मॉडल सामान्यीकरण में सुधार के लिए उपयोग की जाने वाली तकनीकें
  • रिज़िड्यूअल नेटवर्क - सेगमेंटेशन मॉडल में आमतौर पर उपयोग किए जाने वाले बैकबोन आर्किटेक्चर
  • लॉस फंक्शन - मास्क लॉस और बाउंडिंग बॉक्स लॉस सहित
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:computer-vision·instance-segmentation·dataset·benchmark
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास