COCO-Panoptic एक बेंचमार्क डेटासेट और पैनोप्टिक सेगमेंटेशन के लिए मूल्यांकन मीट्रिक है, जो एक कंप्यूटर विज़न कार्य है जो सिमेंटिक सेगमेंटेशन (हर पिक्सेल को एक श्रेणी में वर्गीकृत करना) और इंस्टेंस सेगमेंटेशन (व्यक्तिगत वस्तु इंस्टेंस का पता लगाना और सेगमेंट करना) को एकीकृत करता है। कॉमन ऑब्जेक्ट्स इन कॉन्टेक्स्ट (COCO) डेटासेट के विस्तार के रूप में पेश किया गया, यह मॉडलों को प्रशिक्षित और मूल्यांकन करने का एक मानकीकृत तरीका प्रदान करता है जो एक ही आउटपुट में 'स्टफ' (असंरचित पृष्ठभूमि क्षेत्र जैसे आकाश, घास, और सड़क) और 'थिंग्स' (गिनने योग्य वस्तुएं जैसे लोग, कारें, और जानवर) दोनों की भविष्यवाणी करते हैं। यह बेंचमार्क क्षेत्र में एक डी-फैक्टो मानक बन गया है, जो स्वायत्त ड्राइविंग, रोबोटिक्स, और संवर्धित वास्तविकता जैसे अनुप्रयोगों के लिए दृश्य समझ में प्रगति को बढ़ावा देता है।
यह बेंचमार्क 2019 के पेपर 'पैनोप्टिक सेगमेंटेशन' में अलेक्जेंडर किरिलोव, कैमिंग हे, रॉस गिरशिक, और पियोट्र डॉलर द्वारा प्रस्तावित किया गया था, जो IEEE/CVF कॉन्फ्रेंस ऑन कंप्यूटर विज़न एंड पैटर्न रिकग्निशन (CVPR) में प्रस्तुत किया गया था। लेखकों ने पैनोप्टिक सेगमेंटेशन को एक नए कार्य के रूप में परिभाषित किया और मौजूदा COCO डेटासेट के एक उपसमुच्चय को पुनः-एनोटेट करके COCO-Panoptic बनाया। डेटासेट में 118,000 प्रशिक्षण छवियां, 5,000 सत्यापन छवियां, और 20,000 परीक्षण छवियां शामिल हैं, जो मूल COCO ट्रेन/वैल/टेस्ट विभाजन से प्राप्त हैं। इसमें 80 'थिंग' वर्गों (मूल COCO ऑब्जेक्ट श्रेणियां) और 53 'स्टफ' वर्गों के लिए एनोटेशन शामिल हैं, जो कुल 133 श्रेणियां बनाते हैं। स्टफ एनोटेशन को पानी, जमीन, और आकाश जैसे क्षेत्रों के लिए घने प्रति-पिक्सेल लेबल के रूप में जोड़ा गया था, जो पहले COCO इंस्टेंस एनोटेशन में अलेबल थे।
COCO-Panoptic ने एक एकीकृत मूल्यांकन मीट्रिक पेश किया जिसे पैनोप्टिक क्वालिटी (PQ) कहा जाता है। PQ सेगमेंटेशन गुणवत्ता और पहचान गुणवत्ता को एक ही स्कोर में जोड़ता है, जो डिटेक्शन क्वालिटी (DQ) और सेगमेंटेशन क्वालिटी (SQ) के उत्पाद के रूप में गणना की जाती है। प्रत्येक वर्ग के लिए, PQ की गणना भविष्यवाणी और ग्राउंड-ट्रुथ सेगमेंट के मिलान (0.5 के IoU थ्रेशोल्ड के साथ), सही सकारात्मक का योग, और सही सकारात्मक के योग को आधे गलत सकारात्मक और गलत नकारात्मक के साथ विभाजित करके की जाती है। यह मीट्रिक स्टफ और थिंग्स को समान रूप से व्यवहार करता है, किसी भी ओर पूर्वाग्रह से बचता है। यह डिज़ाइन मॉडलों को छोटे ऑब्जेक्ट्स और बड़े पृष्ठभूमि क्षेत्रों दोनों पर अच्छा प्रदर्शन करने के लिए प्रोत्साहित करता है, जो पैनोप्टिक सेगमेंटेशन में एक प्रमुख चुनौती है।
कार्य परिभाषा और पूर्व कार्य से संबंध
पैनोप्टिक सेगमेंटेशन सिमेंटिक और इंस्टेंस सेगमेंटेशन के बीच स्थित है। सिमेंटिक सेगमेंटेशन हर पिक्सेल को एक वर्ग लेबल प्रदान करता है लेकिन एक वर्ग के भीतर व्यक्तिगत ऑब्जेक्ट्स को अलग नहीं करता (जैसे, दो कारें विलय हो जाती हैं)। इंस्टेंस सेगमेंटेशन प्रत्येक ऑब्जेक्ट को अलग से पहचानता है लेकिन आमतौर पर अलेबल पृष्ठभूमि क्षेत्रों को अनदेखा करता है। पैनोप्टिक सेगमेंटेशन एक एकल लेबलिंग उत्पन्न करता है जहां प्रत्येक पिक्सेल या तो एक थिंग इंस्टेंस (एक आईडी के साथ) या एक स्टफ वर्ग है, जो एक पूर्ण दृश्य विवरण प्रदान करता है। COCO-Panoptic बेंचमार्क ने इस कार्य को औपचारिक रूप दिया, संयुक्त सेगमेंटेशन पर पहले के काम पर निर्माण करते हुए। विशेष रूप से, डेटासेट COCO के समान छवियों का उपयोग करता है, मौजूदा मॉडलों और उपकरणों के साथ संगतता सुनिश्चित करता है, जबकि एनोटेशन की सूक्ष्मता का विस्तार करता है।
डेटासेट आँकड़े और एनोटेशन प्रक्रिया
COCO-Panoptic के लिए एनोटेशन पाइपलाइन में व्यापक मानव प्रयास शामिल था। स्टफ वर्गों को दो-चरणीय दृष्टिकोण का उपयोग करके एनोटेट किया गया था: पहले, क्राउड-सोर्स किए गए कार्यकर्ताओं ने रंगीन छवियों पर प्रत्येक स्टफ क्षेत्र के लिए बहुभुज बनाए; दूसरे, गुणवत्ता नियंत्रण समीक्षकों ने ओवरलैप और सीमाओं को सही किया। प्रत्येक एनोटेशन को 16-बिट वर्ग आईडी के साथ एक एकल-चैनल PNG मास्क के रूप में संग्रहीत किया जाता है। डेटासेट में 'पैनोप्टिक' JSON फाइलें (सेगमेंट जानकारी युक्त) और घने मास्क छवियां दोनों शामिल हैं। मूल COCO इंस्टेंस सेगमेंटेशन लेबल थिंग्स के लिए बनाए रखे गए थे, लेकिन जहां इंस्टेंस मास्क स्टफ क्षेत्रों के साथ ओवरलैप होते थे (जैसे, एक व्यक्ति फुटपाथ पर खड़ा है), नीचे का स्टफ लेबल थिंग मास्क से बाहर रखा गया था, जिससे पिक्सेल-अनन्य लेबल सुनिश्चित हुए। इस सावधानीपूर्वक लेबलिंग के परिणामस्वरूप उच्च अंतर- और अंतर-रेटर सहमति वाला डेटासेट मिला, जैसा कि साथ के पेपर में रिपोर्ट किया गया था (मानव एनोटेटरों का PQ एक संदर्भ सीमा के रूप में उपयोग किया गया था)।
मूल्यांकन और चुनौतियाँ
COCO-Panoptic ने एक आधिकारिक मूल्यांकन सर्वर पेश किया, जिससे शोधकर्ताओं को भविष्यवाणियां जमा करने और सभी 133 वर्गों में PQ स्कोर प्राप्त करने की अनुमति मिली। उच्च PQ प्राप्त करने की चुनौती बड़े, असंरचित स्टफ क्षेत्रों (जिन्हें वैश्विक संदर्भ की आवश्यकता होती है) और छोटे, घने थिंग इंस्टेंस (जिन्हें सटीक सीमाओं की आवश्यकता होती है) दोनों को संभालने में निहित है। प्रारंभिक बेसलाइनों ने मौजूदा आर्किटेक्चर का विस्तार किया, जैसे Residual Network (ResNet)-आधारित फीचर एक्सट्रैक्टर और U-Net-शैली डिकोडर, लेकिन कार्य ने नवीन डिज़ाइनों को प्रेरित किया। उदाहरण के लिए, कुछ विधियां स्टफ और थिंग्स के लिए अलग हेड का उपयोग करती हैं, फिर परिणामों को फ्यूज करती हैं, जबकि अन्य एंड-टू-एंड ट्रांसफार्मर-आधारित दृष्टिकोण अपनाते हैं (जैसे, Mask2Former)। यह बेंचमार्क विधियों की समान आधार पर तुलना करने में सहायक रहा है, जिसमें शीर्ष स्कोर 2019 में सत्यापन सेट पर लगभग 42 PQ से हाल के राज्य-कला मॉडलों में 60 PQ से अधिक तक सुधर गए हैं। यह मीट्रिक वर्ग असंतुलन के प्रति भी मजबूत है, क्योंकि प्रत्येक वर्ग समान रूप से योगदान देता है, जो महत्वपूर्ण है क्योंकि 'आकाश' जैसे स्टफ वर्ग 'टूथब्रश' इंस्टेंस की तुलना में कहीं अधिक पिक्सेल कवर करते हैं।
प्रभाव और संबंधित बेंचमार्क
COCO-Panoptic की सफलता ने बाद के डेटासेट और कार्यों को प्रभावित किया। इसे वीडियो तक बढ़ाया गया है (जैसे, Cityscapes-VPS) और वास्तविक-विश्व अनुप्रयोगों में अपनाया गया है। यह बेंचमार्क Artificial intelligence और Deep learning अनुसंधान में लक्ष्यों के साथ संरेखित है, जहां समग्र धारणा एम्बेडेड एजेंटों के लिए एक कदम है। विशेष रूप से, COCO-Panoptic एनोटेशन COCO-Stuff डेटासेट में उपयोग किए जाते हैं (जो सभी COCO छवियों के लिए स्टफ-केवल लेबल प्रदान करता है) और Detectron2 और MMDetection जैसे प्रमुख फ्रेमवर्क के Data Augmentation टूलकिट में शामिल किए गए हैं। मूल्यांकन मीट्रिक PQ व्यापक रूप से अपनाया गया है, कई पेपर इसे पारंपरिक मीट्रिक जैसे मीन इंटरसेक्शन ओवर यूनियन (mIoU) और औसत परिशुद्धता (AP) के साथ रिपोर्ट करते हैं। 2025 तक, COCO-Panoptic सबसे अधिक उद्धृत पैनोप्टिक सेगमेंटेशन बेंचमार्क बना हुआ है, हालांकि ADE20K और Cityscapes जैसे नए डेटासेट भी पैनोप्टिक एनोटेशन प्रदान करते हैं, अक्सर तुलना के लिए PQ का उपयोग करते हैं। बेंचमार्क के डिज़ाइन सिद्धांत, विशेष रूप से एकीकृत मीट्रिक और स्टफ/थिंग एकीकरण, आधुनिक दृश्य-समझ कार्यों के लिए एक टेम्पलेट बन गए हैं।
भविष्य की दिशाएँ
चल रहे अनुसंधान COCO-Panoptic की सीमाओं को संबोधित करता है, जैसे इसकी निश्चित 133 श्रेणियां और स्थिर छवियां। विस्तारों में ओपन-वोकैबुलरी पैनोप्टिक सेगमेंटेशन (अनदेखे वर्गों को पहचानने के लिए Large language model एम्बेडिंग का उपयोग करना) और वीडियो स्ट्रीम पर पैनोप्टिक सेगमेंटेशन शामिल हैं। बेंचमार्क के मूल विचार, हालांकि, प्रभावशाली बने हुए हैं: यह प्रदर्शित करता है कि एक सावधानीपूर्वक एनोटेट, संतुलित डेटासेट एक सार्थक मीट्रिक के साथ एक क्षेत्र को तेज कर सकता है। शोधकर्ता मॉडलों को पूर्व-प्रशिक्षित करने के लिए COCO-Panoptic का उपयोग जारी रखते हैं, और इसके वजन या फीचर अक्सर Cross-Attention-आधारित ट्रांसफार्मर जैसे डाउनस्ट्रीम कार्यों में स्थानांतरित किए जाते हैं। जैसे-जैसे Neural network आर्किटेक्चर विकसित होते हैं, बेंचमार्क एक स्थिर मापदंड प्रदान करता है, यह सुनिश्चित करता है कि प्रगति लगातार मापी जाए।