अंग्रेज़ी से अनुवादित

COCO-Panoptic एक बेंचमार्क डेटासेट और पैनोप्टिक सेगमेंटेशन के लिए मूल्यांकन मीट्रिक है, जो कंप्यूटर विज़न में समग्र दृश्य समझ को सक्षम करने के लिए COCO डेटासेट में stuff और thing वर्गों को एकीकृत करता है।

COCO-Panoptic एक बेंचमार्क डेटासेट और पैनोप्टिक सेगमेंटेशन के लिए मूल्यांकन मीट्रिक है, जो एक कंप्यूटर विज़न कार्य है जो सिमेंटिक सेगमेंटेशन (हर पिक्सेल को एक श्रेणी में वर्गीकृत करना) और इंस्टेंस सेगमेंटेशन (व्यक्तिगत वस्तु इंस्टेंस का पता लगाना और सेगमेंट करना) को एकीकृत करता है। कॉमन ऑब्जेक्ट्स इन कॉन्टेक्स्ट (COCO) डेटासेट के विस्तार के रूप में पेश किया गया, यह मॉडलों को प्रशिक्षित और मूल्यांकन करने का एक मानकीकृत तरीका प्रदान करता है जो एक ही आउटपुट में 'स्टफ' (असंरचित पृष्ठभूमि क्षेत्र जैसे आकाश, घास, और सड़क) और 'थिंग्स' (गिनने योग्य वस्तुएं जैसे लोग, कारें, और जानवर) दोनों की भविष्यवाणी करते हैं। यह बेंचमार्क क्षेत्र में एक डी-फैक्टो मानक बन गया है, जो स्वायत्त ड्राइविंग, रोबोटिक्स, और संवर्धित वास्तविकता जैसे अनुप्रयोगों के लिए दृश्य समझ में प्रगति को बढ़ावा देता है।

यह बेंचमार्क 2019 के पेपर 'पैनोप्टिक सेगमेंटेशन' में अलेक्जेंडर किरिलोव, कैमिंग हे, रॉस गिरशिक, और पियोट्र डॉलर द्वारा प्रस्तावित किया गया था, जो IEEE/CVF कॉन्फ्रेंस ऑन कंप्यूटर विज़न एंड पैटर्न रिकग्निशन (CVPR) में प्रस्तुत किया गया था। लेखकों ने पैनोप्टिक सेगमेंटेशन को एक नए कार्य के रूप में परिभाषित किया और मौजूदा COCO डेटासेट के एक उपसमुच्चय को पुनः-एनोटेट करके COCO-Panoptic बनाया। डेटासेट में 118,000 प्रशिक्षण छवियां, 5,000 सत्यापन छवियां, और 20,000 परीक्षण छवियां शामिल हैं, जो मूल COCO ट्रेन/वैल/टेस्ट विभाजन से प्राप्त हैं। इसमें 80 'थिंग' वर्गों (मूल COCO ऑब्जेक्ट श्रेणियां) और 53 'स्टफ' वर्गों के लिए एनोटेशन शामिल हैं, जो कुल 133 श्रेणियां बनाते हैं। स्टफ एनोटेशन को पानी, जमीन, और आकाश जैसे क्षेत्रों के लिए घने प्रति-पिक्सेल लेबल के रूप में जोड़ा गया था, जो पहले COCO इंस्टेंस एनोटेशन में अलेबल थे।

COCO-Panoptic ने एक एकीकृत मूल्यांकन मीट्रिक पेश किया जिसे पैनोप्टिक क्वालिटी (PQ) कहा जाता है। PQ सेगमेंटेशन गुणवत्ता और पहचान गुणवत्ता को एक ही स्कोर में जोड़ता है, जो डिटेक्शन क्वालिटी (DQ) और सेगमेंटेशन क्वालिटी (SQ) के उत्पाद के रूप में गणना की जाती है। प्रत्येक वर्ग के लिए, PQ की गणना भविष्यवाणी और ग्राउंड-ट्रुथ सेगमेंट के मिलान (0.5 के IoU थ्रेशोल्ड के साथ), सही सकारात्मक का योग, और सही सकारात्मक के योग को आधे गलत सकारात्मक और गलत नकारात्मक के साथ विभाजित करके की जाती है। यह मीट्रिक स्टफ और थिंग्स को समान रूप से व्यवहार करता है, किसी भी ओर पूर्वाग्रह से बचता है। यह डिज़ाइन मॉडलों को छोटे ऑब्जेक्ट्स और बड़े पृष्ठभूमि क्षेत्रों दोनों पर अच्छा प्रदर्शन करने के लिए प्रोत्साहित करता है, जो पैनोप्टिक सेगमेंटेशन में एक प्रमुख चुनौती है।

कार्य परिभाषा और पूर्व कार्य से संबंध

पैनोप्टिक सेगमेंटेशन सिमेंटिक और इंस्टेंस सेगमेंटेशन के बीच स्थित है। सिमेंटिक सेगमेंटेशन हर पिक्सेल को एक वर्ग लेबल प्रदान करता है लेकिन एक वर्ग के भीतर व्यक्तिगत ऑब्जेक्ट्स को अलग नहीं करता (जैसे, दो कारें विलय हो जाती हैं)। इंस्टेंस सेगमेंटेशन प्रत्येक ऑब्जेक्ट को अलग से पहचानता है लेकिन आमतौर पर अलेबल पृष्ठभूमि क्षेत्रों को अनदेखा करता है। पैनोप्टिक सेगमेंटेशन एक एकल लेबलिंग उत्पन्न करता है जहां प्रत्येक पिक्सेल या तो एक थिंग इंस्टेंस (एक आईडी के साथ) या एक स्टफ वर्ग है, जो एक पूर्ण दृश्य विवरण प्रदान करता है। COCO-Panoptic बेंचमार्क ने इस कार्य को औपचारिक रूप दिया, संयुक्त सेगमेंटेशन पर पहले के काम पर निर्माण करते हुए। विशेष रूप से, डेटासेट COCO के समान छवियों का उपयोग करता है, मौजूदा मॉडलों और उपकरणों के साथ संगतता सुनिश्चित करता है, जबकि एनोटेशन की सूक्ष्मता का विस्तार करता है।

डेटासेट आँकड़े और एनोटेशन प्रक्रिया

COCO-Panoptic के लिए एनोटेशन पाइपलाइन में व्यापक मानव प्रयास शामिल था। स्टफ वर्गों को दो-चरणीय दृष्टिकोण का उपयोग करके एनोटेट किया गया था: पहले, क्राउड-सोर्स किए गए कार्यकर्ताओं ने रंगीन छवियों पर प्रत्येक स्टफ क्षेत्र के लिए बहुभुज बनाए; दूसरे, गुणवत्ता नियंत्रण समीक्षकों ने ओवरलैप और सीमाओं को सही किया। प्रत्येक एनोटेशन को 16-बिट वर्ग आईडी के साथ एक एकल-चैनल PNG मास्क के रूप में संग्रहीत किया जाता है। डेटासेट में 'पैनोप्टिक' JSON फाइलें (सेगमेंट जानकारी युक्त) और घने मास्क छवियां दोनों शामिल हैं। मूल COCO इंस्टेंस सेगमेंटेशन लेबल थिंग्स के लिए बनाए रखे गए थे, लेकिन जहां इंस्टेंस मास्क स्टफ क्षेत्रों के साथ ओवरलैप होते थे (जैसे, एक व्यक्ति फुटपाथ पर खड़ा है), नीचे का स्टफ लेबल थिंग मास्क से बाहर रखा गया था, जिससे पिक्सेल-अनन्य लेबल सुनिश्चित हुए। इस सावधानीपूर्वक लेबलिंग के परिणामस्वरूप उच्च अंतर- और अंतर-रेटर सहमति वाला डेटासेट मिला, जैसा कि साथ के पेपर में रिपोर्ट किया गया था (मानव एनोटेटरों का PQ एक संदर्भ सीमा के रूप में उपयोग किया गया था)।

मूल्यांकन और चुनौतियाँ

COCO-Panoptic ने एक आधिकारिक मूल्यांकन सर्वर पेश किया, जिससे शोधकर्ताओं को भविष्यवाणियां जमा करने और सभी 133 वर्गों में PQ स्कोर प्राप्त करने की अनुमति मिली। उच्च PQ प्राप्त करने की चुनौती बड़े, असंरचित स्टफ क्षेत्रों (जिन्हें वैश्विक संदर्भ की आवश्यकता होती है) और छोटे, घने थिंग इंस्टेंस (जिन्हें सटीक सीमाओं की आवश्यकता होती है) दोनों को संभालने में निहित है। प्रारंभिक बेसलाइनों ने मौजूदा आर्किटेक्चर का विस्तार किया, जैसे Residual Network (ResNet)-आधारित फीचर एक्सट्रैक्टर और U-Net-शैली डिकोडर, लेकिन कार्य ने नवीन डिज़ाइनों को प्रेरित किया। उदाहरण के लिए, कुछ विधियां स्टफ और थिंग्स के लिए अलग हेड का उपयोग करती हैं, फिर परिणामों को फ्यूज करती हैं, जबकि अन्य एंड-टू-एंड ट्रांसफार्मर-आधारित दृष्टिकोण अपनाते हैं (जैसे, Mask2Former)। यह बेंचमार्क विधियों की समान आधार पर तुलना करने में सहायक रहा है, जिसमें शीर्ष स्कोर 2019 में सत्यापन सेट पर लगभग 42 PQ से हाल के राज्य-कला मॉडलों में 60 PQ से अधिक तक सुधर गए हैं। यह मीट्रिक वर्ग असंतुलन के प्रति भी मजबूत है, क्योंकि प्रत्येक वर्ग समान रूप से योगदान देता है, जो महत्वपूर्ण है क्योंकि 'आकाश' जैसे स्टफ वर्ग 'टूथब्रश' इंस्टेंस की तुलना में कहीं अधिक पिक्सेल कवर करते हैं।

प्रभाव और संबंधित बेंचमार्क

COCO-Panoptic की सफलता ने बाद के डेटासेट और कार्यों को प्रभावित किया। इसे वीडियो तक बढ़ाया गया है (जैसे, Cityscapes-VPS) और वास्तविक-विश्व अनुप्रयोगों में अपनाया गया है। यह बेंचमार्क Artificial intelligence और Deep learning अनुसंधान में लक्ष्यों के साथ संरेखित है, जहां समग्र धारणा एम्बेडेड एजेंटों के लिए एक कदम है। विशेष रूप से, COCO-Panoptic एनोटेशन COCO-Stuff डेटासेट में उपयोग किए जाते हैं (जो सभी COCO छवियों के लिए स्टफ-केवल लेबल प्रदान करता है) और Detectron2 और MMDetection जैसे प्रमुख फ्रेमवर्क के Data Augmentation टूलकिट में शामिल किए गए हैं। मूल्यांकन मीट्रिक PQ व्यापक रूप से अपनाया गया है, कई पेपर इसे पारंपरिक मीट्रिक जैसे मीन इंटरसेक्शन ओवर यूनियन (mIoU) और औसत परिशुद्धता (AP) के साथ रिपोर्ट करते हैं। 2025 तक, COCO-Panoptic सबसे अधिक उद्धृत पैनोप्टिक सेगमेंटेशन बेंचमार्क बना हुआ है, हालांकि ADE20K और Cityscapes जैसे नए डेटासेट भी पैनोप्टिक एनोटेशन प्रदान करते हैं, अक्सर तुलना के लिए PQ का उपयोग करते हैं। बेंचमार्क के डिज़ाइन सिद्धांत, विशेष रूप से एकीकृत मीट्रिक और स्टफ/थिंग एकीकरण, आधुनिक दृश्य-समझ कार्यों के लिए एक टेम्पलेट बन गए हैं।

भविष्य की दिशाएँ

चल रहे अनुसंधान COCO-Panoptic की सीमाओं को संबोधित करता है, जैसे इसकी निश्चित 133 श्रेणियां और स्थिर छवियां। विस्तारों में ओपन-वोकैबुलरी पैनोप्टिक सेगमेंटेशन (अनदेखे वर्गों को पहचानने के लिए Large language model एम्बेडिंग का उपयोग करना) और वीडियो स्ट्रीम पर पैनोप्टिक सेगमेंटेशन शामिल हैं। बेंचमार्क के मूल विचार, हालांकि, प्रभावशाली बने हुए हैं: यह प्रदर्शित करता है कि एक सावधानीपूर्वक एनोटेट, संतुलित डेटासेट एक सार्थक मीट्रिक के साथ एक क्षेत्र को तेज कर सकता है। शोधकर्ता मॉडलों को पूर्व-प्रशिक्षित करने के लिए COCO-Panoptic का उपयोग जारी रखते हैं, और इसके वजन या फीचर अक्सर Cross-Attention-आधारित ट्रांसफार्मर जैसे डाउनस्ट्रीम कार्यों में स्थानांतरित किए जाते हैं। जैसे-जैसे Neural network आर्किटेक्चर विकसित होते हैं, बेंचमार्क एक स्थिर मापदंड प्रदान करता है, यह सुनिश्चित करता है कि प्रगति लगातार मापी जाए।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:computer-vision·benchmark·panoptic-segmentation·dataset
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास