अंग्रेज़ी से अनुवादित

COCO-Stuff 164K एक बड़े पैमाने का डेटासेट है जो सिमेंटिक सेगमेंटेशन और दृश्य समझ के लिए है, जो COCO को 164,000 छवियों और 172 स्टफ और थिंग क्लासेस के लिए पिक्सेल-स्तरीय एनोटेशन के साथ विस्तारित करता है।

COCO-Stuff 164K एक बड़े पैमाने पर शब्दार्थ विभाजन (semantic segmentation) और दृश्य समझ (scene understanding) के लिए डेटासेट है, जिसे Microsoft Common Objects in Context (COCO) डेटासेट के विस्तार के रूप में बनाया गया है। यह 'स्टफ' (stuff) वर्गों (जैसे आकाश, घास, और सड़क जैसे अनाकार पृष्ठभूमि क्षेत्र) और 'थिंग' (thing) वर्गों (जैसे व्यक्ति, कार, और कुत्ता जैसे गणनीय वस्तुएँ) दोनों के लिए सघन पिक्सेल-स्तरीय एनोटेशन प्रदान करता है। डेटासेट में 164,000 छवियाँ हैं, जिनमें से प्रत्येक को 172 शब्दार्थ श्रेणियों में से एक के साथ एनोटेट किया गया है, जिससे यह कंप्यूटर विज़न कार्यों जैसे शब्दार्थ विभाजन, उदाहरण विभाजन (instance segmentation), और दृश्य पार्सिंग (scene parsing) में मॉडलों के प्रशिक्षण और मूल्यांकन के लिए सबसे व्यापक संसाधनों में से एक बन जाता है।

डेटासेट को 2018 में फ्रीबर्ग विश्वविद्यालय के शोधकर्ताओं, जिनमें होल्गर सीज़र, जैस्पर उइजलिंग्स, और विटोरियो फेरारी शामिल हैं, द्वारा पेश किया गया था, और इसे 'COCO-Stuff: Thing and Stuff Classes in Context' नामक पेपर में प्रकाशित किया गया था। यह मूल COCO-Stuff डेटासेट पर आधारित है, जिसमें 10,000 छवियाँ थीं, और इसे पूर्ण COCO प्रशिक्षण और सत्यापन विभाजनों तक बढ़ाया गया है। 172 वर्गों को 80 थिंग वर्गों (COCO की थिंग श्रेणियों के समान) और 92 स्टफ वर्गों में विभाजित किया गया है, जिनमें प्राकृतिक और मानव-निर्मित पृष्ठभूमि तत्व शामिल हैं।

निर्माण और एनोटेशन

COCO-Stuff 164K के लिए एनोटेशन प्रक्रिया में स्वचालित और मैनुअल दोनों चरण शामिल थे। प्रारंभिक स्टफ एनोटेशन गहन शिक्षण मॉडल और मानव परिष्कार के संयोजन का उपयोग करके उत्पन्न किए गए थे। डेटासेट थिंग वर्गों के लिए मौजूदा COCO एनोटेशन का लाभ उठाता है, जो क्राउड वर्कर्स द्वारा बनाए गए थे, और स्टफ वर्गों के लिए पिक्सेल-स्तरीय मास्क जोड़ता है। अंतिम एनोटेशन को 164,000 छवियों में स्थिरता और सटीकता सुनिश्चित करने के लिए गुणवत्ता नियंत्रण जांचों की एक श्रृंखला के माध्यम से मान्य किया गया था।

डेटासेट में प्रत्येक छवि को प्रति पिक्सेल एक ही लेबल के साथ एनोटेट किया गया है, और एनोटेशन भंडारण आवश्यकताओं को कम करने के लिए एक कॉम्पैक्ट रन-लेंथ एन्कोडिंग प्रारूप में प्रदान किए गए हैं। डेटासेट को 118,000 छवियों के प्रशिक्षण सेट और 5,000 छवियों के सत्यापन सेट में विभाजित किया गया है, शेष छवियाँ परीक्षण के लिए आरक्षित हैं (परीक्षण सेट के लिए एनोटेशन सार्वजनिक रूप से जारी नहीं किए गए हैं)।

गहन शिक्षण में अनुप्रयोग

COCO-Stuff 164K शब्दार्थ विभाजन के लिए एक मानक बेंचमार्क बन गया है, जो मशीन-लर्निंग और डीप-लर्निंग में एक कार्य है जहाँ एक मॉडल छवि के हर पिक्सेल को एक वर्ग लेबल प्रदान करता है। इसका उपयोग न्यूरल-नेटवर्क आर्किटेक्चर, जिनमें रिज़िड्यूअल-नेटवर्क और यू-नेट आधारित मॉडल, साथ ही ट्रांसफॉर्मर-आधारित दृष्टिकोण शामिल हैं, के प्रदर्शन का मूल्यांकन करने के लिए व्यापक रूप से किया जाता है। डेटासेट की स्टफ और थिंग दोनों वर्गों की विविधता मॉडलों को बारीक वस्तु सीमाओं और बड़े पैमाने पर संदर्भ क्षेत्रों दोनों को समझने की चुनौती देती है।

डेटासेट का उपयोग पैनोप्टिक विभाजन (panoptic segmentation) के लिए भी किया जाता है, जो शब्दार्थ और उदाहरण विभाजन को एकीकृत करता है, जिसमें मॉडलों को एक साथ स्टफ और थिंग दोनों लेबल की भविष्यवाणी करनी होती है। इसने एकीकृत आर्किटेक्चर पर शोध को बढ़ावा दिया है जो एक ही फॉरवर्ड पास में दोनों प्रकार के वर्गों को संभाल सकते हैं।

बेंचमार्क और मूल्यांकन मेट्रिक्स

COCO-Stuff 164K के लिए प्राथमिक मूल्यांकन मेट्रिक माध्य इंटरसेक्शन ओवर यूनियन (mIoU) है, जो सभी वर्गों पर औसत भविष्यवाणी और ग्राउंड-ट्रुथ विभाजन मास्क के बीच ओवरलैप को मापता है। शोधकर्ता प्रति-वर्ग IoU और पिक्सेल सटीकता भी रिपोर्ट करते हैं। डेटासेट का आधिकारिक मूल्यांकन सर्वर मॉडलों की निष्पक्ष तुलना की अनुमति देता है, और लीडरबोर्ड समय के साथ सर्वोत्तम प्रदर्शन को ट्रैक करते हैं।

अपनी रिलीज़ के बाद से, डेटासेट का उपयोग सैकड़ों शोध पत्रों में किया गया है, और शीर्ष प्रदर्शन करने वाले मॉडलों ने सत्यापन सेट पर 50 से अधिक mIoU स्कोर हासिल किए हैं, जिसमें ट्रांसफॉर्मर-आधारित आर्किटेक्चर और ध्यान तंत्रों में प्रगति से महत्वपूर्ण विकास हुआ है।

अन्य डेटासेट से संबंध

COCO-Stuff 164K COCO से व्युत्पन्न डेटासेट के परिवार का हिस्सा है, जिसमें COCO-Stuff 10K और मूल COCO डेटासेट शामिल हैं। यह अन्य दृश्य समझ डेटासेट जैसे Cityscapes, जो शहरी ड्राइविंग दृश्यों पर केंद्रित है, और ADE20K, जो इनडोर और आउटडोर दृश्यों की व्यापक श्रेणी को कवर करता है, का पूरक है। डेटासेट का संदर्भ और स्टफ वर्गों पर जोर इसे स्वायत्त ड्राइविंग, रोबोटिक्स, और संवर्धित वास्तविकता जैसे अनुप्रयोगों के लिए विशेष रूप से उपयोगी बनाता है, जहाँ पृष्ठभूमि क्षेत्रों को समझना वस्तुओं का पता लगाने जितना ही महत्वपूर्ण है।

डेटासेट अनुसंधान उद्देश्यों के लिए सार्वजनिक रूप से उपलब्ध है और आधिकारिक COCO वेबसाइट पर होस्ट किया गया है। इसका उपयोग आमतौर पर आर्टिफिशियल-इंटेलिजेंस अनुसंधान प्रयोगशालाओं और क्लाउड प्लेटफार्मों से पूर्व-प्रशिक्षित मॉडलों के साथ किया जाता है, और यह कंप्यूटर विज़न के क्षेत्र को आगे बढ़ाने के लिए एक प्रमुख संसाधन बना हुआ है।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:computer-vision·semantic-segmentation·dataset·deep-learning
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास