COCO-Stuff एक बड़े पैमाने पर डेटासेट है जो सिमेंटिक सेगमेंटेशन और दृश्य समझ के लिए उपयोग किया जाता है, जिसे Microsoft Common Objects in Context (COCO) डेटासेट के विस्तार के रूप में बनाया गया है। यह COCO के मौजूदा एनोटेशन को अलग-अलग वस्तुओं (जिन्हें 'things' कहा जाता है) के लिए बढ़ाता है, साथ ही आकारहीन पृष्ठभूमि क्षेत्रों (जिन्हें 'stuff' कहा जाता है) जैसे आकाश, घास, सड़कें, और दीवारों के लिए घने पिक्सेल-स्तरीय लेबल जोड़ता है। यह दोहरी एनोटेशन योजना मॉडलों को एक साथ गणनीय वस्तुओं और अगणनीय पृष्ठभूमि सामग्री को पहचानने की अनुमति देती है, जो स्वायत्त ड्राइविंग, रोबोटिक्स, और छवि कैप्शनिंग जैसे कार्यों के लिए आवश्यक है।
यह डेटासेट 2018 में फ्रीबर्ग विश्वविद्यालय के शोधकर्ताओं द्वारा पेश किया गया था, जिसका नेतृत्व अलेक्जेंडर किरिलोव ने किया, और तब से यह कंप्यूटर विज़न में एक मानक बेंचमार्क बन गया है। यह 2017 COCO train/val विभाजन पर आधारित है, जिसमें मूल 80 thing श्रेणियों में 172 stuff श्रेणियाँ जोड़ी गई हैं, जिसके परिणामस्वरूप कुल 182 सिमेंटिक वर्ग बनते हैं। एनोटेशन स्वचालित एल्गोरिदम और मानव सत्यापन के संयोजन से उत्पन्न किए गए थे, जिससे उच्च गुणवत्ता सुनिश्चित होती है जबकि मैन्युअल लेबलिंग की लागत प्रबंधनीय रहती है।
एनोटेशन संरचना
COCO-Stuff दो प्रकार के एनोटेशन प्रदान करता है: प्रत्येक stuff श्रेणी के लिए पिक्सेल-स्तरीय मास्क और things के लिए मूल COCO इंस्टेंस मास्क। stuff श्रेणियाँ पदानुक्रमित रूप से व्यवस्थित हैं, जिसमें 172 वर्ग प्राकृतिक (जैसे, पानी, पहाड़) और मानव-निर्मित (जैसे, इमारत, बाड़) पृष्ठभूमि को कवर करते हैं। डेटासेट की प्रत्येक छवि में एक एकल stuff मास्क होता है जो हर पिक्सेल को एक वर्ग आईडी प्रदान करता है, जिसमें अचिह्नित या अस्पष्ट क्षेत्रों के लिए 'void' लेबल शामिल है। यह संरचना सिमेंटिक सेगमेंटेशन (जहाँ हर पिक्सेल वर्गीकृत होता है) और पैनोप्टिक सेगमेंटेशन (जहाँ things और stuff को एक एकीकृत आउटपुट में जोड़ा जाता है) दोनों को सक्षम बनाती है।
बेंचमार्क भूमिका
COCO-Stuff व्यापक रूप से सिमेंटिक सेगमेंटेशन एल्गोरिदम के मूल्यांकन के लिए एक बेंचमार्क के रूप में उपयोग किया जाता है। मानक मूल्यांकन मीट्रिक सभी 172 stuff वर्गों में माध्य इंटरसेक्शन ओवर यूनियन (mIoU) है, जिसमें पूर्ण 182-वर्ग सेटिंग का उपयोग करते समय thing वर्गों के लिए अलग रिपोर्टिंग होती है। COCO-Stuff पर प्रशिक्षित मॉडल अक्सर अन्य कार्यों जैसे इंस्टेंस सेगमेंटेशन या दृश्य ग्राफ़ जनरेशन के लिए प्रीट्रेन्ड बैकबोन के रूप में कार्य करते हैं। डेटासेट की विविधता - 164,000 छवियों में 80 वस्तु श्रेणियाँ और 172 पृष्ठभूमि प्रकारों को कवर करना - इसे सामान्यीकरण के लिए एक चुनौतीपूर्ण परीक्षण बनाती है, क्योंकि मॉडलों को दुर्लभ stuff वर्गों जैसे 'गगनचुंबी इमारत' या 'नदी' को संभालना होता है जो कुछ प्रशिक्षण नमूनों में दिखाई देते हैं।
अन्य डेटासेट से संबंध
COCO-Stuff ADE20K और Cityscapes जैसे अन्य सेगमेंटेशन डेटासेट का पूरक है। जबकि ADE20K 150 श्रेणियों (things और stuff दोनों सहित) का एक व्यापक सेट प्रदान करता है, COCO-Stuff COCO से विरासत में मिले अधिक विस्तृत thing एनोटेशन प्रदान करता है। Cityscapes 30 वर्गों के साथ शहरी ड्राइविंग दृश्यों पर केंद्रित है, जबकि COCO-Stuff सामान्य रोज़मर्रा के दृश्यों को कवर करता है। यह COCO-Stuff को एक मध्य मार्ग बनाता है: इसमें COCO का पैमाना है (200,000 से अधिक छवियों के साथ) लेकिन पृष्ठभूमि समझ जोड़ता है जो शुद्ध वस्तु पहचान डेटासेट में कमी है। शोधकर्ता अक्सर COCO-Stuff का उपयोग मॉडलों को प्रशिक्षित करने के लिए करते हैं जिन्हें बाद में डोमेन-विशिष्ट डेटासेट पर फाइन-ट्यून किया जाता है, इसकी विविध पृष्ठभूमि कवरेज का लाभ उठाते हुए।
तकनीकी प्रभाव
COCO-Stuff ने Deep learning के कई क्षेत्रों में प्रगति को बढ़ावा दिया है। यह पैनोप्टिक सेगमेंटेशन के विकास में सहायक था, एक कार्य जो 2019 में औपचारिक रूप से स्थापित हुआ और सिमेंटिक और इंस्टेंस सेगमेंटेशन को एकीकृत करता है। U-Net वेरिएंट और ResNet-आधारित एनकोडर जैसे आर्किटेक्चर आमतौर पर इस डेटासेट पर मूल्यांकन किए जाते हैं। डेटासेट कमजोर पर्यवेक्षित शिक्षण में अनुसंधान का भी समर्थन करता है, जहाँ मॉडल पिक्सेल मास्क के बजाय छवि-स्तरीय लेबल से सीखते हैं, और डोमेन अनुकूलन में, जहाँ COCO-Stuff पर प्रशिक्षित मॉडल विभिन्न वितरणों से वास्तविक दुनिया की छवियों पर परीक्षण किए जाते हैं। इसके एनोटेशन का उपयोग स्वायत्त ड्राइविंग और Robotics में Artificial intelligence अनुप्रयोगों के लिए मॉडलों को प्रशिक्षित करने के लिए किया गया है, जहाँ वस्तुओं और उनके परिवेश दोनों को समझना महत्वपूर्ण है।
उपलब्धता और उपयोग
COCO-Stuff मूल COCO डेटासेट के समान शर्तों के तहत अनुसंधान उद्देश्यों के लिए सार्वजनिक रूप से उपलब्ध है। आधिकारिक रिपॉजिटरी एनोटेशन डाउनलोड और प्रीप्रोसेस करने के लिए स्क्रिप्ट प्रदान करती है, साथ ही mIoU के लिए मूल्यांकन कोड भी। डेटासेट COCO वेबसाइट पर होस्ट किया गया है और शैक्षणिक प्लेटफार्मों पर मिरर किया गया है। 2024 तक, यह कंप्यूटर विज़न में सबसे अधिक उद्धृत डेटासेट में से एक बना हुआ है, जिसमें 2,000 से अधिक उद्धरण हैं। इसकी निरंतर प्रासंगिकता इस तथ्य के कारण है कि तब से things और stuff दोनों एनोटेशन के साथ कोई समान रूप से बड़ा डेटासेट जारी नहीं किया गया है, जिससे यह दृश्य समझ मॉडलों के मूल्यांकन के लिए एक वास्तविक मानक बन गया है। शोधकर्ता COCO-Stuff 164k नामक एक संस्करण भी एक्सेस कर सकते हैं, जो 2017 विभाजन में उपयोग की गई 164,000 छवियों के पूर्ण सेट को संदर्भित करता है, जबकि छोटे 10,000-छवि परीक्षण उपसमुच्चय के विपरीत है।
भविष्य की दिशाएँ
COCO-Stuff की सफलता ने इसे गहराई या वीडियो जैसी अतिरिक्त विधाओं के साथ विस्तारित करने के प्रयासों को प्रेरित किया है। हालाँकि, 2025 तक, कोई आधिकारिक उत्तराधिकारी जारी नहीं किया गया है। डेटासेट की सीमाओं में पश्चिमी दृश्यों के प्रति पूर्वाग्रह और बारीक stuff श्रेणियों की कमी (जैसे, विभिन्न प्रकार की वनस्पति) शामिल हैं। इन अंतरालों को OpenPanoptic और Halcyon जैसे नए डेटासेट द्वारा संबोधित किया जा रहा है, लेकिन COCO-Stuff सबसे व्यापक रूप से उपयोग किया जाने वाला बेंचमार्क बना हुआ है। Machine learning अनुसंधान पर इसका प्रभाव कई प्रकाशित पत्रों में स्पष्ट है जो इस पर परिणाम रिपोर्ट करते हैं, और यह वास्तविक दुनिया के Computer vision सिस्टम को शक्ति देने वाले मॉडलों के प्रशिक्षण के लिए एक आधार के रूप में कार्य करना जारी रखता है।