सिमेंटिक बाउंड्रीज़ डेटासेट

अंग्रेज़ी से अनुवादित

सिमेंटिक बाउंड्रीज़ डेटासेट (SBD) ऑब्जेक्ट बाउंड्री डिटेक्शन और सिमेंटिक सेगमेंटेशन के लिए एक बड़े पैमाने का डेटासेट है, जो PASCAL VOC 2011 चैलेंज से व्युत्पन्न है। यह 11,355 छवियों में 20 ऑब्जेक्ट क्लासेस के लिए उच्च-गुणवत्ता वाले पिक्सेल-स्तरीय एनोटेशन प्रदान करता है, जिसका उपयोग डीप लर्निंग मॉडल को प्रशिक्षित और मूल्यांकन करने के लिए व्यापक रूप से किया जाता है।

सिमेंटिक बाउंड्रीज़ डेटासेट (SBD) कंप्यूटर विज़न कार्यों के लिए एक बेंचमार्क डेटासेट है, जिसे विशेष रूप से ऑब्जेक्ट बाउंड्री डिटेक्शन और सिमेंटिक सेगमेंटेशन के लिए डिज़ाइन किया गया है। इसे 2011 में कैलिफोर्निया विश्वविद्यालय, बर्कले के शोधकर्ताओं द्वारा PASCAL VOC 2011 डेटासेट के विस्तार के रूप में पेश किया गया था। SBD 11,355 छवियों में 20 ऑब्जेक्ट क्लासेस (जैसे, व्यक्ति, कार, हवाई जहाज, बिल्ली) के लिए घने पिक्सेल-स्तरीय एनोटेशन प्रदान करता है, जिसमें 8,498 प्रशिक्षण और 2,857 सत्यापन छवियों का विभाजन है। यह डेटासेट अपनी उच्च-गुणवत्ता वाली बाउंड्रीज़ के लिए उल्लेखनीय है, जिन्हें मैन्युअल रूप से एनोटेट किया जाता है और क्राउडसोर्सिंग प्लेटफ़ॉर्म का उपयोग करके परिष्कृत किया जाता है, जिससे यह सिमेंटिक सेगमेंटेशन और एज डिटेक्शन में एल्गोरिदम का मूल्यांकन करने के लिए एक मानक बेंचमार्क बन जाता है।

SBD का प्राथमिक उद्देश्य सिमेंटिक सेगमेंटेशन में अनुसंधान को सुविधाजनक बनाना है, जहां लक्ष्य छवि में प्रत्येक पिक्सेल को एक क्लास लेबल निर्दिष्ट करना है। पहले के डेटासेट के विपरीत, जो बाउंडिंग बॉक्स या मोटे मास्क प्रदान करते थे, SBD सटीक ऑब्जेक्ट बाउंड्रीज़ प्रदान करता है, जिससे मॉडल बारीक स्थानिक विवरण सीख सकते हैं। एनोटेशन PNG प्रारूप में रंग-कोडित क्लास लेबल के साथ संग्रहीत होते हैं, और डेटासेट में इंस्टेंस-स्तरीय सेगमेंटेशन मास्क भी शामिल हैं, जो इंस्टेंस सेगमेंटेशन और ऑब्जेक्ट डिटेक्शन जैसे कार्यों के लिए उपयोगी हैं। SBD को डीप लर्निंग समुदाय में व्यापक रूप से अपनाया गया है, जो फुली कन्वोल्यूशनल नेटवर्क (FCNs), U-Net, और कन्वोल्यूशनल न्यूरल नेटवर्क (CNNs) पर आधारित विभिन्न आर्किटेक्चर जैसे मॉडलों के लिए प्रशिक्षण सेट के रूप में कार्य करता है।

डेटासेट संरचना और एनोटेशन

SBD में PASCAL VOC 2011 चैलेंज की छवियाँ शामिल हैं, जिनमें कई ऑब्जेक्ट्स के साथ विविध दृश्य शामिल हैं। प्रत्येक छवि के साथ एक सेगमेंटेशन मास्क होता है जहां प्रत्येक पिक्सेल को 20 ऑब्जेक्ट क्लासेस या एक बैकग्राउंड क्लास (क्लास 0) में से एक निर्दिष्ट किया जाता है। एनोटेशन दो प्रारूपों में प्रदान किए जाते हैं: क्लास-स्तरीय मास्क (जहां प्रत्येक पिक्सेल में एक एकल क्लास लेबल होता है) और इंस्टेंस-स्तरीय मास्क (जहां प्रत्येक ऑब्जेक्ट इंस्टेंस विशिष्ट रूप से पहचाना जाता है)। डेटासेट में बाउंड्री मैप भी शामिल हैं जो ऑब्जेक्ट्स के बीच के किनारों को उजागर करते हैं, जो सेगमेंटेशन मास्क से प्राप्त होते हैं। आधिकारिक वेबसाइट डेटासेट को एक एकल संग्रह (लगभग 1.2 GB) के रूप में प्रदान करती है जिसमें छवियाँ, मास्क और मेटाडेटा शामिल हैं।

निर्माण और पद्धति

डेटासेट को बर्कले अनुसंधान समूह के हिस्से के रूप में हरिहरन एट अल. (2011) द्वारा बनाया गया था। एनोटेशन प्रक्रिया में स्वचालित सेगमेंटेशन और मैन्युअल परिशोधन का संयोजन शामिल था। प्रारंभ में, छवियों को उम्मीदवार क्षेत्रों का प्रस्ताव देने के लिए एक एल्गोरिदम का उपयोग करके सेगमेंट किया गया था, जिन्हें बाद में एक कस्टम इंटरफ़ेस का उपयोग करके एनोटेटर्स द्वारा मैन्युअल रूप से सही किया गया था। गुणवत्ता सुनिश्चित करने के लिए, प्रत्येक छवि को कई कार्यकर्ताओं द्वारा एनोटेट किया गया था, और असहमति को मतदान तंत्र के माध्यम से हल किया गया था। अंतिम एनोटेशन को स्थिरता बनाए रखने के लिए मूल PASCAL VOC लेबल के विरुद्ध मान्य किया गया था। इस पद्धति के परिणामस्वरूप उच्च-गुणवत्ता वाली बाउंड्रीज़ प्राप्त हुईं जो मूल PASCAL VOC डेटासेट की तुलना में अधिक सटीक हैं, जिसने ऑब्जेक्ट डिटेक्शन के लिए बाउंडिंग बॉक्स का उपयोग किया था।

अनुप्रयोग और प्रभाव

SBD सिमेंटिक सेगमेंटेशन मॉडल का मूल्यांकन करने के लिए एक डी फैक्टो मानक बन गया है। इसका उपयोग कई शोध पत्रों और प्रतियोगिताओं में किया जाता है, जिसमें PASCAL VOC सेगमेंटेशन चैलेंज भी शामिल है, जहां SBD प्रशिक्षण डेटा के रूप में कार्य करता है। यह डेटासेट सेगमेंटेशन के लिए डीप लर्निंग को आगे बढ़ाने में सहायक रहा है, क्योंकि यह जटिल मॉडलों को प्रशिक्षित करने के लिए पर्याप्त बड़ा कॉर्पस प्रदान करता है। उदाहरण के लिए, FCN (लॉन्ग एट अल., 2015) और DeepLab (चेन एट अल., 2017) आर्किटेक्चर को SBD पर प्रशिक्षित और मूल्यांकन किया गया था। इसके अतिरिक्त, SBD का उपयोग ट्रांसफर लर्निंग के लिए किया गया है, जहां SBD पर पूर्व-प्रशिक्षित मॉडल को Cityscapes या COCO जैसे अन्य डेटासेट पर फाइन-ट्यून किया जाता है। डेटासेट बाउंड्री डिटेक्शन में अनुसंधान का भी समर्थन करता है, जहां HED (होलिस्टिकली-नेस्टेड एज डिटेक्शन) जैसे मॉडल SBD के बाउंड्री मैप पर प्रशिक्षित होते हैं।

सीमाएँ और विस्तार

इसकी उपयोगिता के बावजूद, SBD की सीमाएँ हैं। यह डेटासेट COCO (200,000 से अधिक छवियों के साथ) या Open Images जैसे आधुनिक बड़े पैमाने के डेटासेट की तुलना में अपेक्षाकृत छोटा है। छवियाँ भी PASCAL VOC श्रेणियों तक सीमित हैं, जो सभी वास्तविक-विश्व परिदृश्यों को कवर नहीं कर सकती हैं। इसके अलावा, एनोटेशन Cityscapes जैसे नए डेटासेट की तरह घने नहीं हैं, जिनमें अधिक क्लासेस और उच्च-रिज़ॉल्यूशन छवियाँ शामिल हैं। इन मुद्दों को संबोधित करने के लिए, शोधकर्ताओं ने SBD को अन्य डेटासेट के साथ जोड़कर या डेटा ऑगमेंटेशन तकनीकों का उपयोग करके विस्तारित किया है। उदाहरण के लिए, SBD का उपयोग अक्सर PASCAL VOC 2012 डेटासेट के साथ संयोजन में किया जाता है, जहां मॉडल प्रदर्शन को बेहतर बनाने के लिए प्रशिक्षण सेट को SBD छवियों के साथ बढ़ाया जाता है। इसके अतिरिक्त, कुछ कार्यों ने डोमेन अनुकूलन अध्ययनों के लिए SBD के सिंथेटिक संस्करण बनाए हैं।

उपलब्धता और उपयोग

SBD आधिकारिक प्रोजेक्ट पेज से अनुसंधान उद्देश्यों के लिए स्वतंत्र रूप से उपलब्ध है। डेटासेट को एक ZIP फ़ाइल के रूप में वितरित किया जाता है जिसमें छवियाँ (JPEG प्रारूप), सेगमेंटेशन मास्क (PNG), और प्रशिक्षण और सत्यापन विभाजन के लिए छवि ID की सूची शामिल होती है। शोधकर्ता आमतौर पर डेटासेट डाउनलोड करते हैं और इसे PyTorch या TensorFlow जैसे लोकप्रिय डीप लर्निंग फ्रेमवर्क के साथ उपयोग करते हैं। डेटासेट को कई ओपन-सोर्स लाइब्रेरीज़ में भी एकीकृत किया गया है, जिनमें torchvision और GluonCV शामिल हैं, जो अंतर्निहित डेटा लोडर प्रदान करते हैं। SBD का उपयोग करते समय, मूल पेपर को उद्धृत करना प्रथागत है: "सिमेंटिक कंटूर्स फ्रॉम इनवर्स डिटेक्टर्स" भरत हरिहरन, पाब्लो अर्बेलेज़, लुबोमिर बोर्डेव, सुब्रांसु माजी, और जितेंद्र मलिक द्वारा, 2011 इंटरनेशनल कॉन्फ्रेंस ऑन कंप्यूटर विज़न (ICCV) में प्रस्तुत।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:computer-vision-datasets·semantic-segmentation·benchmark-datasets
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास