अंग्रेज़ी से अनुवादित

PASCAL VOC 2012 एक बेंचमार्क डेटासेट है जो ऑब्जेक्ट डिटेक्शन, वर्गीकरण और सेगमेंटेशन के लिए उपयोग किया जाता है, और 2012 से कंप्यूटर विज़न मॉडल का मूल्यांकन करने के लिए व्यापक रूप से उपयोग किया जाता है।

PASCAL VOC 2012 ऑब्जेक्ट डिटेक्शन, क्लासिफिकेशन और सेगमेंटेशन के लिए एक बेंचमार्क डेटासेट है, जो PASCAL विज़ुअल ऑब्जेक्ट क्लासेस (VOC) चैलेंज श्रृंखला का हिस्सा है। यह 20 ऑब्जेक्ट श्रेणियों में लेबल किए गए चित्र प्रदान करता है, जिसमें क्लासिफिकेशन, डिटेक्शन और सेगमेंटेशन कार्यों के लिए एनोटेशन शामिल हैं। 2012 में जारी किया गया, यह कंप्यूटर विज़न एल्गोरिदम के लिए एक मानक मूल्यांकन सूट बन गया, जिसने ResNet और U-Net जैसे डीप लर्निंग मॉडल के विकास को प्रभावित किया।

डेटासेट में प्रशिक्षण और सत्यापन के लिए 11,530 चित्र और परीक्षण के लिए 10,991 चित्र शामिल हैं, जिनमें व्यक्ति, पशु, वाहन और घरेलू सामान सहित 20 कक्षाओं को कवर करने वाले एनोटेशन हैं। चैलेंज ने अस्पष्ट उदाहरणों के लिए एक "difficult" फ़्लैग और छवि सीमाओं से कटे ऑब्जेक्ट के लिए एक "truncated" फ़्लैग भी पेश किया। सेगमेंटेशन एनोटेशन पिक्सेल-स्तरीय मास्क के रूप में प्रदान किए जाते हैं, जो सिमेंटिक और इंस्टेंस-स्तरीय दोनों मूल्यांकन को सक्षम बनाते हैं।

इतिहास और परिप्रेक्ष्य

PASCAL VOC चैलेंज 2005 से 2012 तक चले, जिसे PASCAL नेटवर्क ऑफ़ एक्सीलेंस, एक यूरोपीय संघ-वित्तपोषित परियोजना द्वारा आयोजित किया गया था। 2012 का संस्करण अंतिम था, और इसका डेटासेट एक दीर्घकालिक संदर्भ बिंदु बन गया। ImageNet और COCO जैसे बड़े पैमाने के डेटासेट के उदय से पहले, VOC 2012 ऑब्जेक्ट डिटेक्शन और सेगमेंटेशन के लिए प्राथमिक बेंचमार्क था। इसका अपेक्षाकृत छोटा आकार (बाद के डेटासेट की तुलना में) शोधकर्ताओं के लिए तेज़ी से पुनरावृत्ति करना संभव बनाता था, लेकिन ओवरफिटिंग के बिना गहरे मॉडल को प्रशिक्षित करने के लिए चुनौतियाँ भी पेश करता था।

चैलेंज में क्लासिफिकेशन (ऑब्जेक्ट उपस्थिति की भविष्यवाणी), डिटेक्शन (बाउंडिंग बॉक्स) और सेगमेंटेशन (पिक्सेल-स्तरीय मास्क) के कार्य शामिल थे। मूल्यांकन मेट्रिक्स में डिटेक्शन के लिए औसत परिशुद्धता (AP) और सेगमेंटेशन के लिए माध्य इंटरसेक्शन-ओवर-यूनियन (mIoU) शामिल थे। 2012 के चैलेंज ने कई शैक्षणिक और औद्योगिक टीमों को आकर्षित किया, और विजेता समाधान अक्सर स्टेट ऑफ़ द आर्ट को आगे बढ़ाते थे।

डेटासेट संरचना और एनोटेशन

VOC 2012 के चित्र Flickr और अन्य सार्वजनिक संग्रहों से प्राप्त किए गए हैं, जिनमें यथार्थवादी दृश्यों पर ध्यान केंद्रित किया गया है। प्रत्येक छवि में विभिन्न श्रेणियों के कई ऑब्जेक्ट हो सकते हैं। एनोटेशन डिटेक्शन और क्लासिफिकेशन के लिए XML फ़ाइलों में और सेगमेंटेशन के लिए PNG मास्क में संग्रहीत किए जाते हैं। डेटासेट को ट्रेन, वैल और टेस्ट सबसेट में विभाजित किया गया है, जिसमें आधिकारिक मूल्यांकन के लिए टेस्ट लेबल वापस ले लिए गए हैं। शोधकर्ता अक्सर विकास के लिए ट्रेन और वैल सेट का उपयोग करते हैं, और अंतिम रिपोर्टिंग के लिए टेस्ट सेट का।

20 ऑब्जेक्ट कक्षाएँ हैं: aeroplane, bicycle, bird, boat, bottle, bus, car, cat, chair, cow, dining table, dog, horse, motorbike, person, potted plant, sheep, sofa, train, और tv/monitor। "difficult" फ़्लैग उन ऑब्जेक्ट को इंगित करता है जो बहुत छोटे या अस्पष्ट हैं, और इन्हें आमतौर पर मूल्यांकन से बाहर रखा जाता है। "truncated" फ़्लैग उन ऑब्जेक्ट को चिह्नित करता है जो आंशिक रूप से छवि फ्रेम के बाहर हैं।

कंप्यूटर विज़न पर प्रभाव

VOC 2012 ने आधुनिक ऑब्जेक्ट डिटेक्शन और सेगमेंटेशन विधियों के विकास में महत्वपूर्ण भूमिका निभाई। R-CNN और इसके वेरिएंट जैसे शुरुआती डीप लर्निंग डिटेक्टरों का मूल्यांकन VOC 2012 पर किया गया और पारंपरिक फीचर-आधारित विधियों पर महत्वपूर्ण सुधार दिखाया। डेटासेट ने माध्य औसत परिशुद्धता (mAP) को एक मानक मीट्रिक के रूप में लोकप्रिय बनाया, जो क्षेत्र में आम बना हुआ है।

सेगमेंटेशन के लिए, VOC 2012 U-Net और बाद के पूर्ण रूप से संवहनी नेटवर्क जैसे मॉडल के लिए एक प्रमुख बेंचमार्क था। पिक्सेल-स्तरीय एनोटेशन ने शोधकर्ताओं को सिमेंटिक सेगमेंटेशन तकनीकों को विकसित और तुलना करने की अनुमति दी। डेटासेट का मध्यम आकार डेटा ऑगमेंटेशन और ImageNet जैसे बड़े डेटासेट से ट्रांसफर लर्निंग के उपयोग को प्रोत्साहित करता था।

विरासत और निरंतर उपयोग

हालाँकि PASCAL VOC चैलेंज 2012 में समाप्त हो गया, डेटासेट अनुसंधान और शिक्षा के लिए व्यापक रूप से उपयोग में बना हुआ है। कई पेपर अभी भी VOC 2012 पर परिणाम रिपोर्ट करते हैं, अक्सर अन्य बेंचमार्क के साथ संयोजन में। यह नए मॉडल के लिए एक सैनिटी चेक और विधियों की तुलना के लिए एक सामान्य आधार के रूप में कार्य करता है। डेटासेट का उपयोग शैक्षणिक पाठ्यक्रमों में ऑब्जेक्ट डिटेक्शन और सेगमेंटेशन सिखाने के लिए भी किया जाता है।

COCO जैसे बाद के डेटासेट में बड़े पैमाने और अधिक श्रेणियाँ हैं, लेकिन VOC 2012 अपनी सरलता और अच्छी तरह से परिभाषित मूल्यांकन प्रोटोकॉल के कारण अपना महत्व बनाए रखता है। ऑक्सफोर्ड विश्वविद्यालय द्वारा बनाए रखा गया आधिकारिक मूल्यांकन सर्वर, अभी भी टेस्ट सेट के लिए सबमिशन की अनुमति देता है, जिससे वर्षों में सुसंगत तुलना सुनिश्चित होती है।

सीमाएँ और आलोचनाएँ

VOC 2012 की आधुनिक डेटासेट की तुलना में सीमित संख्या में श्रेणियों और चित्रों के लिए आलोचना की गई है। चित्र भी अपेक्षाकृत कम-रिज़ॉल्यूशन वाले हैं, जो उच्च-रिज़ॉल्यूशन मॉडल के प्रशिक्षण में बाधा डाल सकते हैं। एनोटेशन की गुणवत्ता आम तौर पर उच्च है, लेकिन कुछ लेबल में त्रुटियाँ या असंगतताएँ हैं। इसके अतिरिक्त, डेटासेट वेब-स्रोत छवियों के लिए सामान्य पूर्वाग्रह प्रदर्शित करता है, जैसे कि कुछ ऑब्जेक्ट पोज़ और संदर्भों का अधिक प्रतिनिधित्व।

इन सीमाओं के बावजूद, VOC 2012 एक मूल्यवान संसाधन बना हुआ है। इसका छोटा आकार तेज़ प्रोटोटाइपिंग की अनुमति देता है, और इसकी अच्छी तरह से समझी गई मेट्रिक्स स्पष्ट तुलना की सुविधा प्रदान करती हैं। शोधकर्ता अक्सर बड़े डेटासेट में स्केलिंग से पहले इसे एक प्रारंभिक बिंदु के रूप में उपयोग करते हैं।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:computer-vision·dataset·benchmark·object-detection
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास