Oxford-IIIT पेट डेटासेट कंप्यूटर विज़न में बारीक-दाने वाली छवि वर्गीकरण और सिमेंटिक सेगमेंटेशन के लिए व्यापक रूप से उपयोग किया जाने वाला बेंचमार्क है। 2012 में ऑक्सफोर्ड विश्वविद्यालय और हैदराबाद के भारतीय सूचना प्रौद्योगिकी संस्थान (IIIT-H) के शोधकर्ताओं द्वारा जारी किया गया, इस डेटासेट में 37 बिल्ली और कुत्ते की नस्लों की 7,349 छवियां शामिल हैं। प्रत्येक छवि को एक प्रजाति लेबल, एक नस्ल लेबल, एक पिक्सेल-स्तरीय ट्राइमैप सेगमेंटेशन मास्क और एक मोटा सिर बाउंडिंग बॉक्स के साथ एनोटेट किया गया है। डेटासेट को दृश्य रूप से समान नस्लों के वर्गीकरण और अव्यवस्थित पृष्ठभूमि से जानवरों के सेगमेंटेशन पर शोध को प्रोत्साहित करने के लिए डिज़ाइन किया गया था।
डेटासेट को एक पेपर के साथ पेश किया गया था जिसमें एक मॉडल प्रस्तावित किया गया था जो एक विकृत भाग-आधारित मॉडल को सिमेंटिक सेगमेंटेशन दृष्टिकोण के साथ जोड़ता है। मूल प्रकाशन ने स्थानिक पिरामिड मिलान के साथ बैग-ऑफ-वर्ड्स मॉडल का उपयोग करके 59.2% की वर्गीकरण सटीकता और उनकी प्रस्तावित विधि का उपयोग करके 49.8% माध्य इंटरसेक्शन-ओवर-यूनियन (IoU) की सेगमेंटेशन सटीकता की सूचना दी। इन आंकड़ों को आधुनिक Deep learning मॉडलों द्वारा काफी पीछे छोड़ दिया गया है, लेकिन डेटासेट नई वास्तुकला के मूल्यांकन के लिए एक मानक बना हुआ है।
डेटासेट संरचना
छवियों को 12 बिल्ली नस्लों और 25 कुत्ते नस्लों में विभाजित किया गया है, प्रति वर्ग लगभग 200 छवियों के साथ। नस्लों में आम पालतू जानवर जैसे एबिसिनियन बिल्ली, बंगाल बिल्ली और ब्रिटिश शॉर्टहेयर, साथ ही बीगल, जर्मन शेफर्ड और पग जैसे कुत्ते शामिल हैं। डेटासेट को एक प्रशिक्षण सेट और एक परीक्षण सेट में विभाजित किया गया है, जिसमें विभाजन मूल रिलीज़ में प्रदान किया गया है। प्रशिक्षण सेट में 3,680 छवियां हैं, और परीक्षण सेट में 3,669 छवियां हैं। सेगमेंटेशन मास्क ट्राइमैप हैं, जहां प्रत्येक पिक्सेल को अग्रभूमि, पृष्ठभूमि या अनिश्चित सीमा क्षेत्र के रूप में लेबल किया जाता है।
शोध प्रभाव
Oxford-IIIT पेट डेटासेट का उपयोग सैकड़ों अध्ययनों में किया गया है, विशेष रूप से सिमेंटिक सेगमेंटेशन के लिए U-Net और अन्य तंत्रिका नेटवर्क वास्तुकला के मूल्यांकन के लिए। इसे अक्सर ट्रांसफर लर्निंग बेंचमार्क के लिए PASCAL VOC डेटासेट के साथ जोड़ा जाता है। डेटासेट का मध्यम आकार इसे शुरू से मॉडल प्रशिक्षित करने के लिए उपयुक्त बनाता है, ImageNet जैसे बड़े डेटासेट के विपरीत। इसका उपयोग Data Augmentation तकनीकों का अध्ययन करने के लिए भी किया गया है, क्योंकि प्रति वर्ग छवियों की सीमित संख्या सामान्यीकरण में सुधार के लिए संवर्धन को प्रोत्साहित करती है।
सामान्य मूल्यांकन प्रोटोकॉल
वर्गीकरण के लिए मानक मूल्यांकन माध्य प्रति-वर्ग सटीकता का उपयोग करता है, जबकि सेगमेंटेशन को सभी वर्गों में माध्य IoU द्वारा मापा जाता है। शोधकर्ता आमतौर पर छवियों को एक निश्चित रिज़ॉल्यूशन, जैसे 224x224 पिक्सेल, में आकार बदलते हैं और प्रशिक्षण के दौरान यादृच्छिक फ्लिप और क्रॉप लागू करते हैं। कई प्रकाशित परिणाम आधुनिक अवशिष्ट नेटवर्क और Encoder-Decoder Architecture मॉडल का उपयोग करके 95% से ऊपर वर्गीकरण सटीकता और 90% से ऊपर सेगमेंटेशन IoU की रिपोर्ट करते हैं। डेटासेट की आधिकारिक वेबसाइट मूल एनोटेशन और प्रकाशित परिणामों की एक सूची प्रदान करती है, हालांकि इसे 2010 के दशक के मध्य से अपडेट नहीं किया गया है।
सीमाएं और विकल्प
डेटासेट में ज्ञात सीमाएं हैं, जिनमें प्रति वर्ग छवियों की अपेक्षाकृत कम संख्या और अच्छी तरह से संवारे गए, स्टूडियो-जैसे फोटोग्राफों के प्रति पूर्वाग्रह शामिल हैं। सभी नस्लें शुद्ध नस्ल की हैं, जो मिश्रित नस्ल के पालतू जानवरों की विविधता को प्रतिबिंबित नहीं करती हैं। अधिक चुनौतीपूर्ण कार्यों के लिए, शोधकर्ताओं ने Stanford Dogs या iNaturalist चैलेंज जैसे बड़े डेटासेट की ओर रुख किया है। हालांकि, Oxford-IIIT पेट डेटासेट अपने कॉम्पैक्ट आकार और साफ एनोटेशन के कारण सेगमेंटेशन मॉडल के प्रोटोटाइप के लिए एक सुविधाजनक प्रारंभिक बिंदु बना हुआ है।
विरासत
डेटासेट ओमकार एम. पारखी, एंड्रिया वेदाल्डी, एंड्रयू ज़िसरमैन और सी. वी. जवाहर द्वारा बनाया गया था। 2012 में ब्रिटिश मशीन विज़न सम्मेलन (BMVC) में प्रकाशित साथ वाला पेपर हजारों बार उद्धृत किया गया है। इसने बारीक-दाने वाली पहचान विधियों के विकास में योगदान दिया और कमजोर पर्यवेक्षित सेगमेंटेशन के लिए ट्राइमैप मास्क के उपयोग को लोकप्रिय बनाने में मदद की। डेटासेट शैक्षणिक उपयोग के लिए स्वतंत्र रूप से उपलब्ध है और ऑक्सफोर्ड विश्वविद्यालय की विज़ुअल ज्योमेट्री ग्रुप वेबसाइट पर होस्ट किया गया है।