ऑक्सफोर्ड पेट्स एक कंप्यूटर विज़न डेटासेट है जिसे ऑक्सफोर्ड विश्वविद्यालय के शोधकर्ताओं द्वारा सूक्ष्म-स्तरीय छवि वर्गीकरण और अर्थगत विभाजन के लिए बनाया गया है। इसमें बिल्लियों और कुत्तों की 37 नस्लों की 7,349 छवियाँ शामिल हैं, जिनमें प्रत्येक छवि को प्रजाति लेबल, नस्ल लेबल और पिक्सेल-स्तरीय ट्राइमैप विभाजन मास्क के साथ एनोटेट किया गया है। यह डेटासेट 2012 में पेश किया गया था और सूक्ष्म-स्तरीय दृश्य पहचान कार्यों पर मॉडलों के मूल्यांकन के लिए एक मानक बेंचमार्क बन गया है।
डेटासेट को दृश्य रूप से समान नस्लों, जैसे मेन कून और नॉर्वेजियन फॉरेस्ट कैट के बीच अंतर, को पहचानने की चुनौतियों का समाधान करने के लिए डिज़ाइन किया गया था। प्रत्येक नस्ल को लगभग 200 छवियों द्वारा दर्शाया गया है, और डेटासेट में प्रशिक्षण, सत्यापन और परीक्षण सेटों में एक पूर्वनिर्धारित विभाजन शामिल है। छवियाँ इंटरनेट से एकत्र की गई थीं और इनमें मुद्रा, प्रकाश और पृष्ठभूमि में विविधताएँ शामिल हैं, जिससे यह कार्य पहले के डेटासेट की तुलना में अधिक यथार्थवादी बन गया है।
डेटासेट संरचना
ऑक्सफोर्ड पेट्स डेटासेट दो प्राथमिक प्रकार की एनोटेशन प्रदान करता है: वर्ग लेबल और विभाजन मास्क। वर्ग लेबल प्रत्येक छवि में जानवर की नस्ल की पहचान करते हैं, जबकि विभाजन मास्क ट्राइमैप होते हैं जो प्रत्येक पिक्सेल को तीन श्रेणियों में से एक को सौंपते हैं: अग्रभूमि (जानवर), पृष्ठभूमि, या अज्ञात (आमतौर पर सीमा क्षेत्र)। यह दोहरी एनोटेशन डेटासेट को वर्गीकरण और विभाजन दोनों कार्यों के लिए उपयोग करने की अनुमति देता है, अक्सर बहु-कार्य सीखने की सेटिंग्स में एक साथ।
आधिकारिक विभाजन लगभग 50% छवियों को प्रशिक्षण के लिए, 20% को सत्यापन के लिए, और 30% को परीक्षण के लिए आवंटित करता है। डेटासेट में मनुष्यों या अन्य जानवरों की कोई छवि शामिल नहीं है, जो विशेष रूप से बिल्लियों और कुत्तों पर केंद्रित है। नस्ल सूची में 25 कुत्तों की नस्लें और 12 बिल्लियों की नस्लें शामिल हैं, जिनमें बीगल और फारसी बिल्ली जैसे सामान्य प्रकार, साथ ही बिरमान और अमेरिकन बुलडॉग जैसी दुर्लभ नस्लें शामिल हैं।
अनुसंधान में उपयोग
ऑक्सफोर्ड पेट्स का व्यापक रूप से मशीन लर्निंग और कंप्यूटर विज़न समुदायों में उपयोग किया गया है। यह कन्वोल्यूशनल न्यूरल नेटवर्क और अन्य आर्किटेक्चर के प्रदर्शन का सूक्ष्म-स्तरीय वर्गीकरण पर मूल्यांकन करने के लिए एक बेंचमार्क के रूप में कार्य करता है। डेटासेट विशेष रूप से मूल्यवान है क्योंकि यह मॉडलों को नस्लों के बीच सूक्ष्म अंतर को पकड़ने की आवश्यकता होती है, जो मोटे-स्तरीय वस्तु पहचान से परे जाता है।
शोधकर्ताओं ने डेटा ऑगमेंटेशन, ट्रांसफर लर्निंग, और मॉडल प्रूनिंग में नवाचारों का परीक्षण करने के लिए ऑक्सफोर्ड पेट्स का उपयोग किया है। उदाहरण के लिए, डेटासेट का उपयोग रिसिड्यूअल नेटवर्क और यू-नेट आर्किटेक्चर की विभाजन के लिए प्रभावशीलता को प्रदर्शित करने के लिए किया गया है। ट्राइमैप मास्क कमजोर रूप से पर्यवेक्षित विभाजन पर अनुसंधान को भी सक्षम करते हैं, जहाँ मॉडल छवि-स्तरीय लेबल से पिक्सेल-स्तरीय भविष्यवाणियाँ उत्पन्न करना सीखते हैं।
अन्य डेटासेट से संबंध
ऑक्सफोर्ड पेट्स की तुलना अक्सर स्टैनफोर्ड कार्स डेटासेट और CUB-200 पक्षी डेटासेट जैसे अन्य सूक्ष्म-स्तरीय डेटासेट से की जाती है। इन डेटासेट की संरचना समान होती है, जिसमें कई वर्ग होते हैं जो दृश्य रूप से समान होते हैं, और इन्हें आमतौर पर डोमेन में मॉडलों के सामान्यीकरण का मूल्यांकन करने के लिए एक साथ उपयोग किया जाता है। डेटासेट का उपयोग अक्सर PASCAL VOC डेटासेट के साथ बहु-कार्य सीखने के लिए भी किया जाता है, क्योंकि दोनों विभाजन एनोटेशन प्रदान करते हैं।
कृत्रिम बुद्धिमत्ता अनुसंधान के संदर्भ में, ऑक्सफोर्ड पेट्स को इमेजनेट जैसे बड़े पैमाने के संग्रह की तुलना में एक अपेक्षाकृत छोटा डेटासेट माना जाता है। यह डेटासेट आकार के मॉडल प्रदर्शन पर प्रभाव का अध्ययन करने और सीमित डेटा के साथ अच्छी तरह से काम करने वाली तकनीकों, जैसे फ्यू-शॉट लर्निंग और सेल्फ-सुपरवाइज्ड लर्निंग विकसित करने के लिए उपयोगी बनाता है।
सीमाएँ और विस्तार
ऑक्सफोर्ड पेट्स की मुख्य सीमा इसका आकार है, जो बड़े मॉडलों को शुरू से प्रशिक्षित करते समय अतिअनुकूलन का कारण बन सकता है। इसे कम करने के लिए, शोधकर्ता अक्सर पूर्व-प्रशिक्षित मॉडलों का उपयोग करते हैं और उन्हें डेटासेट पर ठीक-ट्यून करते हैं। एक और सीमा यह है कि सभी छवियाँ प्राकृतिक सेटिंग्स में पालतू जानवरों की हैं, जो चिकित्सा इमेजिंग या स्वायत्त ड्राइविंग जैसे अन्य डोमेन में सामान्यीकृत नहीं हो सकती हैं।
इन सीमाओं के बावजूद, डेटासेट बेंचमार्किंग और शैक्षिक उद्देश्यों के लिए एक लोकप्रिय विकल्प बना हुआ है। यह शैक्षणिक उपयोग के लिए स्वतंत्र रूप से उपलब्ध है और कई लोकप्रिय डीप लर्निंग लाइब्रेरी, जैसे PyTorch और TensorFlow, में उनके अंतर्निहित डेटासेट मॉड्यूल के माध्यम से शामिल है। डेटासेट ने विस्तारों को भी प्रेरित किया है, जैसे ऑक्सफोर्ड पेट्स II डेटासेट, जो अधिक नस्लों और छवियों को जोड़ता है, हालाँकि मूल संस्करण सबसे व्यापक रूप से उपयोग किया जाता है।
यह भी देखें
- सूक्ष्म-स्तरीय वर्गीकरण
- अर्थगत विभाजन
- कंप्यूटर विज़न
- डेटासेट