अंग्रेज़ी से अनुवादित

SVHN Cropped एक बेंचमार्क डेटासेट है जिसमें Google Street View से 600,000+ क्रॉप किए गए अंकों की छवियाँ शामिल हैं, जो अंक पहचान और कंप्यूटर विज़न में गहन शिक्षण मॉडलों के प्रशिक्षण और मूल्यांकन के लिए व्यापक रूप से उपयोग किया जाता है।

SVHN Cropped मशीन लर्निंग और डीप लर्निंग में व्यापक रूप से उपयोग किया जाने वाला एक बेंचमार्क डेटासेट है, जिसमें Google Street View इमेजरी में घर के नंबरों से प्राप्त 600,000 से अधिक क्रॉप किए गए अंकों की छवियाँ शामिल हैं। प्रत्येक छवि एक 32x32 पिक्सेल रंगीन पैच है जो एकल अंक (0-9) पर केंद्रित है, जिससे यह डेटासेट अंक वर्गीकरण, तंत्रिका नेटवर्क प्रशिक्षण, और डेटा-वृद्धि अनुसंधान जैसे कार्यों के लिए उपयुक्त है। यह डेटासेट 2011 में स्टैनफोर्ड एआई लैब और Google के शोधकर्ताओं द्वारा स्ट्रीट व्यू हाउस नंबर (SVHN) परियोजना के भाग के रूप में पेश किया गया था, जिसका उद्देश्य मैपिंग सेवाओं के लिए घर के नंबरों की स्वचालित पठन में सुधार करना था।

SVHN Cropped सेट की तुलना अक्सर MNIST से की जाती है, लेकिन इसकी प्राकृतिक छवि विशेषताओं के कारण इसे अधिक चुनौतीपूर्ण माना जाता है: अंक विभिन्न पृष्ठभूमि, प्रकाश स्थितियों, विकृतियों, और कभी-कभी किनारों पर ध्यान भटकाने वाले अंकों के साथ दिखाई देते हैं। पूरा डेटासेट 73,257 प्रशिक्षण छवियों, 26,032 परीक्षण छवियों, और अतिरिक्त 531,131 अतिरिक्त प्रशिक्षण नमूनों में विभाजित है, जिनका उपयोग प्रशिक्षण सेट को बढ़ाने के लिए किया जा सकता है। लेबल केंद्रीय अंक के अनुरूप होते हैं, और छवियाँ PNG प्रारूप में अंक बाउंडिंग बॉक्स मेटाडेटा के साथ प्रदान की जाती हैं।

डेटासेट संरचना और प्रारूप

SVHN Cropped डेटासेट तीन मुख्य फ़ाइलों में व्यवस्थित है: train.tar.gz, test.tar.gz, और extra.tar.gz। प्रत्येक संग्रह में एक अद्वितीय पहचानकर्ता द्वारा नामित व्यक्तिगत PNG छवियाँ, और एक digitStruct.mat फ़ाइल (MATLAB प्रारूप में) शामिल है जो प्रत्येक अंक के लिए बाउंडिंग बॉक्स निर्देशांक और लेबल संग्रहीत करती है। क्रॉप किए गए संस्करण के लिए, छवियाँ पहले से ही लक्ष्य अंक पर केंद्रित हैं, लेकिन मेटाडेटा में अभी भी मूल बाउंडिंग बॉक्स शामिल हैं, जो ऑब्जेक्ट स्थानीयकरण या डेटासेट के वेरिएंट बनाने जैसे कार्यों के लिए उपयोगी हो सकते हैं।

प्रत्येक छवि तीन रंग चैनलों (RGB) के साथ 32x32 पिक्सेल है, जो ग्रेस्केल 28x28 MNIST छवियों के विपरीत है। बड़ा आकार और रंग जानकारी अधिक दृश्य जटिलता प्रदान करते हैं, जिससे SVHN Cropped कन्वोल्यूशनल आर्किटेक्चर और अवशिष्ट-नेटवर्क डिज़ाइनों के परीक्षण के लिए एक पसंदीदा विकल्प बन जाता है। डेटासेट अनुसंधान उद्देश्यों के लिए सार्वजनिक रूप से उपलब्ध है और आधिकारिक SVHN वेबसाइट या TensorFlow और PyTorch जैसी लोकप्रिय मशीन लर्निंग लाइब्रेरीज़ के माध्यम से डाउनलोड किया जा सकता है, जिनमें अंतर्निहित लोडर शामिल हैं।

मशीन लर्निंग में अनुप्रयोग

SVHN Cropped मुख्य रूप से अंक वर्गीकरण कार्यों के लिए उपयोग किया जाता है, जो नए मॉडलों और तकनीकों के मूल्यांकन के लिए एक मानक बेंचमार्क के रूप में कार्य करता है। इसका उपयोग कई अध्ययनों में विभिन्न आर्किटेक्चरों के प्रदर्शन की तुलना करने के लिए किया गया है, जिसमें कन्वोल्यूशनल तंत्रिका नेटवर्क (CNN), ResNets, और हाल के ट्रांसफॉर्मर-आधारित विज़न मॉडल शामिल हैं। डेटासेट की प्राकृतिक छवि परिवर्तनशीलता इसे वास्तविक दुनिया के OCR (ऑप्टिकल कैरेक्टर रिकग्निशन) कार्यों, जैसे घर के नंबर, लाइसेंस प्लेट, या तस्वीरों में किसी भी अंक अनुक्रम को पढ़ने के लिए एक अच्छा प्रॉक्सी बनाती है।

वर्गीकरण के अलावा, SVHN Cropped का उपयोग पाठ्यक्रम-शिक्षण प्रयोगों के लिए किया गया है, जहाँ मॉडलों को पहले आसान नमूनों पर प्रशिक्षित किया जाता है, और डेटा-वृद्धि रणनीतियों जैसे यादृच्छिक क्रॉपिंग, रोटेशन, और रंग जिटर के परीक्षण के लिए। यह बैच-सामान्यीकरण, ड्रॉपआउट, और अन्य नियमितीकरण तकनीकों के साथ-साथ मॉडल-प्रूनिंग और ज्ञान आसवन अध्ययनों के लिए भी एक परीक्षण मंच के रूप में कार्य करता है। 531,131 छवियों का अतिरिक्त सेट अक्सर अर्ध-पर्यवेक्षित शिक्षण परिदृश्यों का अनुकरण करने के लिए उपयोग किया जाता है, जहाँ केवल एक छोटा लेबल किया गया उपसमुच्चय बड़े अलेबल पूल के साथ उपयोग किया जाता है।

अन्य डेटासेट के साथ तुलना

SVHN Cropped की तुलना अक्सर MNIST और CIFAR-10 के साथ की जाती है। MNIST के विपरीत, जिसमें साफ, केंद्रित, ग्रेस्केल अंक होते हैं, SVHN Cropped अंक रंगीन होते हैं, विभिन्न पैमाने और अभिविन्यास होते हैं, और पृष्ठभूमि अव्यवस्था शामिल होती है। यह SVHN Cropped को वास्तविक दुनिया की स्थितियों का अधिक प्रतिनिधि बनाता है और मॉडलों के लिए उच्च सटीकता प्राप्त करना कठिन बनाता है। उदाहरण के लिए, एक सरल CNN MNIST पर 99% से अधिक सटीकता प्राप्त कर सकता है, लेकिन व्यापक ट्यूनिंग या वृद्धि के बिना SVHN Cropped पर केवल लगभग 95-97% ही प्राप्त कर सकता है।

CIFAR-10 की तुलना में, जिसमें 10 ऑब्जेक्ट वर्गों में 60,000 32x32 रंगीन छवियाँ शामिल हैं, SVHN Cropped अधिक प्रशिक्षण डेटा (600,000 से अधिक छवियाँ) और एक अधिक केंद्रित कार्य (अंक पहचान) प्रदान करता है। डेटासेट का बड़ा आकार ओवरफिटिंग के बिना गहरे नेटवर्क को प्रशिक्षित करने के लिए फायदेमंद है। शोधकर्ता अक्सर SVHN Cropped का उपयोग MNIST की सरलता और ImageNet की जटिलता के बीच एक मध्य मार्ग के रूप में करते हैं, जो मॉडल प्रदर्शन का त्वरित लेकिन सार्थक मूल्यांकन प्रदान करता है।

प्रभाव और विरासत

SVHN Cropped की शुरुआत ने डीप लर्निंग की उन्नति में योगदान दिया, जिससे अनुसंधान समुदाय को एक चुनौतीपूर्ण लेकिन सुलभ डेटासेट मिला। इसे हजारों पत्रों में उद्धृत किया गया है और यह कई मशीन लर्निंग पाठ्यक्रमों और ट्यूटोरियल्स का एक मानक घटक बना हुआ है। डेटासेट ने Google Street View जैसी सेवाओं से वास्तविक दुनिया के डेटा का उपयोग करने के मूल्य को भी उजागर किया, यह प्रदर्शित करते हुए कि बड़े पैमाने पर डेटा संग्रह कृत्रिम बुद्धिमत्ता में प्रगति कैसे चला सकता है।

वर्षों से, SVHN Cropped को Papers with Code जैसे विभिन्न बेंचमार्क सूट और लीडरबोर्ड में एकीकृत किया गया है, जहाँ इसका उपयोग अत्याधुनिक प्रदर्शन को ट्रैक करने के लिए जारी है। इसका प्रभाव डेटा-वृद्धि तकनीकों के विकास और डोमेन शिफ्ट के प्रति मजबूती के मूल्यांकन तक फैला हुआ है। 2020 के दशक की शुरुआत तक, SVHN Cropped एक प्रासंगिक और व्यापक रूप से उपयोग किया जाने वाला संसाधन बना हुआ है, हालाँकि अधिक जटिल कार्यों वाले नए डेटासेट उभरे हैं, फिर भी यह शोधकर्ताओं और चिकित्सकों के लिए एक मौलिक कदम के रूप में कार्य करता है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:dataset·computer-vision·deep-learning·benchmark
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास