अंग्रेज़ी से अनुवादित

SVHN Full गूगल स्ट्रीट व्यू हाउस नंबरों से 604,388 लेबल वाले अंक छवियों का एक डेटासेट है, जो प्रत्येक अंक के चारों ओर बाउंडिंग बॉक्स के साथ पूर्ण छवियाँ प्रदान करता है, जिसका उपयोग ऑब्जेक्ट डिटेक्शन और पहचान कार्यों के लिए किया जाता है।

SVHN Full कंप्यूटर विज़न में व्यापक रूप से उपयोग किया जाने वाला बेंचमार्क डेटासेट है, जो गूगल स्ट्रीट व्यू की घरों के नंबरों की इमेजरी से प्राप्त हुआ है। इसमें 600,000 से अधिक लेबल किए गए अंकों की छवियाँ शामिल हैं, जिनमें से प्रत्येक को एक या अधिक अंकों के साथ पूर्ण दृश्य के रूप में प्रस्तुत किया गया है, साथ ही बाउंडिंग बॉक्स एनोटेशन भी हैं जो छवि के भीतर प्रत्येक अंक को स्थानीयकृत करते हैं। यह इसे सरल SVHN (क्रॉप्ड) डेटासेट से अलग करता है, जो पहले से केंद्रित एकल अंक प्रदान करता है। SVHN Full को अंकों का पता लगाने, पहचानने और एंड-टू-एंड दृश्य समझ जैसे कार्यों के लिए डिज़ाइन किया गया है, जो इसे मशीन लर्निंग मॉडल के लिए एक मानक परीक्षण मंच बनाता है।

इस डेटासेट को 2011 में स्टैनफोर्ड विश्वविद्यालय और गूगल के शोधकर्ताओं द्वारा "Reading Digits in Natural Images with Unsupervised Feature Learning" शीर्षक वाले एक पेपर के भाग के रूप में पेश किया गया था। प्राथमिक प्रेरणा MNIST डेटासेट के लिए एक वास्तविक दुनिया का विकल्प बनाना था, जिसमें हस्तलिखित अंक होते हैं। MNIST के विपरीत, SVHN छवियों में प्रकाश, परिप्रेक्ष्य और पृष्ठभूमि की अव्यवस्था में प्राकृतिक भिन्नताएँ होती हैं, जो उन्हें अधिक चुनौतीपूर्ण और स्वचालित पता पढ़ने या लाइसेंस प्लेट पहचान जैसे व्यावहारिक अनुप्रयोगों के करीब बनाती हैं।

डेटासेट संरचना

SVHN Full में कुल 604,388 लेबल किए गए चित्र शामिल हैं। आधिकारिक विभाजन में प्रशिक्षण के लिए 73,257 चित्र, परीक्षण के लिए 26,032 चित्र और अतिरिक्त प्रशिक्षण डेटा के लिए 531,061 चित्र शामिल हैं, जिन्हें पूरक के रूप में उपयोग किया जा सकता है। प्रत्येक चित्र 32x32 पिक्सेल का RGB रंगीन चित्र है, हालाँकि पूर्ण दृश्यों में अक्सर ऐसे अंक होते हैं जो फ्रेम के केवल एक छोटे हिस्से पर कब्जा करते हैं। बाउंडिंग बॉक्स एनोटेशन प्रत्येक अंक के निर्देशांक निर्दिष्ट करते हैं, साथ ही 0 से 9 तक का एक वर्ग लेबल भी। डेटासेट में सत्यापन उद्देश्यों के लिए 10,000 चित्रों का एक अलग सेट भी शामिल है, हालाँकि यह मानक बेंचमार्क में कम उपयोग किया जाता है।

अंक गूगल स्ट्रीट व्यू छवियों में घरों के नंबरों से निकाले गए हैं, जिसका अर्थ है कि वे विभिन्न फ़ॉन्ट, रंगों और अभिविन्यासों में दिखाई देते हैं। कुछ छवियों में कई अंक होते हैं, और प्रति छवि अंकों की संख्या एक से पाँच या अधिक तक हो सकती है। इस परिवर्तनशीलता के लिए मॉडलों को न केवल अंकों को वर्गीकृत करने की आवश्यकता होती है, बल्कि उन्हें दृश्य के भीतर सटीक रूप से स्थानीयकृत करने की भी आवश्यकता होती है।

कार्य और मूल्यांकन

SVHN Full से जुड़ा प्राथमिक कार्य वस्तु का पता लगाना और पहचानना है। एक मॉडल को प्रत्येक छवि के लिए बाउंडिंग बॉक्स और संबंधित अंक वर्गों का एक सेट भविष्यवाणी करना चाहिए। मूल्यांकन आमतौर पर स्थानीयकरण सटीकता को मापने के लिए इंटरसेक्शन-ओवर-यूनियन (IoU) मीट्रिक का उपयोग करता है, साथ ही वर्गीकरण सटीकता के साथ। एक सामान्य प्रोटोकॉल यह है कि किसी डिटेक्शन को सही मानने के लिए IoU 0.5 से अधिक होना आवश्यक है, और फिर परीक्षण सेट पर परिशुद्धता और रिकॉल की गणना की जाती है।

व्यवहार में, कई अध्ययन कन्वोल्यूशनल न्यूरल नेटवर्क (CNN) और ट्रांसफॉर्मर जैसे अधिक हाल के आर्किटेक्चर की तुलना करने के लिए SVHN Full को बेंचमार्क के रूप में उपयोग करते हैं। डेटासेट का उपयोग अक्सर क्रॉप्ड SVHN संस्करण के साथ किया जाता है, जो शुद्ध वर्गीकरण से डिटेक्शन घटक को अलग करने के लिए एकल अंकों को अलग करता है। SVHN Full पर अत्याधुनिक परिणाम इसकी रिलीज़ के बाद से काफी सुधर गए हैं, आधुनिक डीप लर्निंग मॉडल क्रॉप्ड संस्करण पर 99% से अधिक सटीकता और पूर्ण संस्करण पर लगभग सही डिटेक्शन दर प्राप्त कर रहे हैं।

अन्य डेटासेट से संबंध

SVHN Full अंक पहचान डेटासेट के एक परिवार का हिस्सा है जिसमें MNIST, USPS और क्रॉप्ड SVHN शामिल हैं। इसका उपयोग अक्सर वास्तविक दुनिया के शोर और विरूपण के प्रति मॉडलों की मजबूती का मूल्यांकन करने के लिए MNIST के अधिक चुनौतीपूर्ण विकल्प के रूप में किया जाता है। डेटासेट को "Street View House Numbers" चैलेंज जैसे बड़े बेंचमार्क में भी शामिल किया गया है, जो कागल पर होस्ट किया गया था और हजारों प्रतिभागियों को आकर्षित किया था। इसके अलावा, SVHN Full का उपयोग अनुपयोगी और अर्ध-पर्यवेक्षित शिक्षण पर शोध में किया गया है, क्योंकि अतिरिक्त प्रशिक्षण सेट बड़ी मात्रा में अलेबल या कमजोर लेबल वाला डेटा प्रदान करता है जिसका लाभ उठाया जा सकता है।

डेटासेट आधिकारिक स्टैनफोर्ड वेबसाइट से सार्वजनिक रूप से डाउनलोड के लिए उपलब्ध है और टेंसरफ्लो और पायटॉर्च जैसी लोकप्रिय मशीन लर्निंग लाइब्रेरीज़ में शामिल है, जिससे यह प्रयोग के लिए आसानी से सुलभ हो जाता है। इसके व्यापक उपयोग ने डेटा ऑग्मेंटेशन, Batch Normalization और अवशिष्ट नेटवर्क जैसी तकनीकों के विकास में योगदान दिया है, जो अब कंप्यूटर विज़न में मानक हैं।

चुनौतियाँ और सीमाएँ

अपनी लोकप्रियता के बावजूद, SVHN Full की कुछ सीमाएँ हैं। छवियाँ अपेक्षाकृत कम-रिज़ॉल्यूशन (32x32) हैं, जो 3 और 8 जैसे समान अंकों के बीच अंतर करना मुश्किल बना सकती हैं, खासकर जब वे छोटे या आंशिक रूप से अस्पष्ट हों। डेटासेट में वर्ग असंतुलन भी है, जिसमें अंक '0' अन्य की तुलना में अधिक बार होता है, हालाँकि यह कुछ अन्य डेटासेट की तुलना में कम स्पष्ट है। इसके अतिरिक्त, क्योंकि छवियाँ स्ट्रीट व्यू से प्राप्त होती हैं, उनमें भौगोलिक स्थान और भवन प्रकारों से संबंधित पूर्वाग्रह हो सकते हैं, जो अन्य डोमेन में सामान्यीकरण को प्रभावित कर सकते हैं।

एक और चुनौती यह है कि बाउंडिंग बॉक्स एनोटेशन हमेशा सटीक नहीं होते हैं, और कुछ छवियों में ऐसे अंक होते हैं जो किनारों पर आंशिक रूप से कटे हुए होते हैं। इससे मूल्यांकन में अस्पष्टताएँ उत्पन्न हो सकती हैं। शोधकर्ताओं ने परिष्कृत एनोटेशन प्रोटोकॉल प्रस्तावित करके या सिंथेटिक डेटा जनरेशन तकनीकों के साथ संयोजन में डेटासेट का उपयोग करके इन मुद्दों को संबोधित किया है।

अनुप्रयोग और प्रभाव

SVHN Full ने वस्तु पहचान के लिए डीप लर्निंग के क्षेत्र को आगे बढ़ाने में महत्वपूर्ण भूमिका निभाई है। इसका उपयोग स्वचालित नंबर प्लेट पहचान, पोस्टल कोड पढ़ने और अन्य अंक-भारी कार्यों के लिए मॉडलों को प्रशिक्षित करने के लिए किया गया है। डेटासेट सिंथेटिक डेटा पर प्रशिक्षित मॉडलों की स्थानांतरण क्षमता का मूल्यांकन करने के साथ-साथ अनुपयोगी फीचर लर्निंग विधियों की प्रभावशीलता का परीक्षण करने के लिए एक बेंचमार्क के रूप में भी कार्य करता है। इसकी वास्तविक दुनिया की प्रकृति इसे अनियंत्रित वातावरण में काम करने वाले मजबूत एल्गोरिदम विकसित करने के लिए एक मूल्यवान संसाधन बनाती है।

SVHN Full की रिलीज़ डीप लर्निंग के उदय और शक्तिशाली GPU की उपलब्धता के साथ हुई, और इसे हजारों शोध पत्रों में उद्धृत किया गया है। यह शैक्षिक उद्देश्यों के लिए एक मानक विकल्प बना हुआ है, जो छात्रों और चिकित्सकों को एक प्रबंधनीय लेकिन यथार्थवादी सेटिंग में अत्याधुनिक तकनीकों के साथ प्रयोग करने की अनुमति देता है। 2025 तक, यह एक प्रासंगिक डेटासेट बना हुआ है, हालाँकि ऑग्मेंटेड संस्करण या सिंथेटिक दृश्यों जैसे नए डेटासेट अधिक जटिल कार्यों के लिए तेजी से उपयोग किए जा रहे हैं।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:computer-vision·dataset·object-detection·digit-recognition
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास