SVHN (स्ट्रीट व्यू हाउस नंबर) डेटासेट, Google स्ट्रीट व्यू वाहनों द्वारा खींचे गए घरों के नंबरों से प्राप्त अंकों की छवियों का एक संग्रह है। इसे 2011 में Google के शोधकर्ताओं (जिनमें युवल नेटज़र, ताओ वांग, एडम कोट्स, एलेसेंड्रो बिस्साको, बो वू और एंड्रयू वाई. एनजी शामिल हैं) द्वारा हस्तलिखित अंक पहचान के लिए क्लासिक MNIST डेटासेट के अधिक चुनौतीपूर्ण और यथार्थवादी विकल्प के रूप में पेश किया गया था। SVHN में 600,000 से अधिक लेबल वाली अंक छवियां शामिल हैं, जिनमें से प्रत्येक को एक बड़ी सड़क-स्तरीय तस्वीर से क्रॉप किया गया है। यह डेटासेट प्राकृतिक, अव्यवस्थित दृश्यों में अंकों की पहचान करने के लिए एल्गोरिदम का परीक्षण करने के लिए डिज़ाइन किया गया है, जहां अंक विकृत, आंशिक रूप से अस्पष्ट, या अन्य पाठ और वस्तुओं से घिरे हो सकते हैं। यह Machine learning और Deep learning अनुसंधान में एक मानक बेंचमार्क बन गया है, जिसका उपयोग अंक वर्गीकरण, वस्तु पहचान और अनुक्रम पहचान जैसे कार्यों के लिए किया जाता है।
डेटासेट को तीन भागों में विभाजित किया गया है: 73,257 छवियों का एक प्रशिक्षण सेट, 26,032 छवियों का एक परीक्षण सेट, और 531,131 'अतिरिक्त' छवियों का एक अतिरिक्त सेट जिसका उपयोग प्रशिक्षण के लिए किया जा सकता है। प्रत्येक छवि 32x32 पिक्सेल रंग (RGB) छवि है, जो एक अंक पर केंद्रित है, लेकिन अक्सर आसन्न अंकों या अन्य दृश्य शोर के हिस्से शामिल होते हैं। लेबल वास्तविक अंक मान (0-9) हैं। SVHN अपनी वास्तविक दुनिया की उत्पत्ति के लिए उल्लेखनीय है: छवियां वास्तविक घर के नंबर पट्टिकाओं से आती हैं, जो फोंट, रंग, पृष्ठभूमि और प्रकाश स्थितियों की एक विस्तृत विविधता प्रदर्शित करती हैं। यह इसे सिंथेटिक डेटासेट की तुलना में अधिक यथार्थवादी परीक्षण मंच बनाता है, और इसका उपयोग Neural network आर्किटेक्चर, डेटा संवर्धन तकनीकों और स्थानांतरण सीखने के दृष्टिकोणों की मजबूती का मूल्यांकन करने के लिए किया गया है।
डेटासेट की विशेषताएं और चुनौतियां
MNIST के विपरीत, जहां अंक स्पष्ट रूप से लिखे और केंद्रित होते हैं, SVHN छवियों में महत्वपूर्ण दृश्य अव्यवस्था होती है। एक अंक आंशिक रूप से एक साइनपोस्ट, खिड़की या किसी अन्य अंक से अस्पष्ट हो सकता है। अंक स्वयं घुमाए जा सकते हैं, तिरछे हो सकते हैं, या अलग-अलग मोटाई के हो सकते हैं। पृष्ठभूमि में ईंट की दीवारें, दरवाजे, पत्ते या अन्य वास्तुशिल्प तत्व शामिल हो सकते हैं। ये कारक SVHN को एक अधिक कठिन वर्गीकरण कार्य बनाते हैं, जिसमें मानव-स्तरीय प्रदर्शन लगभग 98% सटीकता होने का अनुमान है, जबकि अत्याधुनिक Deep learning मॉडल ने परीक्षण सेट पर 99% से अधिक सटीकता हासिल की है। डेटासेट में प्रत्येक छवि के लिए एक 'अंक संरचना' एनोटेशन भी शामिल है, जो मूल पूर्ण छवि में सभी अंकों के बाउंडिंग बॉक्स निर्दिष्ट करता है, जो अंक स्थानीयकरण और बहु-अंक पहचान जैसे कार्यों को सक्षम बनाता है।
'अतिरिक्त' सेट अर्ध-पर्यवेक्षित सीखने के प्रयोगों के लिए विशेष रूप से उपयोगी है, क्योंकि यह अलेबल (या कमजोर रूप से लेबल) डेटा का एक बड़ा पूल प्रदान करता है। कई शोध पत्रों ने डेटा संवर्धन (जैसे, यादृच्छिक क्रॉपिंग, रोटेशन, रंग जिटर), बैच सामान्यीकरण और अवशिष्ट कनेक्शन जैसी तकनीकों की प्रभावशीलता प्रदर्शित करने के लिए SVHN का उपयोग किया है। डेटासेट अपेक्षाकृत छोटे छवि आकार और मध्यम जटिलता के कारण जनरेटिव मॉडल, जैसे Generative AI मॉडल, की बेंचमार्किंग के लिए भी एक सामान्य विकल्प है।
अनुसंधान में अनुप्रयोग
SVHN का व्यापक रूप से शैक्षणिक और औद्योगिक अनुसंधान में उपयोग किया गया है। यह छवि वर्गीकरण एल्गोरिदम के लिए एक मानक परीक्षण मंच के रूप में कार्य करता है, जिसे अक्सर तुलनात्मक अध्ययनों में MNIST और CIFAR-10 के साथ जोड़ा जाता है। 2010 के दशक की शुरुआत में, यह गहरे कन्वोल्यूशनल न्यूरल नेटवर्क (CNN) की शक्ति प्रदर्शित करने के लिए एक महत्वपूर्ण डेटासेट था। उदाहरण के लिए, 2012 में, Stanford AI Lab और अन्य संस्थानों के शोधकर्ताओं ने यह दिखाने के लिए SVHN का उपयोग किया कि गहरे CNN पारंपरिक हस्त-निर्मित फीचर विधियों से बेहतर प्रदर्शन कर सकते हैं। डेटासेट का उपयोग डोमेन अनुकूलन पर अध्ययनों में भी किया गया है, जहां सिंथेटिक डेटा (जैसे, MNIST) पर प्रशिक्षित मॉडल को वास्तविक दुनिया के डेटा (जैसे, SVHN) के अनुकूल बनाया जाता है।
वर्गीकरण के अलावा, SVHN का उपयोग वस्तु पहचान कार्यों के लिए किया जाता है, जहां लक्ष्य एक पूर्ण स्ट्रीट-व्यू छवि में सभी अंकों का पता लगाना और पहचानना है। पूर्ण छवियां (केवल क्रॉप किए गए अंक नहीं) उपलब्ध हैं, और बाउंडिंग बॉक्स एनोटेशन पहचान मॉडल को प्रशिक्षित करने की अनुमति देते हैं। इसका अनुप्रयोग स्वचालित पता पहचान में है, जो नेविगेशन सिस्टम और TomTom और Waymo जैसी मैपिंग सेवाओं के लिए प्रासंगिक है। डेटासेट का उपयोग प्रतिकूल मजबूती पर शोध में भी किया गया है, क्योंकि इसकी प्राकृतिक जटिलता इसे प्रतिकूल हमलों के लिए एक चुनौतीपूर्ण लक्ष्य बनाती है।
अन्य डेटासेट के साथ तुलना
SVHN की तुलना अक्सर MNIST से की जाती है, जिसमें 70,000 हस्तलिखित अंक (28x28 ग्रेस्केल) होते हैं। जबकि MNIST को 'हल' माना जाता है (99.7% से अधिक सटीकता वाले मॉडल के साथ), SVHN एक अधिक चुनौतीपूर्ण बेंचमार्क बना हुआ है। मुख्य अंतर हैं: (1) SVHN छवियां रंगीन और बड़ी (32x32) हैं, (2) उनमें पृष्ठभूमि अव्यवस्था होती है, (3) अंक विकृत और आंशिक रूप से अस्पष्ट हो सकते हैं, और (4) लेबल वितरण अधिक संतुलित है (MNIST में थोड़ा असंतुलन है)। SVHN CIFAR-10 डेटासेट के समान भी है, लेकिन CIFAR-10 में अंकों के बजाय सामान्य वस्तुएं (हवाई जहाज, कार, जानवर) होती हैं। वास्तविक दुनिया के परिदृश्यों में अंक पहचान में रुचि रखने वाले शोधकर्ताओं के लिए, SVHN वास्तविक मानक है।
डेटासेट का उपयोग स्वचालित दस्तावेज़ प्रसंस्करण के लिए Artificial intelligence सिस्टम के विकास में भी किया गया है, जैसे सड़क-स्तरीय इमेजरी से घर के नंबर पढ़ना। Google DeepMind और OpenAI जैसी कंपनियों ने अपने शोध में SVHN का उपयोग किया है, हालांकि यह अधिक सामान्यतः शैक्षणिक प्रयोगशालाओं से जुड़ा है। डेटासेट डाउनलोड के लिए स्वतंत्र रूप से उपलब्ध है, और इसकी लोकप्रियता के कारण इसे कई मशीन लर्निंग लाइब्रेरी और ट्यूटोरियल में शामिल किया गया है।
भविष्य की दिशाएं और सीमाएं
जबकि SVHN एक मूल्यवान संसाधन है, इसकी सीमाएं हैं। छवियां अपेक्षाकृत कम-रिज़ॉल्यूशन (32x32) हैं, जो बारीक विवरणों को कैप्चर नहीं कर सकती हैं। डेटासेट केवल अंकों तक सीमित है, इसलिए यह अक्षरों या अन्य वर्णों को कवर नहीं करता है। शोधकर्ताओं ने एक्सटेंशन बनाए हैं, जैसे 'SVHN फुल' डेटासेट, जिसमें बिना क्रॉपिंग के मूल पूर्ण छवियां शामिल हैं। 2020 के दशक के मध्य तक, SVHN अभी भी व्यापक रूप से उपयोग किया जाता है, लेकिन अधिक जटिल कार्यों के लिए Google का 'स्ट्रीट व्यू टेक्स्ट' या विभिन्न दृश्य-पाठ डेटासेट जैसे नए डेटासेट उभरे हैं। फिर भी, SVHN Computer vision और Deep learning के बारे में सीखने वाले छात्रों और शोधकर्ताओं के लिए एक मानक प्रवेश बिंदु बना हुआ है। इसकी सादगी, वास्तविक दुनिया की जटिलता के साथ मिलकर, इसे नए एल्गोरिदम के प्रोटोटाइप और शैक्षिक उद्देश्यों के लिए एक आदर्श डेटासेट बनाती है।