MNIST डेटाबेस (संशोधित राष्ट्रीय मानक और प्रौद्योगिकी संस्थान डेटाबेस) हस्तलिखित अंकों का एक बड़ा डेटाबेस है जिसका उपयोग आमतौर पर विभिन्न छवि प्रसंस्करण प्रणालियों के प्रशिक्षण के लिए किया जाता है। यह डेटाबेस मशीन-लर्निंग के क्षेत्र में प्रशिक्षण और परीक्षण के लिए भी व्यापक रूप से उपयोग किया जाता है। इसे NIST के मूल डेटासेट के नमूनों को "पुनः-मिश्रित" करके बनाया गया था। रचनाकारों ने महसूस किया कि चूंकि NIST का प्रशिक्षण डेटासेट अमेरिकी जनगणना ब्यूरो के कर्मचारियों से लिया गया था, जबकि परीक्षण डेटासेट अमेरिकी हाई स्कूल के छात्रों से लिया गया था, यह मशीन लर्निंग प्रयोगों के लिए उपयुक्त नहीं था। इसके अलावा, NIST की काले और सफेद छवियों को 28x28 पिक्सेल बाउंडिंग बॉक्स में फिट करने के लिए सामान्यीकृत किया गया था और एंटी-अलियास किया गया था, जिससे ग्रेस्केल स्तर पेश किए गए।
MNIST डेटाबेस में 60,000 प्रशिक्षण छवियां और 10,000 परीक्षण छवियां हैं। प्रशिक्षण सेट का आधा और परीक्षण सेट का आधा हिस्सा NIST के प्रशिक्षण डेटासेट से लिया गया था, जबकि प्रशिक्षण सेट का दूसरा आधा और परीक्षण सेट का दूसरा आधा हिस्सा NIST के परीक्षण डेटासेट से लिया गया था। डेटाबेस के मूल रचनाकार इस पर परीक्षण की गई कुछ विधियों की सूची रखते हैं। अपने मूल पेपर में, उन्होंने 0.8% की त्रुटि दर प्राप्त करने के लिए सपोर्ट-वेक्टर मशीन का उपयोग किया। मूल MNIST डेटासेट में कम से कम 4 गलत लेबल हैं।
इतिहास
MNIST का विकास कई संबंधित डेटासेट और बेंचमार्क से पहले हुआ था। 1988 में, यूएस डाक सेवा से अंकों का एक डेटासेट बनाया गया था, जिसमें बफ़ेलो, न्यूयॉर्क डाकघर से गुजरने वाले अमेरिकी मेल पर हस्तलिखित ज़िप कोड से डिजीटल की गई 16x16 ग्रेस्केल छवियां शामिल थीं। प्रशिक्षण सेट में 7,291 छवियां थीं, और परीक्षण सेट में 2,007 थीं, जिससे कुल 9,298 हो गए। प्रशिक्षण और परीक्षण दोनों सेटों में अस्पष्ट, अवर्गीकृत और गलत वर्गीकृत डेटा शामिल था। डेटासेट का उपयोग 1989 के LeNet को प्रशिक्षित और बेंचमार्क करने के लिए किया गया था, जो एक अग्रणी तंत्रिका-नेटवर्क है। परीक्षण सेट पर, दो मनुष्यों ने औसतन 2.5% की दर से त्रुटियां कीं।
विशेष डेटाबेस
1980 के दशक के अंत में, जनगणना ब्यूरो हस्तलिखित जनगणना प्रपत्रों के स्वचालित डिजिटलीकरण में रुचि रखता था, इसलिए उसने OCR प्रणालियों का मूल्यांकन करने के लिए NIST में छवि पहचान समूह (IRG) को नियुक्त किया। कई वर्षों के काम के परिणामस्वरूप कई "विशेष डेटाबेस" और बेंचमार्क बने। MNIST के लिए विशेष रूप से महत्वपूर्ण हैं विशेष डेटाबेस 1 (SD-1), मई 1990 में जारी, विशेष डेटाबेस 3 (SD-3), फरवरी 1992 में जारी, और विशेष डेटाबेस 7 (SD-7), या NIST परीक्षण डेटा 1 (TD-1), अप्रैल 1992 में जारी। वे ISO-9660 CD-ROM पर जारी किए गए थे। वे लोगों से "हस्तलेखन नमूना प्रपत्र" (HSF) पर लिखने के लिए कहकर, फिर HSF को डिजीटल करके, फिर अल्फ़ान्यूमेरिकल वर्णों को खंडित करके प्राप्त किए गए थे। प्रत्येक लेखक ने एक HSF लिखा।
प्रत्येक HSF में कई प्रविष्टि क्षेत्र होते हैं, जिनमें लोगों को लिखने के लिए कहा गया था। 34 क्षेत्र हैं: नाम और तिथि प्रविष्टियां, एक शहर/राज्य क्षेत्र, 28 अंक क्षेत्र, एक अपरकेस क्षेत्र, एक लोअरकेस क्षेत्र, और एक अप्रतिबंधित संविधान पाठ अनुच्छेद। प्रत्येक HSF को 300 डॉट्स प्रति इंच (11.8 डॉट्स प्रति मिलीमीटर) के रिज़ॉल्यूशन पर स्कैन किया गया था। SD-1 और SD-3 1990 की संयुक्त राज्य जनगणना के हिस्से के रूप में 3,400 स्थायी जनगणना क्षेत्र कार्यकर्ताओं में से 2,100 द्वारा HSF के समान सेट से बनाए गए थे। SD-1 में खंडित डेटा प्रविष्टि क्षेत्र शामिल थे, लेकिन खंडित अल्फ़ान्यूमेरिकल नहीं। SD-3 में खंडित अल्फ़ान्यूमेरिकल से डिजीटल की गई बाइनरी 128x128 छवियां शामिल थीं, जिनमें 223,125 अंक, 44,951 अपरकेस अक्षर और 45,313 लोअरकेस अक्षर थे।
SD-7 या TD-1 परीक्षण सेट था, और इसमें बेथेस्डा, मैरीलैंड में 500 हाई स्कूल के छात्रों द्वारा लिखी गई 58,646 128x128 बाइनरी छवियां शामिल थीं। उन्हें "कक्षा के दौरान एक छोटे अभ्यास के रूप में एक हाई स्कूल में गणित और विज्ञान के छात्र" के रूप में वर्णित किया गया था। प्रत्येक छवि के साथ उसके लेखक की पहचान के लिए एक अद्वितीय पूर्णांक ID होती है। SD-7 बिना लेबल के CD-ROM पर जारी किया गया था, और लेबल बाद में फ्लॉपी ड्राइव पर जारी किए गए थे। इसमें HSF शामिल नहीं थे। SD-7 इतना कठिन था कि इस पर मानव त्रुटि दर 1.5% थी। SD-3 SD-7 की छवियों की तुलना में बहुत साफ और पहचानने में आसान था। यूरोपीय क्रॉस्ड सात (7) SD-7 में SD-3 की तुलना में कहीं अधिक प्रचुर मात्रा में है। यह संदेह था कि SD-3 उन लोगों द्वारा तैयार किया गया था जो SD-7 का उत्पादन करने वालों की तुलना में अधिक प्रेरित थे। साथ ही, SD-3 के लिए वर्ण विभाजक SD-7 की तुलना में एक पुराना डिज़ाइन था, और अधिक बार विफल रहा। यह संदेह था कि कठिन उदाहरणों को SD-3 के निर्माण से फ़िल्टर कर दिया गया था, क्योंकि कठिन उदाहरण विभाजक से गुजरने में भी विफल रहे। यह पाया गया कि SD-3 पर प्रशिक्षित और मान्य किए गए मशीन लर्निंग सिस्टम ने SD-7 पर प्रदर्शन में महत्वपूर्ण गिरावट का अनुभव किया, 1% से कम की त्रुटि दर से लगभग 10% तक।
1992 में, NIST और जनगणना ब्यूरो ने इस उद्योग में कला की स्थिति निर्धारित करने के लिए एक प्रतियोगिता और एक सम्मेलन प्रायोजित किया। प्रतियोगिता में, टीमों को 23 मार्च से पहले प्रशिक्षण सेट के रूप में SD-3, 13 अप्रैल से पहले परीक्षण सेट के रूप में SD-7 दिया गया था, और 27 अप्रैल से पहले SD-7 को वर्गीकृत करने के लिए एक या अधिक सिस्टम जमा करेंगे। 7 विभिन्न देशों की 26 कंपनियों से कुल 45 एल्गोरिदम जमा किए गए थे। 27 और 28 मई को, परिणाम जमा करने वाले सभी पक्ष गैथर्सबर्ग, मैरीलैंड में पहले जनगणना OCR सिस्टम सम्मेलन में एकत्र हुए। FBI, IRS और USPS के पर्यवेक्षक उपस्थित थे। विजेता प्रविष्टि ने प्रशिक्षण के लिए SD-3 का उपयोग नहीं किया, बल्कि एक बहुत बड़ा स्वामित्व प्रशिक्षण सेट इस्तेमाल किया, इस प्रकार वितरण बदलाव से प्रभावित नहीं हुआ। प्रशिक्षण के लिए SD-3 का उपयोग करने वाली 25 प्रविष्टियों में से, विजेता प्रविष्टि एक निकटतम-पड़ोसी वर्गीकरणकर्ता थी जो यूक्लिडियन परिवर्तनों के लिए अपरिवर्तनीय एक हस्तनिर्मित मीट्रिक का उपयोग करती थी।
SD-19 1995 में प्रकाशित किया गया था, जो SD-1, SD-3, SD-7 और कुछ और डेटा का संकलन था। इसमें अल्फ़ान्यूमेरिकल की 814,255 बाइनरी छवियां और 4,169 HSF की बाइनरी छवियां शामिल थीं, जिनमें वे 500 HSF भी शामिल थे जिनका उपयोग SD-7 उत्पन्न करने के लिए किया गया था। इसे 2016 में अद्यतन किया गया था।
MNIST
MNIST का निर्माण गर्मियों 1994 से कुछ समय पहले किया गया था। इसे SD-3 और SD-7 से 128x128 बाइनरी छवियों को मिलाकर बनाया गया था। विशेष रूप से, उन्होंने पहले SD-7 से सभी छवियां लीं और उन्हें एक प्रशिक्षण सेट और एक परीक्षण सेट में विभाजित किया, प्रत्येक 250 लेखकों से। इसके परिणामस्वरूप प्रत्येक सेट में लगभग 30,000 छवियां आईं। फिर उन्होंने SD-3 से अधिक छवियां तब तक जोड़ीं जब तक कि प्रत्येक सेट में ठीक 60,000 छवियां नहीं हो गईं।
प्रत्येक छवि को उनके पहलू अनुपात को संरक्षित करते हुए 20x20 पिक्सेल बॉक्स में फिट करने के लिए आकार-सामान्यीकृत किया गया था, और ग्रेस्केल के लिए एंटी-अलियास किया गया था। फिर इसे पिक्सेल के द्रव्यमान के केंद्र को छवि के केंद्र में रखने के लिए अनुवाद करके 28x28 छवि में रखा गया था। डाउनसैंपलिंग कैसे आगे बढ़ी इसका विवरण फिर से बनाया गया था। प्रशिक्षण सेट और परीक्षण सेट दोनों में मूल रूप से 60k नमूने थे, लेकिन परीक्षण सेट के 50k नमूनों को त्याग दिया गया था, और केवल 24476 से 34475 तक अनुक्रमित नमूनों का उपयोग किया गया था, जिससे परीक्षण सेट में केवल 10k नमूने मिले।
आगे के संस्करण
2019 में, QMNIST का निर्माण करने के लिए MNIST से पूर्ण 60k परीक्षण सेट बहाल किया गया था, जिसमें प्रशिक्षण सेट में 60k छवियां और परीक्षण सेट में 60k हैं। विस्तारित MNIST (EMNIST) एक नया डेटासेट है जिसे NIST द्वारा MNIST के (अंतिम) उत्तराधिकारी के रूप में विकसित और जारी किया गया था, जो 2017 में जारी किया गया था। MNIST में केवल हस्तलिखित अंकों की छवियां शामिल थीं। EMNIST SD-19 की सभी छवियों से बनाया गया था, जिसमें अंकों के साथ-साथ अक्षर भी शामिल थे, और यह गहन-शिक्षण और कृत्रिम-बुद्धिमत्ता अनुसंधान के लिए एक अधिक चुनौतीपूर्ण बेंचमार्क प्रदान करता है।