MNIST डेटाबेस (संशोधित राष्ट्रीय मानक और प्रौद्योगिकी संस्थान डेटाबेस) हस्तलिखित अंकों का एक बड़ा डेटाबेस है जिसका उपयोग आमतौर पर विभिन्न छवि प्रसंस्करण प्रणालियों के प्रशिक्षण के लिए किया जाता है। यह मशीन-लर्निंग के क्षेत्र में प्रशिक्षण और परीक्षण के लिए भी व्यापक रूप से उपयोग किया जाता है। डेटाबेस NIST के मूल डेटासेट से नमूनों को "पुनः-मिश्रित" करके बनाया गया था, क्योंकि निर्माताओं ने महसूस किया कि मूल प्रशिक्षण डेटासेट, जो अमेरिकी जनगणना ब्यूरो के कर्मचारियों से लिया गया था, और परीक्षण डेटासेट, जो अमेरिकी हाई स्कूल के छात्रों से लिया गया था, मशीन-लर्निंग प्रयोगों के लिए उपयुक्त नहीं थे। NIST से प्राप्त काले और सफेद छवियों को 28x28 पिक्सेल बाउंडिंग बॉक्स में फिट करने के लिए सामान्यीकृत किया गया और एंटी-अलियास किया गया, जिससे ग्रेस्केल स्तर शामिल हुए।
MNIST डेटाबेस में 60,000 प्रशिक्षण छवियां और 10,000 परीक्षण छवियां शामिल हैं। प्रशिक्षण सेट का आधा और परीक्षण सेट का आधा हिस्सा NIST के प्रशिक्षण डेटासेट से लिया गया था, जबकि प्रत्येक का दूसरा आधा हिस्सा NIST के परीक्षण डेटासेट से आया था। मूल निर्माता इस पर परीक्षण किए गए तरीकों की एक सूची बनाए रखते हैं; अपने मूल पेपर में, उन्होंने 0.8% की त्रुटि दर प्राप्त करने के लिए एक सपोर्ट-वेक्टर मशीन का उपयोग किया। मूल MNIST डेटासेट में कम से कम चार गलत लेबल हैं।
इतिहास
USPS डेटाबेस
1988 में, अमेरिकी डाक सेवा से अंकों का एक डेटासेट बनाया गया था। इसमें न्यूयॉर्क के बफ़ेलो डाकघर से गुजरने वाले अमेरिकी मेल पर हस्तलिखित ज़िप कोड से डिजिटलीकृत 16×16 ग्रेस्केल छवियां शामिल थीं। प्रशिक्षण सेट में 7,291 छवियां थीं, और परीक्षण सेट में 2,007, कुल 9,298 थे। दोनों सेटों में अस्पष्ट, अवर्गीकृत और गलत वर्गीकृत डेटा शामिल था। इस डेटासेट का उपयोग 1989 के LeNet को प्रशिक्षित और बेंचमार्क करने के लिए किया गया था। कार्य कठिन था; परीक्षण सेट पर, दो मनुष्यों ने औसतन 2.5% की दर से त्रुटियां कीं।
विशेष डेटाबेस
1980 के दशक के अंत में, जनगणना ब्यूरो हस्तलिखित जनगणना फॉर्मों के स्वचालित डिजिटलीकरण में रुचि रखता था और OCR प्रणालियों का मूल्यांकन करने के लिए NIST में छवि पहचान समूह (IRG) को शामिल किया। कई वर्षों के काम के परिणामस्वरूप कई "विशेष डेटाबेस" और बेंचमार्क बने। MNIST के लिए विशेष रूप से महत्वपूर्ण हैं विशेष डेटाबेस 1 (SD-1), मई 1990 में जारी, विशेष डेटाबेस 3 (SD-3), फरवरी 1992 में जारी, और विशेष डेटाबेस 7 (SD-7), या NIST परीक्षण डेटा 1 (TD-1), अप्रैल 1992 में जारी। वे ISO-9660 CD-ROM पर जारी किए गए थे। डेटा लोगों से "हस्तलेखन नमूना फॉर्म" (HSF) पर लिखने के लिए कहकर प्राप्त किया गया था, फिर फॉर्मों को डिजिटलीकृत करके और अल्फ़ान्यूमेरिकल वर्णों को खंडित करके प्राप्त किया गया था। प्रत्येक लेखक ने एक एकल HSF लिखा।
प्रत्येक HSF में कई प्रविष्टि क्षेत्र शामिल हैं, जिनमें नाम और तिथि प्रविष्टियां, एक शहर/राज्य क्षेत्र, 28 अंक क्षेत्र, एक अपर-केस क्षेत्र, एक लोअर-केस क्षेत्र, और एक अप्रतिबंधित संविधान पाठ अनुच्छेद शामिल हैं। प्रत्येक HSF को 300 डॉट प्रति इंच (11.8 डॉट प्रति मिलीमीटर) के रिज़ॉल्यूशन पर स्कैन किया गया था।
SD-1 और SD-3 1990 संयुक्त राज्य जनगणना के हिस्से के रूप में 3,400 स्थायी जनगणना क्षेत्र कर्मचारियों में से 2,100 द्वारा HSF के समान सेट से बनाए गए थे। SD-1 में खंडित डेटा प्रविष्टि क्षेत्र शामिल थे, लेकिन खंडित अल्फ़ान्यूमेरिकल नहीं। SD-3 में खंडित अल्फ़ान्यूमेरिकल से डिजिटलीकृत बाइनरी 128×128 छवियां शामिल थीं, जिनमें 223,125 अंक, 44,951 अपर-केस अक्षर और 45,313 लोअर-केस अक्षर थे।
SD-7 (या TD-1) परीक्षण सेट था, जिसमें बेथेस्डा, मैरीलैंड में 500 हाई स्कूल के छात्रों द्वारा लिखी गई 58,646 128×128 बाइनरी छवियां शामिल थीं, जिन्हें "कक्षा के दौरान एक छोटे अभ्यास के रूप में एक हाई स्कूल में गणित और विज्ञान के छात्र" के रूप में वर्णित किया गया था। प्रत्येक छवि के साथ लेखक की पहचान के लिए एक अद्वितीय पूर्णांक ID थी। SD-7 को CD-ROM पर बिना लेबल के जारी किया गया था, लेबल बाद में फ्लॉपी ड्राइव पर जारी किए गए। इसमें HSF शामिल नहीं थे। SD-7 पर मानव त्रुटि दर 1.5% थी।
SD-3 SD-7 की तुलना में बहुत साफ और पहचानने में आसान था। यूरोपीय क्रॉस किया हुआ सात (7) SD-7 में SD-3 की तुलना में कहीं अधिक प्रचुर मात्रा में था। संदेह था कि SD-3 SD-7 की तुलना में अधिक प्रेरित लोगों द्वारा बनाया गया था, और SD-3 के लिए कैरेक्टर सेगमेंटर, एक पुराना डिज़ाइन, अधिक बार विफल हुआ, जिससे कठिन उदाहरण फ़िल्टर हो गए। SD-3 पर प्रशिक्षित और मान्य किए गए मशीन-लर्निंग सिस्टम ने SD-7 पर प्रदर्शन में महत्वपूर्ण गिरावट का अनुभव किया, त्रुटि दर 1% से कम से लगभग 10% तक।
1992 में, NIST और जनगणना ब्यूरो ने कला की स्थिति निर्धारित करने के लिए एक प्रतियोगिता और सम्मेलन प्रायोजित किया। टीमों को 23 मार्च से पहले प्रशिक्षण सेट के रूप में SD-3, 13 अप्रैल से पहले परीक्षण सेट के रूप में SD-7 दिया गया था, और 27 अप्रैल से पहले SD-7 को वर्गीकृत करने के लिए सिस्टम जमा करना होगा। 7 देशों की 26 कंपनियों से कुल 45 एल्गोरिदम जमा किए गए। 27 और 28 मई को, सभी पक्ष गैथर्सबर्ग, मैरीलैंड में पहले जनगणना OCR सिस्टम सम्मेलन में एकत्र हुए, जिसमें FBI, IRS और USPS के पर्यवेक्षक थे। विजेता प्रविष्टि ने प्रशिक्षण के लिए SD-3 का उपयोग नहीं किया, बल्कि एक बहुत बड़ा स्वामित्व प्रशिक्षण सेट इस्तेमाल किया, जिससे वितरण बदलाव से बचा गया। SD-3 का उपयोग करने वाली 25 प्रविष्टियों में से, विजेता एक निकटतम-पड़ोसी वर्गीकरणकर्ता था जो यूक्लिडियन परिवर्तनों के लिए अपरिवर्तनीय एक हस्तनिर्मित मीट्रिक का उपयोग करता था।
SD-19 1995 में SD-1, SD-3, SD-7 और आगे के डेटा के संकलन के रूप में प्रकाशित किया गया था। इसमें अल्फ़ान्यूमेरिकल की 814,255 बाइनरी छवियां और 4,169 HSF की बाइनरी छवियां शामिल थीं, जिनमें SD-7 उत्पन्न करने के लिए उपयोग किए गए 500 HSF शामिल थे। इसे 2016 में अद्यतन किया गया था।
MNIST का निर्माण
MNIST 1994 की गर्मियों से पहले किसी समय SD-3 और SD-7 से 128x128 बाइनरी छवियों को मिश्रित करके बनाया गया था। विशेष रूप से, निर्माताओं ने पहले SD-7 से सभी छवियां लीं और उन्हें प्रशिक्षण सेट और परीक्षण सेट में विभाजित किया, प्रत्येक 250 लेखकों से, जिसके परिणामस्वरूप प्रत्येक सेट में लगभग 30,000 छवियां थीं। फिर उन्होंने SD-3 से अधिक छवियां जोड़ीं जब तक कि प्रत्येक सेट में ठीक 60,000 छवियां नहीं थीं।
प्रत्येक छवि को उसके पहलू अनुपात को बनाए रखते हुए 20x20 पिक्सेल बॉक्स में फिट करने के लिए आकार-सामान्यीकृत किया गया था, और ग्रेस्केल में एंटी-अलियास किया गया था। फिर इसे पिक्सेल के द्रव्यमान का केंद्र छवि के केंद्र में होने तक अनुवाद करके 28x28 छवि में रखा गया था। डाउनसैंपलिंग प्रक्रिया के विवरण बाद में पुनर्निर्मित किए गए थे।
प्रशिक्षण सेट और परीक्षण सेट दोनों में मूल रूप से 60,000 नमूने थे, लेकिन परीक्षण सेट के 50,000 नमूनों को त्याग दिया गया था, केवल सूचकांक 24,476 से 34,475 तक के नमूने छोड़े गए, जिससे परीक्षण सेट में केवल 10,000 नमूने रह गए।
आगे के संस्करण
2019 में, QMNIST का निर्माण करने के लिए MNIST से पूर्ण 60,000 परीक्षण सेट बहाल किया गया था, जिसमें प्रशिक्षण सेट में 60,000 छवियां और परीक्षण सेट में 60,000 छवियां हैं।
विस्तारित MNIST (EMNIST) एक नया डेटासेट है जिसे NIST द्वारा MNIST के उत्तराधिकारी के रूप में विकसित और जारी किया गया था, जो 2017 में जारी किया गया था। जबकि MNIST में केवल हस्तलिखित अंक शामिल थे, EMNIST SD-19 में सभी छवियों से बनाया गया था, जिसमें अक्षर और अंक शामिल हैं, और डीप-लर्निंग और कृत्रिम-बुद्धिमत्ता अनुसंधान के लिए एक अधिक चुनौतीपूर्ण बेंचमार्क प्रदान करता है।
विरासत
MNIST मशीन-लर्निंग शिक्षा और अनुसंधान में एक मौलिक बेंचमार्क बन गया है, जिसे अक्सर नए एल्गोरिदम और आर्किटेक्चर के लिए पहले परीक्षण के रूप में उपयोग किया जाता है। इसकी सरलता और छोटा आकार इसे तंत्रिका-नेटवर्क प्रशिक्षण और मूल्यांकन में अवधारणाओं को सिखाने के लिए आदर्श बनाता है। डेटासेट की व्यापक स्वीकृति ने बाद के बेंचमार्क के विकास को प्रभावित किया है और क्षेत्र के विकास में योगदान दिया है, जिसमें डीप-लर्निंग और जनरेटिव-एआई में प्रगति शामिल है।