MNIST डेटाबेस (संशोधित राष्ट्रीय मानक और प्रौद्योगिकी संस्थान डेटाबेस) हस्तलिखित अंकों की छवियों का एक बड़ा संग्रह है, जिसका उपयोग आमतौर पर छवि प्रसंस्करण और मशीन लर्निंग प्रणालियों के प्रशिक्षण और परीक्षण के लिए किया जाता है। मूल NIST डेटासेट के नमूनों को पुनः मिश्रित करके निर्मित, इसे NIST के प्रशिक्षण डेटा की सीमाओं को संबोधित करने के लिए डिज़ाइन किया गया था, जो अमेरिकी जनगणना ब्यूरो के कर्मचारियों से आया था, और इसका परीक्षण डेटा, अमेरिकी हाई स्कूल के छात्रों से, जो मशीन लर्निंग प्रयोगों के लिए अनुपयुक्त बना दिया। काले और सफेद छवियों को 28x28 पिक्सेल बाउंडिंग बॉक्स में सामान्यीकृत किया गया और एंटी-अलियास किया गया, जिससे ग्रेस्केल स्तर पेश किए गए।
MNIST में 60,000 प्रशिक्षण छवियां और 10,000 परीक्षण छवियां शामिल हैं, जिनमें प्रत्येक सेट का आधा NIST के प्रशिक्षण डेटा से और आधा इसके परीक्षण डेटा से लिया गया है। निर्माता डेटासेट पर परीक्षण किए गए तरीकों की एक सूची बनाए रखते हैं, और उनके मूल पेपर ने सपोर्ट-वेक्टर मशीन का उपयोग करके 0.8% त्रुटि दर की सूचना दी। मूल MNIST डेटासेट में कम से कम चार गलत लेबल शामिल हैं, जो एक प्रसिद्ध विचित्रता है।
पूर्ववर्ती और उत्पत्ति
MNIST से पहले, USPS डेटाबेस (1988) ने अमेरिकी मेल पर हस्तलिखित ज़िप कोड से एक छोटा अंक डेटासेट प्रदान किया। इसमें 16x16 ग्रेस्केल छवियां शामिल थीं, जिनमें 7,291 प्रशिक्षण और 2,007 परीक्षण छवियां थीं, कुल 9,298। इस डेटासेट में अस्पष्ट और गलत वर्गीकृत नमूने शामिल थे, और यह चुनौतीपूर्ण था, जिसमें मानव त्रुटि दर औसतन 2.5% थी। इसका उपयोग 1989 के शुरुआती LeNet आर्किटेक्चर को प्रशिक्षित करने के लिए किया गया था।
1980 के दशक के अंत में, जनगणना ब्यूरो ने हस्तलिखित फॉर्म डिजिटाइजेशन को स्वचालित करने की मांग की, और OCR प्रणालियों का मूल्यांकन करने के लिए NIST के छवि पहचान समूह को नियुक्त किया। उनके काम ने कई विशेष डेटाबेस तैयार किए: SD-1 (1990), SD-3 (1992), और SD-7 (1992)। ये हस्तलेखन नमूना फॉर्म (HSFs) से बनाए गए थे, जिन्हें 300 डीपीआई पर स्कैन किया गया था, जिसमें नाम, अंक और अक्षरों के लिए विभिन्न फ़ील्ड थे। SD-3 में 128x128 बाइनरी छवियां शामिल थीं जिनमें 223,125 अंक शामिल थे, और यह जनगणना कर्मचारियों से प्राप्त किया गया था। SD-7, परीक्षण सेट, में 500 हाई स्कूल के छात्रों से 58,646 छवियां थीं, जिनमें मानव त्रुटि दर 1.5% थी। विशेष रूप से, SD-3 साफ और आसान था, लेकिन SD-3 पर प्रशिक्षित मशीन लर्निंग प्रणालियों ने SD-7 पर ~-10% त्रुटि तक प्रदर्शन में गिरावट देखी, जो वितरण बदलाव को उजागर करती है।
1992 की एक NIST प्रतियोगिता ने SD-3 को प्रशिक्षण डेटा और SD-7 को परीक्षण सेट के रूप में उपयोग किया, जिसमें 26 कंपनियों से 45 एल्गोरिदम शामिल थे। विजेता प्रविष्टि ने एक स्वामित्व प्रशिक्षण सेट का उपयोग किया, जबकि SD-3-प्रशिक्षित प्रणालियों में सबसे अच्छा एक अपरिवर्तनीय मीट्रिक के साथ निकटतम-पड़ोसी वर्गीकरणकर्ता था। SD-19 (1995) ने कई विशेष डेटाबेस संयुक्त किए, जिसमें 814,255 छवियां शामिल थीं।
MNIST का निर्माण
गर्मियों 1994 से पहले किसी समय, MNIST को SD-3 और SD-7 से बनाया गया था। निर्माताओं ने SD-7 की छवियों को प्रशिक्षण और परीक्षण सेटों में विभाजित किया, प्रत्येक में 250 लेखकों से, लगभग 30,000 छवियां प्राप्त हुईं। फिर उन्होंने प्रति सेट 60,000 नमूनों तक पहुंचने के लिए प्रत्येक को SD-3 छवियों के साथ बढ़ाया। सभी छवियों को पहलू अनुपात बनाए रखते हुए 20x20 पिक्सेल बॉक्स में आकार-सामान्यीकृत किया गया, और ग्रेस्केल में एंटी-अलियास किया गया, फिर द्रव्यमान के केंद्र को समायोजित करके 28x28 छवि में केंद्रित किया गया। डाउनसैंपलिंग विवरण बाद में पुनर्निर्मित किए गए।
शुरुआत में, प्रशिक्षण और परीक्षण सेट दोनों में 60,000 नमूने थे, लेकिन परीक्षण सेट आकार को कम करने के लिए, 50,000 नमूने त्याग दिए गए, केवल सूचकांक 24476 से 34475 रखते हुए, जिसके परिणामस्वरूप 10,000 परीक्षण छवियां मिलीं।
मूल्यांकन और प्रभाव
MNIST Machine learning और Deep learning अनुसंधान में एक मानक आधार रेखा बन गया। इसका व्यापक रूप से एल्गोरिदम की तुलना करने के लिए उपयोग किया जाता है, सरल रैखिक मॉडल से लेकर जटिल Neural network मॉडल तक। डेटासेट का छोटा छवि आकार और मामूली संख्या में वर्ग इसे प्रोटोटाइपिंग के लिए आदर्श बनाते हैं। इसकी सार्वजनिक उपलब्धता और स्पष्ट बेंचमार्क ने इसे एक सामान्य शैक्षिक उपकरण बना दिया है।
विरासत और उत्तराधिकारी
विस्तारित MNIST (EMNIST) एक नया डेटासेट है जो NIST द्वारा विकसित किया गया है, जिसे 2017 में MNIST के उत्तराधिकारी के रूप में जारी किया गया। इसमें हस्तलिखित अंक और अक्षर शामिल हैं, जिनमें व्यापक श्रेणियां हैं। 2019 में, MNIST का पूरा 60,000 परीक्षण सेट QMNIST बनाने के लिए बहाल किया गया, जो अनुसंधान के लिए एक बड़ा परीक्षण सेट प्रदान करता है। ये व्युत्पन्न MNIST की संरचना को बनाए रखते हुए इसकी विविधता का विस्तार करते हैं।
यह भी देखें
संदर्भ
- यान लेकुन एट अल द्वारा मूल MNIST पेपर, 1998 (स्रोत तथ्यों में प्रदान किया गया)।
- NIST विशेष डेटाबेस प्रकाशन और OCR बेंचमार्क रिपोर्ट।