EMNIST (विस्तारित MNIST) हस्तलिखित वर्णों का एक डेटासेट है जो मूल MNIST डेटासेट को अंकों से आगे बढ़ाकर अंकों और अपरकेस तथा लोअरकेस अक्षरों दोनों को शामिल करता है। इसमें 240,000 प्रशिक्षण छवियाँ और 40,000 परीक्षण छवियाँ हैं, प्रत्येक 28x28 ग्रेस्केल छवि है। EMNIST का व्यापक रूप से Machine learning और Deep learning अनुसंधान में वर्ण पहचान और वर्गीकरण एल्गोरिदम के बेंचमार्किंग जैसे कार्यों के लिए उपयोग किया जाता है।
यह डेटासेट 2017 में ग्रेगरी कोहेन, सईद अफशर, जोनाथन टैप्सन, और आंद्रे वैन शाइक द्वारा MARCS इंस्टीट्यूट फॉर ब्रेन, बिहेवियर एंड डेवलपमेंट, वेस्टर्न सिडनी विश्वविद्यालय में पेश किया गया था। इसे NIST स्पेशल डेटाबेस 19 को परिवर्तित करके बनाया गया था, जिसमें 3,600 से अधिक लेखकों के हस्तलिखित नमूने शामिल हैं, MNIST के समान प्रारूप में। EMNIST MNIST की तुलना में अधिक चुनौतीपूर्ण बेंचमार्क प्रदान करता है क्योंकि इसमें अक्षर शामिल हैं, जिनमें अधिक वर्ग और कुछ वर्णों के बीच अधिक दृश्य समानता होती है (जैसे, 'O' और '0', 'I' और 'l')।
वेरिएंट और विभाजन
EMNIST कई वेरिएंट में उपलब्ध है, प्रत्येक में अलग वर्ग संरचना होती है। सबसे आम है EMNIST Letters, जिसमें 26 वर्ग (A-Z) और 145,600 प्रशिक्षण छवियाँ हैं। अन्य वेरिएंट में EMNIST Digits (10 वर्ग, 280,000 प्रशिक्षण छवियाँ), EMNIST Balanced (47 वर्ग, 112,800 प्रशिक्षण छवियाँ), EMNIST ByClass (62 वर्ग, 697,932 प्रशिक्षण छवियाँ), और EMNIST ByMerge (47 वर्ग, 697,932 प्रशिक्षण छवियाँ) शामिल हैं। Balanced और ByMerge वेरिएंट कुछ अक्षर मामलों (जैसे, 'C' और 'c') को विलय करके अस्पष्टता को कम करते हैं, जबकि ByClass सभी वर्गों को अलग रखता है।
अनुसंधान में उपयोग
EMNIST Neural network आर्किटेक्चर और प्रशिक्षण तकनीकों का मूल्यांकन करने के लिए एक मानक बेंचमार्क बन गया है। इसका उपयोग अक्सर Data Augmentation, Dropout, Batch Normalization, और अन्य नियमितीकरण विधियों में सुधार का परीक्षण करने के लिए किया जाता है। शोधकर्ता ट्रांसफर लर्निंग का अध्ययन करने के लिए भी EMNIST का उपयोग करते हैं, जहाँ बड़े डेटासेट पर पूर्व-प्रशिक्षित मॉडल EMNIST पर फाइन-ट्यून किए जाते हैं। डेटासेट लोकप्रिय मशीन लर्निंग लाइब्रेरी जैसे PyTorch और TensorFlow में शामिल है, जिससे यह प्रयोग के लिए आसानी से सुलभ हो जाता है।
MNIST से संबंध
EMNIST को MNIST के ड्रॉप-इन प्रतिस्थापन के रूप में डिज़ाइन किया गया है, जिसमें समान छवि आकार और प्रारूप है। हालाँकि, अक्षरों का समावेश कठिनाई को बढ़ाता है: वर्गों की संख्या 10 से बढ़कर 62 तक हो जाती है, और अंतर-वर्ग समानता अधिक होती है। यह EMNIST को वास्तविक दुनिया के अनुप्रयोगों, जैसे डाक मेल छँटाई और फॉर्म प्रोसेसिंग, में हस्तलेखन पहचान के लिए अधिक यथार्थवादी बेंचमार्क बनाता है। कई अध्ययन रिपोर्ट करते हैं कि MNIST पर लगभग पूर्ण सटीकता प्राप्त करने वाले मॉडल EMNIST पर महत्वपूर्ण गिरावट देखते हैं, जो अधिक मजबूत विधियों की आवश्यकता को उजागर करता है।
सीमाएँ और विस्तार
व्यापक दायरे के बावजूद, EMNIST में अभी भी सीमाएँ हैं। यह एकल स्रोत (NIST) से व्युत्पन्न है, इसलिए यह विभिन्न आबादी में हस्तलेखन शैलियों की पूर्ण विविधता को पकड़ नहीं सकता है। छवियों को केंद्रित और सामान्यीकृत करने के लिए पूर्व-संसाधित भी किया जाता है, जो परिवर्तनशीलता को कम करता है। इन मुद्दों को संबोधित करने के लिए, शोधकर्ताओं ने Fashion-MNIST (कपड़ों की छवियाँ) और Kuzushiji-MNIST (जापानी वर्ण) जैसे विस्तार बनाए हैं, लेकिन EMNIST एक व्यापक रूप से उपयोग किया जाने वाला आधार रेखा बना हुआ है। 2020 के दशक की शुरुआत तक, EMNIST को सालाना सैकड़ों पेपरों में उद्धृत किया जा रहा है, और इसका उपयोग अक्सर शैक्षिक सेटिंग्स में Deep learning अवधारणाओं को सिखाने के लिए किया जाता है।