कुज़ुशीजी-एमएनआईएसटी (KMNIST) 70,000 ग्रेस्केल छवियों का एक डेटासेट है, जिसमें हस्तलिखित जापानी हीरागाना वर्ण शामिल हैं, प्रत्येक छवि 28x28 पिक्सेल की है। इसे क्लासिक एमएनआईएसटी डेटासेट के लिए एक अधिक चुनौतीपूर्ण विकल्प के रूप में बनाया गया था, जिसमें हस्तलिखित अंक होते हैं। KMNIST को मशीन लर्निंग बेंचमार्क में एमएनआईएसटी के लिए एक ड्रॉप-इन प्रतिस्थापन के रूप में डिज़ाइन किया गया है, जिससे शोधकर्ताओं को समान संरचना लेकिन हीरागाना की घसीट प्रकृति के कारण अधिक दृश्य जटिलता वाले कार्य पर मॉडल का परीक्षण करने की अनुमति मिलती है।
डेटासेट को 2018 में टोक्यो विश्वविद्यालय के शोधकर्ताओं की एक टीम द्वारा पेश किया गया था, जिसमें तारिन क्लानुवाट, मिकेल बोबेर-इरिज़ार, असानोबू कितामोटो और एलेक्स लैम्ब शामिल थे। इसे कुज़ुशीजी डेटासेट से प्राप्त किया गया था, जिसमें शास्त्रीय जापानी साहित्य की 140,000 से अधिक छवियां शामिल हैं। KMNIST उपसमुच्चय 10 हीरागाना वर्णों पर केंद्रित है, जिनमें से प्रत्येक को 7,000 छवियों (प्रशिक्षण के लिए 6,000 और परीक्षण के लिए 1,000) द्वारा दर्शाया गया है, जो एमएनआईएसटी के सटीक विभाजन को दर्शाता है।
डेटासेट संरचना
KMNIST एमएनआईएसटी के समान प्रारूप का पालन करता है: प्रत्येक छवि 28x28 पिक्सेल ग्रेस्केल सरणी है, जिसमें पिक्सेल मान 0 से 255 तक होते हैं। डेटासेट को 60,000 प्रशिक्षण छवियों और 10,000 परीक्षण छवियों में विभाजित किया गया है। शामिल 10 वर्ण हैं: 'ओ', 'की', 'सु', 'त्सु', 'ना', 'हा', 'मा', 'या', 'रे' और 'वो'। इन वर्णों का चयन इसलिए किया गया क्योंकि वे मूल कुज़ुशीजी डेटासेट में सबसे आम हैं और एक संतुलित वर्गीकरण चुनौती प्रस्तुत करते हैं।
निर्माताओं ने जानबूझकर एमएनआईएसटी अंकों के समान वर्णों का उपयोग करने से परहेज किया, यह सुनिश्चित करते हुए कि KMNIST पर प्रशिक्षित मॉडल अंक पहचान से सीखी गई सुविधाओं को सीधे स्थानांतरित नहीं कर सकते। हीरागाना वर्णों में अधिक जटिल स्ट्रोक पैटर्न और वक्रताएं हैं, जो पारंपरिक मशीन लर्निंग मॉडल के लिए कार्य को कठिन बनाती हैं।
बेंचमार्किंग और प्रदर्शन
KMNIST Machine learning समुदाय में एक मानक बेंचमार्क बन गया है, विशेष रूप से Neural network आर्किटेक्चर के मूल्यांकन के लिए। मूल एमएनआईएसटी पर, कई मॉडल 99% से अधिक सटीकता प्राप्त करते हैं, लेकिन KMNIST काफी कठिन है। उदाहरण के लिए, एक सरल Residual Network (ResNet) एमएनआईएसटी पर लगभग 99% प्राप्त कर सकता है, लेकिन KMNIST पर केवल लगभग 95%। यह KMNIST को सरल कार्यों पर अच्छा प्रदर्शन करने वाले मॉडल और अधिक जटिल पैटर्न को सामान्यीकृत करने वाले मॉडल के बीच अंतर करने के लिए उपयोगी बनाता है।
शोधकर्ताओं ने KMNIST का उपयोग विभिन्न तकनीकों का परीक्षण करने के लिए किया है, जिसमें Data Augmentation, Dropout और Batch Normalization शामिल हैं। डेटासेट लोकप्रिय मशीन लर्निंग लाइब्रेरी जैसे PyTorch और TensorFlow में भी शामिल है, जिससे इसे मौजूदा पाइपलाइनों में एकीकृत करना आसान हो जाता है।
संबंधित डेटासेट
KMNIST एमएनआईएसटी-जैसे डेटासेट के एक परिवार का हिस्सा है, जिसमें फैशन-एमएनआईएसटी (कपड़ों की वस्तुएं) और ईएमएनआईएसटी (अक्षर और अंक) शामिल हैं। ये डेटासेट समान छवि प्रारूप और विभाजन साझा करते हैं, जिससे विभिन्न डोमेन में मॉडल प्रदर्शन की सीधी तुलना की अनुमति मिलती है। KMNIST इस मायने में अद्वितीय है कि यह एक गैर-लैटिन लिपि पर केंद्रित है, जो एक सांस्कृतिक और भाषाई चुनौती प्रदान करता है जो अन्य डेटासेट नहीं करते।
मूल कुज़ुशीजी डेटासेट, जिससे KMNIST प्राप्त हुआ है, में 4,000 से अधिक विभिन्न वर्ण शामिल हैं और इसका उपयोग ऐतिहासिक दस्तावेज़ विश्लेषण के लिए किया जाता है। KMNIST इसे 10-वर्गीय समस्या में सरल बनाता है, जिससे यह शैक्षिक उद्देश्यों और त्वरित प्रयोग के लिए सुलभ हो जाता है।
अनुप्रयोग और प्रभाव
KMNIST को Deep learning अनुसंधान और शिक्षा में व्यापक रूप से अपनाया गया है। इसका उपयोग अक्सर परिचयात्मक पाठ्यक्रमों में Convolutional neural network डिज़ाइन सिखाने के लिए किया जाता है, क्योंकि इसके लिए एमएनआईएसटी की तुलना में अधिक परिष्कृत आर्किटेक्चर की आवश्यकता होती है। डेटासेट का उपयोग Transfer learning और डोमेन-अनुकूलन पर अध्ययनों में भी किया गया है, जहां एमएनआईएसटी पर पूर्व-प्रशिक्षित मॉडल को KMNIST पर ठीक-ट्यून किया जाता है।
बेंचमार्किंग से परे, KMNIST ने जापानी सांस्कृतिक विरासत के संरक्षण और अध्ययन में योगदान दिया है। शास्त्रीय हीरागाना वर्णों को मशीन-पठनीय प्रारूप में सुलभ बनाकर, यह ऐतिहासिक दस्तावेजों के स्वचालित विश्लेषण को सक्षम बनाता है, जो इतिहासकारों और भाषाविदों के लिए मूल्यवान है।
सीमाएं और भविष्य की दिशाएं
अपनी उपयोगिता के बावजूद, KMNIST की सीमाएं हैं। 10 वर्ण पूर्ण हीरागाना शब्दांश का केवल एक छोटा सा हिस्सा दर्शाते हैं, और छवियों को एमएनआईएसटी के प्रारूप से मेल खाने के लिए पूर्व-संसाधित किया जाता है, जो कुछ मूल स्ट्रोक जानकारी खो सकता है। इसके अतिरिक्त, डेटासेट आधुनिक बड़े पैमाने के डेटासेट की तुलना में अपेक्षाकृत छोटा है, जो बहुत गहरे मॉडल के प्रशिक्षण के लिए इसके उपयोग को सीमित कर सकता है।
भविष्य के कार्य में KMNIST का विस्तार करके अधिक वर्ण शामिल करना या विभिन्न पूर्व-प्रसंस्करण के साथ संस्करण बनाना शामिल हो सकता है। 2025 तक, KMNIST एक मानक बेंचमार्क बना हुआ है, लेकिन शोधकर्ता तेजी से अत्याधुनिक मॉडल के मूल्यांकन के लिए CIFAR-10 या ImageNet जैसे अधिक जटिल डेटासेट की ओर रुख कर रहे हैं। फिर भी, KMNIST त्वरित प्रोटोटाइपिंग और शैक्षिक उद्देश्यों के लिए एक मूल्यवान उपकरण के रूप में काम करना जारी रखता है।