अंग्रेज़ी से अनुवादित

कुज़ुशिजी-एमएनआईएसटी 70,000 ग्रेस्केल छवियों का एक डेटासेट है, जिसमें हस्तलिखित जापानी हीरागाना वर्ण शामिल हैं, और इसे मशीन लर्निंग अनुसंधान के लिए मूल एमएनआईएसटी डेटासेट के प्रत्यक्ष प्रतिस्थापन के रूप में डिज़ाइन किया गया है।

कुज़ुशीजी-एमएनआईएसटी मशीन-लर्निंग और डीप-लर्निंग में छवि वर्गीकरण के लिए एक बेंचमार्क डेटासेट है। इसमें हस्तलिखित जापानी हीरागाना वर्णों की 70,000 28x28 पिक्सेल ग्रेस्केल छवियां शामिल हैं, जिन्हें 60,000 नमूनों के प्रशिक्षण सेट और 10,000 नमूनों के परीक्षण सेट में विभाजित किया गया है। यह डेटासेट हस्तलिखित अंकों के क्लासिक एमएनआईएसटी डेटासेट के आधुनिक विकल्प के रूप में बनाया गया था, जिसका उपयोग 1990 के दशक के अंत से तंत्रिका-नेटवर्क एल्गोरिदम का मूल्यांकन करने के लिए व्यापक रूप से किया जा रहा है। कुज़ुशीजी-एमएनआईएसटी मूल एमएनआईएसटी के समान छवि आयाम, डेटा प्रारूप और वर्गों की संख्या (10) बनाए रखता है, जिससे यह शोधकर्ताओं के लिए एक सीधा ड्रॉप-इन प्रतिस्थापन बन जाता है जो अधिक चुनौतीपूर्ण और सांस्कृतिक रूप से महत्वपूर्ण कार्य पर मॉडल का परीक्षण करना चाहते हैं।

यह डेटासेट 2018 में टोक्यो विश्वविद्यालय और राष्ट्रीय जापानी साहित्य संस्थान के शोधकर्ताओं की एक टीम द्वारा, तारिन क्लानुवत और सहयोगियों के नेतृत्व में पेश किया गया था। इसे दो संबंधित डेटासेट के साथ जारी किया गया था: कुज़ुशीजी-49, जिसमें हीरागाना वर्णों की 49 श्रेणियां हैं, और कुज़ुशीजी-कांजी, जिसमें 3,832 श्रेणियों के घसीट कांजी शामिल हैं। प्राथमिक प्रेरणा ऐतिहासिक जापानी दस्तावेजों के लिए ऑप्टिकल कैरेक्टर पहचान (ओसीआर) की समस्या को संबोधित करना था, जो कुज़ुशीजी नामक घसीट लिपि में लिखे गए हैं। यह लिपि 8वीं से 19वीं शताब्दी तक व्यापक रूप से उपयोग की जाती थी, लेकिन 1900 में शैक्षिक सुधारों के बाद इसे बड़े पैमाने पर छोड़ दिया गया, जिससे लाखों ऐतिहासिक ग्रंथ आधुनिक जापानी बोलने वालों के लिए अपठनीय रह गए।

डिजाइन और निर्माण

कुज़ुशीजी-एमएनआईएसटी में छवियां स्कैन किए गए ऐतिहासिक जापानी पुस्तकों और पांडुलिपियों के एक बड़े कोष से प्राप्त की गई थीं। शोधकर्ताओं ने इन दस्तावेजों से व्यक्तिगत वर्ण छवियों को निकालने के लिए स्वचालित विभाजन और मैन्युअल एनोटेशन के संयोजन का उपयोग किया। फिर प्रत्येक छवि को 28x28 पिक्सेल में आकार दिया गया और ग्रेस्केल में परिवर्तित किया गया, जिसमें पिक्सेल मान 0 (काला) से 255 (सफेद) तक थे, जो मूल एमएनआईएसटी डेटासेट के प्रारूप से बिल्कुल मेल खाते हैं। 10 वर्ग कोष में सबसे आम हीरागाना वर्णों के अनुरूप हैं, जो हैं: 'ओ', 'की', 'सु', 'त्सु', 'ना', 'हा', 'मा', 'या', 'रे', और 'वो'। इन वर्णों को वर्ग आवृत्ति और दृश्य विशिष्टता को संतुलित करने के लिए चुना गया था, यह सुनिश्चित करते हुए कि वर्गीकरण कार्य न तो तुच्छ है और न ही असंभव रूप से कठिन है।

डेटासेट मूल एमएनआईएसटी के समान बाइनरी प्रारूप में वितरित किया जाता है, जिसमें प्रशिक्षण छवियों, प्रशिक्षण लेबल, परीक्षण छवियों और परीक्षण लेबल के लिए अलग-अलग फाइलें होती हैं। यह संगतता शोधकर्ताओं को बिना संशोधन के एमएनआईएसटी के लिए डिज़ाइन किए गए मौजूदा कोड और पाइपलाइनों का उपयोग करने की अनुमति देती है, बस नए डेटा फ़ाइलों में स्वैप करके। रचनाकारों ने पायथन लोडर स्क्रिप्ट और एक विस्तृत README भी प्रदान किया ताकि पायटोर्च और टेन्सरफ्लो जैसे सामान्य डीप-लर्निंग ढांचे में आसान एकीकरण की सुविधा मिल सके।

बेंचमार्क प्रदर्शन

अपनी रिलीज़ के बाद से, कुज़ुशीजी-एमएनआईएसटी छवि वर्गीकरण मॉडल का मूल्यांकन करने के लिए एक मानक बेंचमार्क बन गया है, विशेष रूप से डेटा-संवर्धन और अवशिष्ट-नेटवर्क आर्किटेक्चर के संदर्भ में। यह कार्य मूल एमएनआईएसटी की तुलना में काफी अधिक कठिन है क्योंकि हीरागाना वर्ण अधिक अंतर-वर्ग भिन्नता और विभिन्न वर्गों के बीच दृश्य समानता प्रदर्शित करते हैं। उदाहरण के लिए, 'सु' और 'त्सु' के वर्ण अक्सर कुज़ुशीजी से अपरिचित मानव पाठकों द्वारा भी भ्रमित होते हैं। परिणामस्वरूप, सरल मॉडल जो एमएनआईएसटी पर लगभग सटीक सटीकता प्राप्त करते हैं, वे आमतौर पर कुज़ुशीजी-एमएनआईएसटी पर काफी खराब प्रदर्शन करते हैं, जिससे यह मॉडल क्षमता और सामान्यीकरण का अधिक संवेदनशील परीक्षण बन जाता है।

कुज़ुशीजी-एमएनआईएसटी पर अत्याधुनिक परिणाम बैच-सामान्यीकरण और ड्रॉपआउट नियमितीकरण के साथ कन्वोल्यूशनल तंत्रिका नेटवर्क (सीएनएन) का उपयोग करके प्राप्त किए गए हैं। 2024 तक, सबसे अच्छी रिपोर्ट की गई परीक्षण सटीकता लगभग 99.5% है, जो व्यापक डेटा संवर्धन के साथ अवशिष्ट नेटवर्क के एक समूह द्वारा प्राप्त की गई है। हालांकि, डेटासेट हल्के मॉडल और हस्तनिर्मित सुविधाओं पर निर्भर दृष्टिकोणों के लिए चुनौतीपूर्ण बना हुआ है, जो अक्सर 95% से नीचे की सटीकता पर स्थिर हो जाते हैं। बेंचमार्क का उपयोग सीखने-दर-अनुसूची और वजन-आरंभीकरण रणनीतियों के प्रभावों का अध्ययन करने के साथ-साथ लेबल शोर के प्रति मॉडल की मजबूती का अध्ययन करने के लिए भी किया गया है।

अनुप्रयोग और प्रभाव

कुज़ुशीजी-एमएनआईएसटी का प्राथमिक अनुप्रयोग ऐतिहासिक जापानी दस्तावेजों के लिए ओसीआर तकनीक को आगे बढ़ाने के लिए एक शोध उपकरण के रूप में है। व्यापक कुज़ुशीजी परियोजना, जिससे डेटासेट प्राप्त हुआ है, का उद्देश्य कुज़ुशीजी में लिखी गई लाखों पुस्तकों और पांडुलिपियों को डिजिटाइज़ करना और खोजने योग्य बनाना है जो वर्तमान में आम जनता के लिए दुर्गम हैं। एक मानकीकृत बेंचमार्क प्रदान करके, डेटासेट ने दुनिया भर के शोधकर्ताओं को घसीट वर्णों को पहचानने के लिए एल्गोरिदम विकसित करने और तुलना करने में सक्षम बनाया है, जो इन ग्रंथों के स्वचालित प्रतिलेखन की दिशा में एक महत्वपूर्ण कदम है।

अपने प्रत्यक्ष अनुप्रयोग के अलावा, कुज़ुशीजी-एमएनआईएसटी को मशीन-लर्निंग शिक्षा और अनुसंधान में एक सामान्य प्रयोजन परीक्षण के रूप में अपनाया गया है। एमएनआईएसटी से इसकी समानता इसे छवि वर्गीकरण के लिए एक सुलभ परिचय बनाती है, जबकि इसकी बढ़ी हुई कठिनाई अधिक उन्नत तकनीकों की खोज को प्रोत्साहित करती है। डेटासेट को सैकड़ों शैक्षणिक पत्रों में उद्धृत किया गया है और यह लोकप्रिय मशीन लर्निंग पुस्तकालयों और पाठ्यक्रम सामग्री में शामिल है। इसका उपयोग लैटिन वर्णमाला या चीनी वर्णों जैसे अन्य वर्ण डेटासेट पर प्रशिक्षित मॉडलों की स्थानांतरण क्षमता का मूल्यांकन करने के लिए भी किया गया है, जो क्रॉस-स्क्रिप्ट सामान्यीकरण में अंतर्दृष्टि प्रदान करता है।

संबंधित डेटासेट और विस्तार

कुज़ुशीजी-एमएनआईएसटी के रचनाकारों ने कुज़ुशीजी-49 भी जारी किया, जिसमें सभी 49 हीरागाना वर्ण शामिल हैं, और कुज़ुशीजी-कांजी, जो 3,832 कांजी वर्णों को कवर करता है। ये डेटासेट बड़े और अधिक जटिल हैं, कुज़ुशीजी-कांजी में 140,000 से अधिक छवियां शामिल हैं। वे अधिक उन्नत ओसीआर कार्यों के लिए और ऐतिहासिक दस्तावेजों में पाए जाने वाले वर्णों की पूरी श्रृंखला को संभालने वाले मॉडल को प्रशिक्षित करने के लिए हैं। इसके अतिरिक्त, कुज़ुशीजी परियोजना ने कुज़ुशीजी डेटासेट के रूप में ज्ञात ऐतिहासिक ग्रंथों का एक बड़ा एनोटेटेड कोष प्रकाशित किया है, जिसमें वर्ण-स्तरीय बाउंडिंग बॉक्स के साथ पूर्ण-पृष्ठ छवियां शामिल हैं। इस संसाधन का उपयोग प्रतियोगिताओं और सहयोगी अनुसंधान प्रयासों में एंड-टू-एंड प्रतिलेखन प्रणाली विकसित करने के लिए किया गया है।

मशीन लर्निंग समुदाय में, कुज़ुशीजी-एमएनआईएसटी ने सांस्कृतिक रूप से विविध बेंचमार्क बनाने के समान प्रयासों को प्रेरित किया है, जैसे हस्तलिखित अक्षरों के लिए ईएमएनआईएसटी डेटासेट और कपड़ों की छवियों के लिए फैशन-एमएनआईएसटी डेटासेट। ये डेटासेट मूल एमएनआईएसटी के समान प्रारूप और आकार साझा करते हैं, जिससे विभिन्न डोमेन में मॉडल प्रदर्शन की सीधी तुलना की जा सकती है। कुज़ुशीजी-एमएनआईएसटी की सफलता ने ऐतिहासिक लिपियों को संरक्षित और डिजिटाइज़ करने के मूल्य को उजागर किया है, और यह सांस्कृतिक विरासत संरक्षण और आधुनिक कृत्रिम-बुद्धिमत्ता अनुसंधान के बीच एक पुल के रूप में काम करना जारी रखता है।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:dataset·image-classification·japanese-ocr·benchmark
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास