अंग्रेज़ी से अनुवादित

Fashion-MNIST 70,000 ग्रेस्केल फैशन उत्पाद छवियों का एक डेटासेट है, जिसका उपयोग मशीन लर्निंग और डीप लर्निंग वर्गीकरण कार्यों में मूल MNIST बेंचमार्क के ड्रॉप-इन प्रतिस्थापन के रूप में किया जाता है।

Fashion-MNIST मशीन लर्निंग और डीप लर्निंग के क्षेत्रों में व्यापक रूप से उपयोग किया जाने वाला बेंचमार्क डेटासेट है। इसमें फैशन उत्पादों की 70,000 ग्रेस्केल छवियाँ शामिल हैं, प्रत्येक 28 गुणा 28 पिक्सेल की है, जो 60,000 प्रशिक्षण छवियों और 10,000 परीक्षण छवियों में विभाजित है। यह डेटासेट 2017 में Zalando Research द्वारा बनाया गया था, जो हस्तलिखित अंकों के मूल MNIST डेटासेट के अधिक चुनौतीपूर्ण और यथार्थवादी विकल्प के रूप में कार्य करता है, जो बहुत उच्च वर्गीकरण सटीकता के साथ संतृप्त हो गया था। Fashion-MNIST को तंत्रिका नेटवर्क मॉडल की दस अलग-अलग कपड़ों की श्रेणियों के बीच अंतर करने की क्षमता का परीक्षण करने के लिए डिज़ाइन किया गया है, जो इसे छवि वर्गीकरण एल्गोरिदम के मूल्यांकन के लिए एक मानक उपकरण बनाता है।

डेटासेट की दस श्रेणियाँ हैं: टी-शर्ट/टॉप, ट्राउज़र, पुलओवर, ड्रेस, कोट, सैंडल, शर्ट, स्नीकर, बैग, और एंकल बूट। प्रत्येक छवि एक केंद्रित, कम-रिज़ॉल्यूशन वाली ग्रेस्केल तस्वीर है जिसमें कुछ पृष्ठभूमि शोर शामिल है, जो MNIST के साफ, केंद्रित अंकों की तुलना में वास्तविक दुनिया की स्थितियों को अधिक निकटता से दर्शाती है। क्योंकि छवियाँ छोटी हैं और डेटासेट मध्यम आकार का है, Fashion-MNIST पर प्रशिक्षण कम्प्यूटेशनल रूप से सस्ता है, फिर भी यह विभिन्न आर्किटेक्चर और हाइपरपैरामीटर वाले मॉडलों के बीच अंतर करने के लिए पर्याप्त कठिन समस्या उत्पन्न करता है।

इतिहास और प्रेरणा

Fashion-MNIST को 2017 के एक पेपर में Han Xiao, Kashif Rasul, और Roland Vollgraf द्वारा पेश किया गया था, जो Zalando Research के शोधकर्ता हैं, जो जर्मन फैशन ई-कॉमर्स कंपनी Zalando का मशीन लर्निंग प्रभाग है। प्राथमिक प्रेरणा यह अवलोकन था कि मूल MNIST डेटासेट, जो 1998 में Yann LeCun, Corinna Cortes, और Christopher Burges द्वारा जारी किया गया था, आधुनिक क्लासिफायर के लिए बहुत आसान हो गया था। कई मॉडलों ने 99% से अधिक सटीकता हासिल की, जिससे एल्गोरिदम डिज़ाइन में सार्थक सुधारों को समझना मुश्किल हो गया। लेखकों का लक्ष्य एक ऐसा डेटासेट बनाना था जो MNIST के समान प्रारूप और जटिलता को बनाए रखे - 28x28 ग्रेस्केल छवियाँ, 10 श्रेणियाँ, और समान प्रशिक्षण/परीक्षण विभाजन - लेकिन अधिक चुनौतीपूर्ण दृश्य पहचान कार्य के साथ।

छवियाँ Zalando कैटलॉग से प्राप्त की गई थीं, जहाँ उत्पाद तस्वीरों को ग्रेस्केल में परिवर्तित किया गया, आकार बदला गया, और वस्तुओं को केंद्रित करने के लिए क्रॉप किया गया। डेटासेट MIT लाइसेंस के तहत जारी किया गया था, जो शैक्षणिक और वाणिज्यिक अनुप्रयोगों में मुफ्त उपयोग की अनुमति देता है। अपनी रिलीज़ के बाद से, Fashion-MNIST मशीन लर्निंग अनुसंधान में सबसे अधिक उद्धृत डेटासेट में से एक बन गया है, जिसमें हजारों पेपर कन्वोल्यूशनल न्यूरल नेटवर्क, सपोर्ट वेक्टर मशीन, और अन्य क्लासिफायर को बेंचमार्क करने के लिए इसका उपयोग करते हैं।

डेटासेट की विशेषताएँ

Fashion-MNIST में प्रत्येक छवि 28x28 पिक्सेल की एक सरणी है, जिसमें पिक्सेल मान 0 (काला) से 255 (सफेद) तक होते हैं। छवियाँ मूल MNIST के समान प्रारूप में संग्रहीत हैं, जिससे मौजूदा कोडबेस में एक डेटासेट को दूसरे के लिए स्वैप करना आसान हो जाता है। प्रशिक्षण सेट में प्रति श्रेणी 6,000 छवियाँ हैं, और परीक्षण सेट में प्रति श्रेणी 1,000 छवियाँ हैं, जो सभी दस श्रेणियों में संतुलित प्रतिनिधित्व सुनिश्चित करती हैं।

एक उल्लेखनीय विशेषता अंतर-श्रेणी भिन्नता की उपस्थिति है। उदाहरण के लिए, "शर्ट" श्रेणी में छोटी आस्तीन और लंबी आस्तीन दोनों शर्ट शामिल हैं, और "बैग" श्रेणी में हैंडबैग, बैकपैक, और क्लच शामिल हैं। यह परिवर्तनशीलता मॉडल को सरल पिक्सेल पैटर्न पर भरोसा करने के बजाय अधिक मजबूत विशेषताएँ सीखने के लिए मजबूर करती है। इसके अतिरिक्त, कुछ श्रेणियाँ एक-दूसरे के समान दिखती हैं, जैसे पुलओवर, कोट, और शर्ट, जो MNIST के विशिष्ट अंक आकारों की तुलना में वर्गीकरण कार्य की कठिनाई को बढ़ाता है।

मशीन लर्निंग अनुसंधान में उपयोग

Fashion-MNIST आमतौर पर नए तंत्रिका नेटवर्क आर्किटेक्चर, अनुकूलन तकनीकों, और नियमितीकरण विधियों के मूल्यांकन के लिए एक आधारभूत डेटासेट के रूप में उपयोग किया जाता है। क्योंकि डेटासेट एक GPU पर मिनटों में प्रशिक्षित करने के लिए पर्याप्त छोटा है, शोधकर्ता तेजी से पुनरावृत्ति कर सकते हैं। यह शैक्षिक सेटिंग्स में डीप लर्निंग अवधारणाओं को सिखाने के लिए भी अक्सर उपयोग किया जाता है, क्योंकि यह हस्तलिखित अंकों की तुलना में अधिक दिलचस्प दृश्य कार्य प्रदान करता है, जबकि छात्रों के लिए प्रबंधनीय रहता है।

Fashion-MNIST पर विशिष्ट बेंचमार्क परिणाम दिखाते हैं कि एक अच्छी तरह से ट्यून किया गया कन्वोल्यूशनल न्यूरल नेटवर्क लगभग 93-95% सटीकता प्राप्त कर सकता है, जबकि एक सरल लॉजिस्टिक रिग्रेशन मॉडल लगभग 85% तक पहुँचता है। यह अंतर इस कार्य के लिए डीप लर्निंग दृष्टिकोणों के लाभ को उजागर करता है। डेटासेट का उपयोग ट्रांसफर लर्निंग, डेटा ऑग्मेंटेशन रणनीतियों, और विरोधी मजबूती का परीक्षण करने के लिए भी किया गया है, क्योंकि इसकी छवियाँ MNIST की तुलना में अधिक जटिल हैं लेकिन नियंत्रित प्रयोगों के लिए पर्याप्त सरल हैं।

मूल MNIST के साथ तुलना

मूल MNIST डेटासेट में 0 से 9 तक हस्तलिखित अंक शामिल हैं, जो अमेरिकी जनगणना ब्यूरो के कर्मचारियों और हाई स्कूल के छात्रों से एकत्र किए गए थे। जबकि MNIST लगभग हल हो चुका है, कई मॉडल 99.5% से अधिक सटीकता के साथ, Fashion-MNIST आमतौर पर लगभग 96-97% की शीर्ष सटीकता देखता है, जो सुधार के लिए अधिक गुंजाइश छोड़ता है। फैशन छवियों में अधिक किनारे जटिलता और बनावट भिन्नता भी होती है, जो उन्हें ई-कॉमर्स में उत्पाद पहचान जैसे वास्तविक दुनिया के कंप्यूटर विज़न कार्यों के लिए एक बेहतर प्रॉक्सी बनाती है।

एक और अंतर डेटा का स्रोत है। MNIST अंक मैन्युअल रूप से लिखे और स्कैन किए गए थे, जबकि Fashion-MNIST छवियाँ पेशेवर उत्पाद तस्वीरों से प्राप्त होती हैं, जिनमें प्रकाश भिन्नताएँ और पृष्ठभूमि तत्व शामिल हैं। यह Fashion-MNIST को व्यावहारिक अनुप्रयोगों का अधिक प्रतिनिधि बनाता है, फिर भी यह समान कम रिज़ॉल्यूशन और सरल प्रारूप बनाए रखता है जो इसे देखने और संसाधित करने में आसान बनाता है।

सीमाएँ और विस्तार

अपनी लोकप्रियता के बावजूद, Fashion-MNIST की सीमाएँ हैं। 28x28 रिज़ॉल्यूशन बारीक-दानेदार वर्गीकरण के लिए बहुत कम है, और ग्रेस्केल प्रारूप रंग जानकारी को त्याग देता है जो वास्तविक दुनिया की फैशन पहचान में उपयोगी हो सकती है। कुछ शोधकर्ताओं ने डेटासेट को CIFAR-10 या ImageNet जैसे आधुनिक बेंचमार्क की तुलना में बहुत आसान होने के लिए आलोचना की है, जिसमें उच्च रिज़ॉल्यूशन और अधिक श्रेणियों वाली प्राकृतिक छवियाँ शामिल हैं। फिर भी, Fashion-MNIST त्वरित प्रोटोटाइपिंग और शैक्षिक उद्देश्यों के लिए एक मूल्यवान उपकरण बना हुआ है।

डेटासेट के विस्तार में जोड़े गए शोर, रोटेशन, या विरोधी गड़बड़ी वाले Fashion-MNIST वेरिएंट शामिल हैं, जिनका उपयोग मॉडल मजबूती का परीक्षण करने के लिए किया जाता है। कुछ कार्यों ने मल्टी-टास्क लर्निंग बेंचमार्क बनाने के लिए Fashion-MNIST को अन्य डेटासेट के साथ भी जोड़ा है। डेटासेट की सरलता और स्पष्ट लेबलिंग इसे शोधकर्ताओं के लिए अधिक जटिल डेटासेट में स्केल करने से पहले कृत्रिम बुद्धिमत्ता में नए विचारों की खोज के लिए एक विश्वसनीय शुरुआती बिंदु बनाती है।

प्रभाव और विरासत

Fashion-MNIST ने मशीन लर्निंग समुदाय पर एक महत्वपूर्ण प्रभाव डाला है, जो खिलौना समस्याओं और वास्तविक दुनिया के अनुप्रयोगों के बीच की खाई को पाटने वाला एक मानकीकृत, सुलभ बेंचमार्क प्रदान करता है। इसे TensorFlow, PyTorch, और Keras जैसी प्रमुख डीप लर्निंग लाइब्रेरीज़ में एकीकृत किया गया है, जिससे उपयोगकर्ता कोड की एक पंक्ति के साथ डेटासेट लोड कर सकते हैं। इसका व्यापक रूप से अपनाया जाना इसे परिचयात्मक कंप्यूटर विज़न पाठ्यक्रमों और नए प्रस्तावित मॉडलों के प्रदर्शन की तुलना करने के लिए एक वास्तविक मानक बनाता है।

डेटासेट के निर्माताओं ने डेटा लोड करने और देखने के लिए कोड के साथ एक विस्तृत तकनीकी रिपोर्ट और एक GitHub रिपॉजिटरी भी प्रदान की, जिसने इसके तेजी से अपनाने की सुविधा प्रदान की। 2020 के दशक की शुरुआत तक, Fashion-MNIST को सालाना सैकड़ों शोध पत्रों में उद्धृत किया जाता रहा है, और यह कम-रिज़ॉल्यूशन डोमेन में छवि वर्गीकरण एल्गोरिदम विकसित करने वाले किसी भी व्यक्ति के लिए एक अनुशंसित बेंचमार्क बना हुआ है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:dataset·machine-learning·computer-vision·benchmark
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास