Fashion-MNIST मशीन लर्निंग और डीप लर्निंग के क्षेत्रों में व्यापक रूप से उपयोग किया जाने वाला बेंचमार्क डेटासेट है। इसमें फैशन उत्पादों की 70,000 ग्रेस्केल छवियाँ शामिल हैं, प्रत्येक 28 गुणा 28 पिक्सेल की है, जो 60,000 प्रशिक्षण छवियों और 10,000 परीक्षण छवियों में विभाजित है। यह डेटासेट 2017 में Zalando Research द्वारा बनाया गया था, जो हस्तलिखित अंकों के मूल MNIST डेटासेट के अधिक चुनौतीपूर्ण और यथार्थवादी विकल्प के रूप में कार्य करता है, जो बहुत उच्च वर्गीकरण सटीकता के साथ संतृप्त हो गया था। Fashion-MNIST को तंत्रिका नेटवर्क मॉडल की दस अलग-अलग कपड़ों की श्रेणियों के बीच अंतर करने की क्षमता का परीक्षण करने के लिए डिज़ाइन किया गया है, जो इसे छवि वर्गीकरण एल्गोरिदम के मूल्यांकन के लिए एक मानक उपकरण बनाता है।
डेटासेट की दस श्रेणियाँ हैं: टी-शर्ट/टॉप, ट्राउज़र, पुलओवर, ड्रेस, कोट, सैंडल, शर्ट, स्नीकर, बैग, और एंकल बूट। प्रत्येक छवि एक केंद्रित, कम-रिज़ॉल्यूशन वाली ग्रेस्केल तस्वीर है जिसमें कुछ पृष्ठभूमि शोर शामिल है, जो MNIST के साफ, केंद्रित अंकों की तुलना में वास्तविक दुनिया की स्थितियों को अधिक निकटता से दर्शाती है। क्योंकि छवियाँ छोटी हैं और डेटासेट मध्यम आकार का है, Fashion-MNIST पर प्रशिक्षण कम्प्यूटेशनल रूप से सस्ता है, फिर भी यह विभिन्न आर्किटेक्चर और हाइपरपैरामीटर वाले मॉडलों के बीच अंतर करने के लिए पर्याप्त कठिन समस्या उत्पन्न करता है।
इतिहास और प्रेरणा
Fashion-MNIST को 2017 के एक पेपर में Han Xiao, Kashif Rasul, और Roland Vollgraf द्वारा पेश किया गया था, जो Zalando Research के शोधकर्ता हैं, जो जर्मन फैशन ई-कॉमर्स कंपनी Zalando का मशीन लर्निंग प्रभाग है। प्राथमिक प्रेरणा यह अवलोकन था कि मूल MNIST डेटासेट, जो 1998 में Yann LeCun, Corinna Cortes, और Christopher Burges द्वारा जारी किया गया था, आधुनिक क्लासिफायर के लिए बहुत आसान हो गया था। कई मॉडलों ने 99% से अधिक सटीकता हासिल की, जिससे एल्गोरिदम डिज़ाइन में सार्थक सुधारों को समझना मुश्किल हो गया। लेखकों का लक्ष्य एक ऐसा डेटासेट बनाना था जो MNIST के समान प्रारूप और जटिलता को बनाए रखे - 28x28 ग्रेस्केल छवियाँ, 10 श्रेणियाँ, और समान प्रशिक्षण/परीक्षण विभाजन - लेकिन अधिक चुनौतीपूर्ण दृश्य पहचान कार्य के साथ।
छवियाँ Zalando कैटलॉग से प्राप्त की गई थीं, जहाँ उत्पाद तस्वीरों को ग्रेस्केल में परिवर्तित किया गया, आकार बदला गया, और वस्तुओं को केंद्रित करने के लिए क्रॉप किया गया। डेटासेट MIT लाइसेंस के तहत जारी किया गया था, जो शैक्षणिक और वाणिज्यिक अनुप्रयोगों में मुफ्त उपयोग की अनुमति देता है। अपनी रिलीज़ के बाद से, Fashion-MNIST मशीन लर्निंग अनुसंधान में सबसे अधिक उद्धृत डेटासेट में से एक बन गया है, जिसमें हजारों पेपर कन्वोल्यूशनल न्यूरल नेटवर्क, सपोर्ट वेक्टर मशीन, और अन्य क्लासिफायर को बेंचमार्क करने के लिए इसका उपयोग करते हैं।
डेटासेट की विशेषताएँ
Fashion-MNIST में प्रत्येक छवि 28x28 पिक्सेल की एक सरणी है, जिसमें पिक्सेल मान 0 (काला) से 255 (सफेद) तक होते हैं। छवियाँ मूल MNIST के समान प्रारूप में संग्रहीत हैं, जिससे मौजूदा कोडबेस में एक डेटासेट को दूसरे के लिए स्वैप करना आसान हो जाता है। प्रशिक्षण सेट में प्रति श्रेणी 6,000 छवियाँ हैं, और परीक्षण सेट में प्रति श्रेणी 1,000 छवियाँ हैं, जो सभी दस श्रेणियों में संतुलित प्रतिनिधित्व सुनिश्चित करती हैं।
एक उल्लेखनीय विशेषता अंतर-श्रेणी भिन्नता की उपस्थिति है। उदाहरण के लिए, "शर्ट" श्रेणी में छोटी आस्तीन और लंबी आस्तीन दोनों शर्ट शामिल हैं, और "बैग" श्रेणी में हैंडबैग, बैकपैक, और क्लच शामिल हैं। यह परिवर्तनशीलता मॉडल को सरल पिक्सेल पैटर्न पर भरोसा करने के बजाय अधिक मजबूत विशेषताएँ सीखने के लिए मजबूर करती है। इसके अतिरिक्त, कुछ श्रेणियाँ एक-दूसरे के समान दिखती हैं, जैसे पुलओवर, कोट, और शर्ट, जो MNIST के विशिष्ट अंक आकारों की तुलना में वर्गीकरण कार्य की कठिनाई को बढ़ाता है।
मशीन लर्निंग अनुसंधान में उपयोग
Fashion-MNIST आमतौर पर नए तंत्रिका नेटवर्क आर्किटेक्चर, अनुकूलन तकनीकों, और नियमितीकरण विधियों के मूल्यांकन के लिए एक आधारभूत डेटासेट के रूप में उपयोग किया जाता है। क्योंकि डेटासेट एक GPU पर मिनटों में प्रशिक्षित करने के लिए पर्याप्त छोटा है, शोधकर्ता तेजी से पुनरावृत्ति कर सकते हैं। यह शैक्षिक सेटिंग्स में डीप लर्निंग अवधारणाओं को सिखाने के लिए भी अक्सर उपयोग किया जाता है, क्योंकि यह हस्तलिखित अंकों की तुलना में अधिक दिलचस्प दृश्य कार्य प्रदान करता है, जबकि छात्रों के लिए प्रबंधनीय रहता है।
Fashion-MNIST पर विशिष्ट बेंचमार्क परिणाम दिखाते हैं कि एक अच्छी तरह से ट्यून किया गया कन्वोल्यूशनल न्यूरल नेटवर्क लगभग 93-95% सटीकता प्राप्त कर सकता है, जबकि एक सरल लॉजिस्टिक रिग्रेशन मॉडल लगभग 85% तक पहुँचता है। यह अंतर इस कार्य के लिए डीप लर्निंग दृष्टिकोणों के लाभ को उजागर करता है। डेटासेट का उपयोग ट्रांसफर लर्निंग, डेटा ऑग्मेंटेशन रणनीतियों, और विरोधी मजबूती का परीक्षण करने के लिए भी किया गया है, क्योंकि इसकी छवियाँ MNIST की तुलना में अधिक जटिल हैं लेकिन नियंत्रित प्रयोगों के लिए पर्याप्त सरल हैं।
मूल MNIST के साथ तुलना
मूल MNIST डेटासेट में 0 से 9 तक हस्तलिखित अंक शामिल हैं, जो अमेरिकी जनगणना ब्यूरो के कर्मचारियों और हाई स्कूल के छात्रों से एकत्र किए गए थे। जबकि MNIST लगभग हल हो चुका है, कई मॉडल 99.5% से अधिक सटीकता के साथ, Fashion-MNIST आमतौर पर लगभग 96-97% की शीर्ष सटीकता देखता है, जो सुधार के लिए अधिक गुंजाइश छोड़ता है। फैशन छवियों में अधिक किनारे जटिलता और बनावट भिन्नता भी होती है, जो उन्हें ई-कॉमर्स में उत्पाद पहचान जैसे वास्तविक दुनिया के कंप्यूटर विज़न कार्यों के लिए एक बेहतर प्रॉक्सी बनाती है।
एक और अंतर डेटा का स्रोत है। MNIST अंक मैन्युअल रूप से लिखे और स्कैन किए गए थे, जबकि Fashion-MNIST छवियाँ पेशेवर उत्पाद तस्वीरों से प्राप्त होती हैं, जिनमें प्रकाश भिन्नताएँ और पृष्ठभूमि तत्व शामिल हैं। यह Fashion-MNIST को व्यावहारिक अनुप्रयोगों का अधिक प्रतिनिधि बनाता है, फिर भी यह समान कम रिज़ॉल्यूशन और सरल प्रारूप बनाए रखता है जो इसे देखने और संसाधित करने में आसान बनाता है।
सीमाएँ और विस्तार
अपनी लोकप्रियता के बावजूद, Fashion-MNIST की सीमाएँ हैं। 28x28 रिज़ॉल्यूशन बारीक-दानेदार वर्गीकरण के लिए बहुत कम है, और ग्रेस्केल प्रारूप रंग जानकारी को त्याग देता है जो वास्तविक दुनिया की फैशन पहचान में उपयोगी हो सकती है। कुछ शोधकर्ताओं ने डेटासेट को CIFAR-10 या ImageNet जैसे आधुनिक बेंचमार्क की तुलना में बहुत आसान होने के लिए आलोचना की है, जिसमें उच्च रिज़ॉल्यूशन और अधिक श्रेणियों वाली प्राकृतिक छवियाँ शामिल हैं। फिर भी, Fashion-MNIST त्वरित प्रोटोटाइपिंग और शैक्षिक उद्देश्यों के लिए एक मूल्यवान उपकरण बना हुआ है।
डेटासेट के विस्तार में जोड़े गए शोर, रोटेशन, या विरोधी गड़बड़ी वाले Fashion-MNIST वेरिएंट शामिल हैं, जिनका उपयोग मॉडल मजबूती का परीक्षण करने के लिए किया जाता है। कुछ कार्यों ने मल्टी-टास्क लर्निंग बेंचमार्क बनाने के लिए Fashion-MNIST को अन्य डेटासेट के साथ भी जोड़ा है। डेटासेट की सरलता और स्पष्ट लेबलिंग इसे शोधकर्ताओं के लिए अधिक जटिल डेटासेट में स्केल करने से पहले कृत्रिम बुद्धिमत्ता में नए विचारों की खोज के लिए एक विश्वसनीय शुरुआती बिंदु बनाती है।
प्रभाव और विरासत
Fashion-MNIST ने मशीन लर्निंग समुदाय पर एक महत्वपूर्ण प्रभाव डाला है, जो खिलौना समस्याओं और वास्तविक दुनिया के अनुप्रयोगों के बीच की खाई को पाटने वाला एक मानकीकृत, सुलभ बेंचमार्क प्रदान करता है। इसे TensorFlow, PyTorch, और Keras जैसी प्रमुख डीप लर्निंग लाइब्रेरीज़ में एकीकृत किया गया है, जिससे उपयोगकर्ता कोड की एक पंक्ति के साथ डेटासेट लोड कर सकते हैं। इसका व्यापक रूप से अपनाया जाना इसे परिचयात्मक कंप्यूटर विज़न पाठ्यक्रमों और नए प्रस्तावित मॉडलों के प्रदर्शन की तुलना करने के लिए एक वास्तविक मानक बनाता है।
डेटासेट के निर्माताओं ने डेटा लोड करने और देखने के लिए कोड के साथ एक विस्तृत तकनीकी रिपोर्ट और एक GitHub रिपॉजिटरी भी प्रदान की, जिसने इसके तेजी से अपनाने की सुविधा प्रदान की। 2020 के दशक की शुरुआत तक, Fashion-MNIST को सालाना सैकड़ों शोध पत्रों में उद्धृत किया जाता रहा है, और यह कम-रिज़ॉल्यूशन डोमेन में छवि वर्गीकरण एल्गोरिदम विकसित करने वाले किसी भी व्यक्ति के लिए एक अनुशंसित बेंचमार्क बना हुआ है।