MNIST-M एक सिंथेटिक छवि डेटासेट है जिसे Machine learning में डोमेन अनुकूलन तकनीकों के मूल्यांकन के लिए डिज़ाइन किया गया है। यह हस्तलिखित अंकों के मूल MNIST डेटासेट से व्युत्पन्न है, लेकिन प्रत्येक अंक को BSDS500 डेटासेट से निकाले गए यादृच्छिक रंगीन पृष्ठभूमि के साथ मिश्रित किया जाता है। परिणाम छवियों का एक सेट है जो अंक संरचना को बनाए रखता है जबकि रंग और बनावट में महत्वपूर्ण दृश्य भिन्नता पेश करता है, जिससे यह मानक MNIST पर प्रशिक्षित मॉडल के लिए एक चुनौतीपूर्ण बेंचमार्क बन जाता है।
इस डेटासेट को 2016 में यारोस्लाव गैनिन और विक्टर लेम्पिट्स्की द्वारा उनके अनसुपरवाइज्ड डोमेन अनुकूलन पर पेपर में पेश किया गया था, जहां उन्होंने एक डोमेन-विरोधी तंत्रिका नेटवर्क प्रस्तावित किया था। MNIST-M तब से डोमेन अनुकूलन साहित्य में एक मानक बेंचमार्क बन गया है, जिसे अक्सर स्रोत डोमेन के रूप में MNIST और लक्ष्य डोमेन के रूप में MNIST-M के साथ जोड़ा जाता है। शोधकर्ता इसका उपयोग यह परीक्षण करने के लिए करते हैं कि मॉडल एक स्वच्छ, ग्रेस्केल स्रोत से शोरगुल वाले, रंगीन लक्ष्य तक कितनी अच्छी तरह सामान्यीकरण करते हैं।
निर्माण और गुण
MNIST-M को MNIST प्रशिक्षण और परीक्षण सेट से प्रत्येक छवि लेकर और इसे BSDS500 डेटासेट से यादृच्छिक पृष्ठभूमि पैच पर समग्रित करके बनाया गया है। अंक को यादृच्छिक रंग में प्रस्तुत किया जाता है, और पृष्ठभूमि भी यादृच्छिक रूप से चुनी जाती है, जिससे विभिन्न प्रकार की उपस्थिति बनती है। छवियां 28x28 पिक्सेल हैं, जो मूल MNIST रिज़ॉल्यूशन से मेल खाती हैं, लेकिन वे ग्रेस्केल के बजाय RGB प्रारूप में हैं। डेटासेट में 60,000 प्रशिक्षण छवियां और 10,000 परीक्षण छवियां हैं, जो MNIST के विभाजन को दर्शाती हैं।
यादृच्छिक मिश्रण डोमेन शिफ्ट पेश करता है: जबकि अंक आकार MNIST के समान हैं, रंग वितरण और पृष्ठभूमि बनावट काफी भिन्न हैं। यह MNIST-M को उन मॉडलों के लिए एक उपयोगी तनाव परीक्षण बनाता है जो निम्न-स्तरीय सुविधाओं पर निर्भर करते हैं, क्योंकि उन्हें अप्रासंगिक रंग जानकारी को अनदेखा करना और आकार पर ध्यान केंद्रित करना सीखना चाहिए।
डोमेन अनुकूलन अनुसंधान में भूमिका
डोमेन अनुकूलन Machine learning का एक उपक्षेत्र है जो एक वितरण (स्रोत) पर मॉडल प्रशिक्षित करने और इसे एक अलग लेकिन संबंधित वितरण (लक्ष्य) पर लागू करने की समस्या को संबोधित करता है। MNIST-M को अक्सर उन प्रयोगों में लक्ष्य डोमेन के रूप में उपयोग किया जाता है जहां MNIST स्रोत के रूप में कार्य करता है। लक्ष्य लेबल किए गए MNIST छवियों पर एक क्लासिफायर प्रशिक्षित करना और फिर बिना लेबल वाली MNIST-M छवियों पर इसके प्रदर्शन का मूल्यांकन करना है, जिसमें मॉडल को अतिरिक्त लेबल के बिना नए डोमेन के अनुकूल होने की उम्मीद है।
एक सामान्य आधार रेखा केवल MNIST पर एक मॉडल प्रशिक्षित करना और MNIST-M पर परीक्षण करना है, जो आमतौर पर डोमेन शिफ्ट के कारण कम सटीकता देता है। डोमेन-विरोधी प्रशिक्षण, फीचर संरेखण, और स्व-पर्यवेक्षित प्रीट्रेनिंग जैसी विधियों ने इस बेंचमार्क पर महत्वपूर्ण सुधार दिखाए हैं। डेटासेट का उपयोग अनसुपरवाइज्ड डोमेन अनुकूलन एल्गोरिदम की तुलना में भी किया जाता है, जहां लक्ष्य डोमेन लेबल केवल मूल्यांकन के लिए उपलब्ध हैं।
संबंधित डेटासेट और वेरिएंट
MNIST-M MNIST-व्युत्पन्न बेंचमार्क के एक परिवार का हिस्सा है, जिसमें MNIST-C (दूषित MNIST), MNIST-R (घुमाया गया MNIST), और SVHN (स्ट्रीट व्यू हाउस नंबर) शामिल हैं, जो डोमेन अनुकूलन लक्ष्य के रूप में भी काम करते हैं। MNIST-C के विपरीत, जो नियतात्मक भ्रष्टाचार लागू करता है, MNIST-M यादृच्छिक पृष्ठभूमि का उपयोग करता है, जिससे यह शैली स्थानांतरण समस्या के समान हो जाता है। डेटासेट को अक्सर मल्टी-सोर्स डोमेन अनुकूलन अध्ययनों में अन्य बेंचमार्क के साथ जोड़ा जाता है।
सीमाएं और आलोचनाएं
जबकि MNIST-M एक मूल्यवान बेंचमार्क है, इसकी सीमाएं हैं। डेटासेट की सिंथेटिक प्रकृति का मतलब है कि MNIST-M पर प्रदर्शन वास्तविक दुनिया के डोमेन शिफ्ट, जैसे कि चिकित्सा इमेजिंग या स्वायत्त ड्राइविंग में सामने आने वाले, पर पूरी तरह से भविष्यवाणी नहीं कर सकता है। इसके अतिरिक्त, यादृच्छिक पृष्ठभूमि कभी-कभी अंक को अस्पष्ट कर सकती है, जिससे कुछ नमूने मनुष्यों के लिए भी वर्गीकृत करना लगभग असंभव हो जाता है। शोधकर्ताओं ने नोट किया है कि MNIST-M DomainNet या Office-Home जैसे अधिक जटिल बेंचमार्क की तुलना में अपेक्षाकृत आसान है, लेकिन यह नई विधियों को मान्य करने के लिए एक उपयोगी पहला कदम बना हुआ है।
डीप लर्निंग में अनुप्रयोग
MNIST-M का व्यापक रूप से Deep learning अनुसंधान में आर्किटेक्चर और प्रशिक्षण तकनीकों का मूल्यांकन करने के लिए उपयोग किया जाता है। यह विशेष रूप से विरोधी प्रशिक्षण, डोमेन-अपरिवर्तनीय फीचर सीखने, और जनरेटिव मॉडल के अध्ययन में लोकप्रिय है। उदाहरण के लिए, कुछ दृष्टिकोण स्रोत डेटा से लक्ष्य-जैसी छवियों को संश्लेषित करने के लिए Generative AI का उपयोग करते हैं, और MNIST-M ऐसी विधियों के लिए एक परीक्षण मंच के रूप में कार्य करता है। डेटासेट का उपयोग शैक्षिक सेटिंग्स में डोमेन शिफ्ट की चुनौतियों और अनुकूलन तकनीकों की प्रभावशीलता को चित्रित करने के लिए भी किया जाता है।
यह भी देखें
संदर्भ
- Ganin, Y., & Lempitsky, V. (2015). Unsupervised Domain Adaptation by Backpropagation. Proceedings of the 32nd International Conference on Machine Learning (ICML).
- Ganin, Y., et al. (2016). Domain-Adversarial Training of Neural Networks. Journal of Machine Learning Research.