CutMix छवि वर्गीकरण कार्यों के लिए तंत्रिका नेटवर्क प्रशिक्षण हेतु एक डेटा संवर्धन तकनीक है। यह छवि पैचों के कट-एंड-पेस्ट को mixup द्वारा प्रस्तुत लेबल मिश्रण रणनीति के साथ जोड़ती है। प्रत्येक प्रशिक्षण पुनरावृत्ति में, एक आयताकार पैच एक प्रशिक्षण छवि से काटकर दूसरी छवि पर चिपकाया जाता है, और प्रशिक्षण लेबल को दो मूल लेबलों के भारित संयोजन के रूप में समायोजित किया जाता है, जिसमें भार चिपकाए गए पैच के क्षेत्रफल के अनुपात में होता है। यह दृष्टिकोण मॉडलों को आंशिक विशेषताओं या भ्रामक सहसंबंधों पर निर्भर रहने के बजाय पूरे ऑब्जेक्ट पर ध्यान केंद्रित करने के लिए प्रोत्साहित करता है, और यह वर्गीकरण सटीकता, क्षति के प्रति मजबूती, और स्थानीयकरण प्रदर्शन में सुधार करने के लिए दिखाया गया है।
यह विधि 2019 के एक पेपर में Sangdoo Yun, Dongyoon Han, Seong Joon Oh, Sanghyuk Chun, Junsuk Choe, और Youngjoon Yoo द्वारा प्रस्तुत की गई थी, जो Clova AI और NAVER Corporation से संबद्ध थे। "CutMix: Regularization Strategy to Train Strong Classifiers with Localizable Features" शीर्षक वाला यह पेपर 2019 IEEE/CVF इंटरनेशनल कॉन्फ्रेंस ऑन कंप्यूटर विज़न (ICCV) में प्रस्तुत किया गया था। अपनी शुरुआत के बाद से, CutMix कई अत्याधुनिक विज़न मॉडलों के प्रशिक्षण पाइपलाइनों में एक मानक घटक बन गया है, जिसे अक्सर अन्य संवर्धन तकनीकों के साथ संयोजन में उपयोग किया जाता है।
तंत्र
CutMix ऑपरेशन निम्नानुसार काम करता है। दो प्रशिक्षण नमूनों \(x_A\) और \(x_B\) को एक-हॉट लेबल \(y_A\) और \(y_B\) के साथ देखते हुए, एल्गोरिदम पहले एक बाइनरी मास्क \(M\) का नमूना लेता है जो बताता है कि प्रत्येक छवि से कौन से पिक्सेल लेने हैं। मास्क एक बाउंडिंग बॉक्स निर्देशांक \((r_x, r_y, r_w, r_h)\) को यादृच्छिक रूप से चुनकर उत्पन्न किया जाता है, जिसमें बॉक्स क्षेत्रफल अनुपात \(\lambda\) को बीटा वितरण से नमूना किया जाता है, आमतौर पर पैरामीटर \(\alpha = 1\) के साथ। नया प्रशिक्षण नमूना छवि A से बॉक्स के बाहर के क्षेत्र और छवि B से बॉक्स के अंदर के क्षेत्र को लेकर बनाया जाता है। संयुक्त नमूने के लिए लेबल \(\tilde{y} = \lambda y_A + (1 - \lambda) y_B\) के रूप में गणना की जाती है, जहाँ \(\lambda\) छवि A से बनाए रखे गए पिक्सेल का अंश है।
यह प्रक्रिया प्रशिक्षण के दौरान ऑन-द-फ्लाई लागू की जाती है, जिसका अर्थ है कि प्रत्येक मिनी-बैच यादृच्छिक रूप से संवर्धित होता है। मास्क बैच में प्रत्येक नमूने के लिए स्वतंत्र रूप से उत्पन्न होता है, जिससे मिश्रित छवियों का एक विविध सेट बनता है। कट की स्थिति और आकार समान रूप से यादृच्छिक होते हैं, जो सुनिश्चित करता है कि मॉडल विभिन्न प्रकार के आंशिक अवरोधों और संयोजनों को देखता है।
अन्य संवर्धन विधियों से संबंध
CutMix पहले की संवर्धन रणनीतियों पर आधारित है। सबसे प्रत्यक्ष पूर्ववर्ती mixup है, जिसे Hongyi Zhang, Moustapha Cisse, Yann N. Dauphin, और David Lopez-Paz ने 2018 में प्रस्तुत किया, जो पिक्सेल मानों और लेबलों का उत्तल संयोजन लेकर पूरी छवियों को मिश्रित करता है। Mixup प्रशिक्षण नमूनों के बीच रैखिक व्यवहार को प्रोत्साहित करता है लेकिन अप्राकृतिक छवियां उत्पन्न कर सकता है जिन्हें मनुष्यों के लिए व्याख्या करना कठिन होता है। इसके विपरीत, CutMix प्रत्येक क्षेत्र के भीतर छवियों की प्राकृतिक उपस्थिति बनाए रखता है, जिससे संवर्धित नमूने अधिक अर्थपूर्ण रूप से सुसंगत होते हैं।
एक अन्य संबंधित तकनीक Cutout है, जिसे Terrance DeVries और Graham W. Taylor ने 2017 में प्रस्तावित किया, जो एक छवि के आयताकार क्षेत्रों को यादृच्छिक रूप से मास्क करके उन्हें शून्य पर सेट करता है। Cutout पिक्सेल स्तर पर ड्रॉपआउट के एक रूप के रूप में कार्य करता है, जो मॉडल को कम प्रमुख विशेषताओं पर निर्भर रहने के लिए मजबूर करता है। CutMix को एक सामान्यीकरण के रूप में देखा जा सकता है जो शून्य-भरे क्षेत्रों को दूसरी छवि के पैच से बदल देता है, जो मिश्रित लेबल के माध्यम से अतिरिक्त पर्यवेक्षी संकेत प्रदान करता है।
CutMix के लेखकों ने अनुभवजन्य रूप से दिखाया कि यह CIFAR-10, CIFAR-100, और ImageNet सहित कई बेंचमार्क डेटासेटों पर mixup और Cutout दोनों से बेहतर प्रदर्शन करता है। उन्होंने यह भी दिखाया कि CutMix मॉडल की ऑब्जेक्ट स्थानीयकरण क्षमता में सुधार करता है, जैसा कि पॉइंटिंग गेम मीट्रिक द्वारा मापा जाता है, क्योंकि मॉडल को मिश्रित छवि को सही ढंग से वर्गीकृत करने के लिए पूरे ऑब्जेक्ट पर ध्यान देना चाहिए।
कार्यान्वयन विवरण
व्यवहार में, CutMix को एक सरल परिवर्तन के रूप में लागू किया जाता है जिसे किसी भी छवि वर्गीकरण प्रशिक्षण लूप में जोड़ा जा सकता है। बैच में छवियों की प्रत्येक जोड़ी के लिए, एल्गोरिदम:
- मिश्रण अनुपात \(\lambda\) प्राप्त करने के लिए बीटा वितरण का नमूना लेता है।
- \(\lambda\) के आधार पर बाउंडिंग बॉक्स निर्देशांक की गणना करता है।
- छवि B से पैच को छवि A में कॉपी करके संयुक्त छवि बनाता है।
- भारित योग के रूप में मिश्रित लेबल की गणना करता है।
कम्प्यूटेशनल ओवरहेड न्यूनतम है, क्योंकि ऑपरेशन में केवल ऐरे स्लाइसिंग और असाइनमेंट शामिल है। यह CutMix को PyTorch या TensorFlow जैसे मौजूदा फ्रेमवर्क में एकीकृत करना आसान बनाता है। कई ओपन-सोर्स कार्यान्वयन मौजूद हैं, और तकनीक को अक्सर यादृच्छिक क्रॉपिंग, फ्लिपिंग, और कलर जिटर जैसे अन्य संवर्धनों के साथ जोड़ा जाता है।
एक व्यावहारिक विचार यह है कि बीटा वितरण पैरामीटर \(\alpha\) संवर्धन की तीव्रता को नियंत्रित करता है। \(\alpha = 1\) के साथ, वितरण समान होता है, जिसका अर्थ है कि सभी मिश्रण अनुपात समान रूप से संभावित होते हैं। \(\alpha\) के छोटे मान (जैसे, 0.2) अधिक चरम मिश्रण उत्पन्न करते हैं जहाँ एक छवि हावी होती है, जबकि बड़े मान अधिक संतुलित मिश्रण उत्पन्न करते हैं। मूल पेपर ने पाया कि \(\alpha = 1\) डेटासेटों में अच्छा काम करता है, लेकिन कुछ अनुवर्ती कार्यों ने विशिष्ट कार्यों के लिए इस पैरामीटर को ट्यून किया है।
अनुप्रयोग और विस्तार
CutMix को छवि वर्गीकरण से परे लागू किया गया है। इसका उपयोग ऑब्जेक्ट डिटेक्शन, सिमेंटिक सेगमेंटेशन, और यहां तक कि विज़न कार्यों के लिए ट्रांसफॉर्मर प्रशिक्षण में भी किया गया है। पैच मिश्रण के विचार को अन्य मोडैलिटी, जैसे ऑडियो और टेक्स्ट, तक विस्तारित किया गया है, हालांकि उन डेटा की असतत प्रकृति के अनुकूलन के साथ।
कई वेरिएंट प्रस्तावित किए गए हैं। उदाहरण के लिए, Puzzle Mix, जिसे 2020 में प्रस्तुत किया गया, ऑब्जेक्ट सीमाओं को संरक्षित करने और प्रमुख भागों के माध्यम से कटने से बचने वाले मिश्रण मास्क खोजने के लिए अधिक परिष्कृत अनुकूलन का उपयोग करता है। एक अन्य वेरिएंट, FMix, अनियमित मिश्रण पैटर्न बनाने के लिए फूरियर डोमेन मास्क का उपयोग करता है। Co-Mixup, जिसे 2021 में प्रस्तावित किया गया, विचार को कई छवियों तक विस्तारित करता है और मिश्रित नमूनों के बीच विविधता को प्रोत्साहित करता है।
डेटा संवर्धन के संदर्भ में, CutMix को अक्सर ड्रॉपआउट और बैच-नॉर्मलाइजेशन जैसी अन्य तकनीकों के साथ संयोजन में उपयोग किया जाता है। यह विशेष रूप से सीमित डेटा पर बड़े मॉडलों को प्रशिक्षित करते समय प्रभावी दिखाया गया है, क्योंकि यह नियमितीकरण का एक रूप प्रदान करता है जो ओवरफिटिंग को कम करता है।
मॉडल मजबूती पर प्रभाव
CutMix के प्रमुख लाभों में से एक इनपुट क्षति और प्रतिकूल गड़बड़ी के प्रति बेहतर मजबूती है। अन्य वर्गों के पैच वाली छवियों पर प्रशिक्षण द्वारा, मॉडल विशेषताओं के व्यापक सेट पर निर्भर रहना सीखता है। यह पृष्ठभूमि संकेतों या बनावट पैटर्नों पर ओवरफिट करने की प्रवृत्ति को कम करता है जो वास्तविक दुनिया के परिदृश्यों में मौजूद नहीं हो सकते हैं।
अध्ययनों से पता चला है कि CutMix के साथ प्रशिक्षित मॉडल ImageNet-C जैसे क्षतिग्रस्त ImageNet संस्करणों पर मानक संवर्धन या अकेले mixup के साथ प्रशिक्षित मॉडलों की तुलना में उच्च सटीकता प्राप्त करते हैं। तकनीक कैलिब्रेशन में भी सुधार करती है, जिसका अर्थ है कि मॉडल की अनुमानित संभावनाएं वास्तविक सटीकता के साथ अधिक संरेखित होती हैं।
इसके अलावा, CutMix को बारीक-वर्गीकरण कार्यों पर मॉडलों के प्रदर्शन में सुधार करने के लिए दिखाया गया है, जहाँ वर्गों के बीच सूक्ष्म अंतर महत्वपूर्ण होते हैं। मिश्रित छवियां मॉडल को वैश्विक आंकड़ों पर निर्भर रहने के बजाय विभेदक भागों पर ध्यान देने के लिए मजबूर करती हैं।
उद्योग में अपनाना
CutMix को शैक्षणिक अनुसंधान और उद्योग दोनों में व्यापक रूप से अपनाया गया है। यह लोकप्रिय डीप लर्निंग लाइब्रेरी और फ्रेमवर्क, जैसे छवि मॉडल के लिए timm लाइब्रेरी और NVIDIA DALI डेटा लोडिंग लाइब्रेरी में शामिल है। ImageNet चैलेंज और अन्य प्रतियोगिताओं में कई अत्याधुनिक मॉडलों ने अपने प्रशिक्षण रेसिपी के हिस्से के रूप में CutMix का उपयोग किया है।
गूगल डीपमाइंड, ओपनएआई, और एंथ्रोपिक जैसी कंपनियों ने CutMix को अपने कंप्यूटर विज़न पाइपलाइनों में शामिल किया है, हालांकि विशिष्ट विवरण अक्सर स्वामित्व वाले होते हैं। तकनीक का उपयोग चिकित्सा इमेजिंग में भी किया जाता है, जहाँ डेटा दुर्लभ होता है और संवर्धन महत्वपूर्ण होता है। उदाहरण के लिए, CutMix को छाती एक्स-रे वर्गीकरण और हिस्टोपैथोलॉजी छवि विश्लेषण पर लागू किया गया है, जिसमें बेहतर सामान्यीकरण दिखाया गया है।
सीमाएं और विचार
अपनी प्रभावशीलता के बावजूद, CutMix की कुछ सीमाएं हैं। यादृच्छिक कट-एंड-पेस्ट कभी-कभी अवास्तविक छवियां बना सकता है, खासकर जब पैच को अर्थपूर्ण रूप से असंगत स्थान पर रखा जाता है। उदाहरण के लिए, एक पक्षी की तस्वीर पर कार का पैच चिपकाना मॉडल को भ्रमित कर सकता है यदि पैच पक्षी के महत्वपूर्ण हिस्से को कवर करता है। हालांकि, मिश्रित लेबल एक नरम लक्ष्य प्रदान करके इसे कम करता है।
एक और विचार यह है कि CutMix मानता है कि इनपुट पिक्सेल का एक ग्रिड है, जो ग्राफ या पॉइंट क्लाउड जैसे अन्य डेटा प्रकारों पर सीधे लागू नहीं होता है। इन मोडैलिटी के लिए विस्तार प्रस्तावित किए गए हैं, लेकिन उन्हें अधिक जटिल मास्किंग रणनीतियों की आवश्यकता होती है।
अंत में, बीटा वितरण पैरामीटर का चुनाव प्रदर्शन को प्रभावित कर सकता है। जबकि \(\alpha = 1\) एक अच्छा डिफ़ॉल्ट है, कुछ कार्य ट्यूनिंग से लाभान्वित हो सकते हैं। मूल पेपर इस पर मार्गदर्शन प्रदान करता है, लेकिन यह एक अनुभवजन्य विकल्प बना हुआ है।
निष्कर्ष
CutMix एक सरल लेकिन शक्तिशाली डेटा संवर्धन तकनीक है जो आधुनिक कंप्यूटर विज़न में एक प्रमुख घटक बन गई है। mixup और Cutout की ताकतों को जोड़कर, यह मॉडलों को नियमित करने और उनकी मजबूती और स्थानीयकरण क्षमताओं में सुधार करने का एक तरीका प्रदान करता है। इसका सरल कार्यान्वयन और बेंचमार्कों में लगातार लाभ इसे कई चिकित्सकों के लिए एक डिफ़ॉल्ट विकल्प बनाते हैं। जैसे-जैसे अनुसंधान जारी है, CutMix के वेरिएंट और विस्तार प्रासंगिक बने रहने की संभावना है, विशेष रूप से सीमित डेटा या चुनौतीपूर्ण स्थितियों वाले डोमेन में।
संदर्भ
- Yun, S., Han, D., Oh, S. J., Chun, S., Choe, J., & Yoo, Y. (2019). CutMix: Regularization Strategy to Train Strong Classifiers with Localizable Features. ICCV.
- Zhang, H., Cisse, M., Dauphin, Y. N., & Lopez-Paz, D. (2018). mixup: Beyond Empirical Risk Minimization. ICLR.
- DeVries, T., & Taylor, G. W. (2017). Improved Regularization of Convolutional Neural Networks with Cutout. arXiv.
- Kim, J.-H., Choo, W., & Song, H. O. (2020). Puzzle Mix: Exploiting Saliency and Local Statistics for Optimal Mixup. ICML.
- Harris, E., Marcu, A., Painter, M., Niranjan, M., Prügel-Bennett, A., & Hare, J. (2020). FMix: Enhancing Mixed Sample Data Augmentation. arXiv.
यह भी देखें
- डेटा संवर्धन
- मिक्सअप (सूची में नहीं, लेकिन संबंधित)
- ड्रॉपआउट
- अवशिष्ट-नेटवर्क
- गहन-शिक्षण
- मशीन-शिक्षण