मिक्सअप एक डेटा ऑग्मेंटेशन तकनीक है जिसका उपयोग मशीन लर्निंग मॉडल, विशेष रूप से गहरे तंत्रिका नेटवर्क को प्रशिक्षित करने के लिए किया जाता है। यह इनपुट नमूनों के जोड़े और उनके संबंधित वन-हॉट एन्कोडेड लेबल के उत्तल संयोजन बनाकर सिंथेटिक प्रशिक्षण उदाहरण उत्पन्न करता है। यह विधि 2018 के एक पेपर में होंगयी झांग, मुस्तफा सिसे, यान एन. डौफिन और डेविड लोपेज़-पाज़ द्वारा पेश की गई थी, और तब से यह गहन शिक्षण में व्यापक रूप से अपनाई जाने वाली नियमितीकरण रणनीति बन गई है। प्रशिक्षण उदाहरणों के बीच रैखिक रूप से व्यवहार करने के लिए मॉडल को प्रोत्साहित करके, मिक्सअप ओवरफिटिंग को कम करता है और प्रतिकूल हमलों और दूषित लेबलों के प्रति मजबूती में सुधार करता है।
मिक्सअप का मूल विचार सरल है: दो प्रशिक्षण उदाहरणों (x_i, y_i) और (x_j, y_j) को देखते हुए, एक नया प्रशिक्षण उदाहरण x_tilde = lambda x_i + (1 - lambda) x_j और y_tilde = lambda y_i + (1 - lambda) y_j के रूप में बनाया जाता है, जहां lambda को alpha > 0 के लिए बीटा वितरण Beta(alpha, alpha) से खींचा जाता है। हाइपरपैरामीटर alpha इंटरपोलेशन की ताकत को नियंत्रित करता है; जब alpha शून्य के करीब पहुंचता है, तो मिक्सअप मानक अनुभवजन्य जोखिम न्यूनीकरण में बदल जाता है, जबकि बड़े मान अधिक आक्रामक मिश्रण उत्पन्न करते हैं। यह विधि कम्प्यूटेशनल रूप से सस्ती है, इसे लागू करने के लिए केवल कुछ पंक्तियों के कोड की आवश्यकता होती है, और इसे छवियों, पाठ और ऑडियो सहित डेटा की एक विस्तृत श्रृंखला पर लागू किया जा सकता है।
मिक्सअप नियमितीकरण तकनीकों के एक व्यापक परिवार से संबंधित है जिसमें ड्रॉपआउट, वेट डेके और बैच नॉर्मलाइज़ेशन भी शामिल हैं। इन विधियों के विपरीत, जो नेटवर्क आर्किटेक्चर या अनुकूलन प्रक्रिया को संशोधित करते हैं, मिक्सअप सीधे इनपुट और लेबल स्थान पर काम करता है। यह अद्वितीय दृष्टिकोण कई विविधताओं और विस्तारों को प्रेरित किया है, जैसे कटमिक्स, जो एक छवि के आयताकार क्षेत्र को दूसरी छवि से बदल देता है, और मैनिफोल्ड मिक्सअप, जो तंत्रिका नेटवर्क के छिपे हुए फीचर स्थान में इंटरपोलेशन करता है।
सैद्धांतिक आधार
मिक्सअप के लिए सैद्धांतिक औचित्य विकिनल रिस्क मिनिमाइज़ेशन (VRM) की अवधारणा पर आधारित है, जो 2001 में ओलिवियर चैपल और सहयोगियों द्वारा प्रस्तावित एक ढांचा है। VRM में, प्रशिक्षण डेटा पर अनुभवजन्य जोखिम को कम करने के बजाय, एक विकिनल वितरण पर जोखिम को कम किया जाता है जो प्रत्येक प्रशिक्षण उदाहरण के आसपास के पड़ोस को संभाव्यता द्रव्यमान प्रदान करता है। मिक्सअप को VRM के एक विशिष्ट उदाहरण के रूप में देखा जा सकता है जहां विकिनल वितरण उदाहरणों के जोड़े के बीच रैखिक इंटरपोलेशन द्वारा परिभाषित किया गया है।
शोधकर्ताओं ने कई दृष्टिकोणों से मिक्सअप का विश्लेषण किया है। कार्य की एक पंक्ति दिखाती है कि मिक्सअप एक नियमितीकरणकर्ता के रूप में कार्य करता है जो सीखे गए फ़ंक्शन को छोटा लिप्सचिट्ज़ स्थिरांक रखने के लिए प्रोत्साहित करता है, जिसका अर्थ है कि इनपुट में छोटे बदलाव आउटपुट में छोटे बदलाव लाते हैं। यह गुण बेहतर सामान्यीकरण और मजबूती से जुड़ा है। एक और दृष्टिकोण मिक्सअप को लेबल स्मूथिंग से जोड़ता है, क्योंकि इंटरपोलेटेड लेबल मूल वन-हॉट वैक्टर की तुलना में नरम होते हैं, जो मॉडल की भविष्यवाणियों में अति-आत्मविश्वास को कम कर सकते हैं।
अनुभवजन्य अध्ययनों ने प्रदर्शित किया है कि मिक्सअप तंत्रिका नेटवर्क की प्रतिकूल उदाहरणों के प्रति संवेदनशीलता को कम कर सकता है, जो मॉडल को धोखा देने के लिए तैयार किए गए इनपुट हैं। इनपुट के उत्तल संयोजनों पर प्रशिक्षण द्वारा, मॉडल निर्णय सीमाएं सीखता है जो अधिक रैखिक और तेज, ओवरफिटेड क्षेत्रों से कम प्रवण होती हैं। इसने मिक्सअप को प्रतिकूल मजबूती पाइपलाइनों में एक सामान्य घटक बना दिया है।
कंप्यूटर विज़न में अनुप्रयोग
मिक्सअप को कंप्यूटर विज़न कार्यों में व्यापक रूप से लागू किया गया है, जिसमें छवि वर्गीकरण, वस्तु पहचान और सिमेंटिक विभाजन शामिल हैं। छवि वर्गीकरण में, मिक्सअप को अक्सर यादृच्छिक क्रॉपिंग, फ़्लिपिंग और रंग जिटर जैसी मानक डेटा ऑग्मेंटेशन तकनीकों के लिए ड्रॉप-इन प्रतिस्थापन के रूप में उपयोग किया जाता है। यह सीआईएफएआर-10, सीआईएफएआर-100 और इमेजनेट जैसे बेंचमार्क डेटासेट पर शीर्ष -1 सटीकता में सुधार करने के लिए दिखाया गया है, विशेष रूप से सीमित डेटा के साथ बड़े मॉडल को प्रशिक्षित करते समय।
वस्तु पहचान के लिए, मिक्सअप को बाउंडिंग बॉक्स एनोटेशन को संभालने के लिए अनुकूलित किया गया है। एक दृष्टिकोण, जिसे पहचान के लिए मिक्सअप के रूप में जाना जाता है, छवियों और संबंधित बाउंडिंग बॉक्स और लेबल दोनों को इंटरपोलेट करता है, जिससे मॉडल मिश्रित दृश्यों से सीख सकता है। यह COCO जैसे डेटासेट पर प्रदर्शन में सुधार करने के लिए दिखाया गया है, विशेष रूप से छोटी वस्तुओं के लिए।
सिमेंटिक विभाजन में, मिक्सअप का उपयोग सिंथेटिक प्रशिक्षण जोड़े उत्पन्न करने के लिए किया गया है जो विभिन्न दृश्य संदर्भों को जोड़ते हैं। यह मॉडल को वस्तुओं और पृष्ठभूमि के अनदेखे संयोजनों के लिए सामान्यीकरण करने में मदद करता है। कटमिक्स जैसे विविधताओं को भी विभाजन कार्यों पर लागू किया गया है, जहां मिश्रित क्षेत्रों को वस्तु सीमाओं के साथ सावधानीपूर्वक संरेखित किया जाता है।
प्राकृतिक भाषा प्रसंस्करण में अनुप्रयोग
प्राकृतिक भाषा प्रसंस्करण (NLP) में, मिक्सअप को असतत पाठ डेटा के साथ काम करने के लिए अनुकूलित किया गया है। चूंकि पाठ को इनपुट स्थान में सीधे इंटरपोलेट नहीं किया जा सकता है, अधिकांश दृष्टिकोण एम्बेडिंग स्थान में मिक्सअप लागू करते हैं। उदाहरण के लिए, दो वाक्यों के शब्द एम्बेडिंग को औसत या रैखिक रूप से जोड़ा जा सकता है ताकि एक सिंथेटिक इनपुट प्रतिनिधित्व बनाया जा सके। यह तकनीक, जिसे अक्सर एम्बेडिंग मिक्सअप कहा जाता है, भावना विश्लेषण और विषय वर्गीकरण जैसे पाठ वर्गीकरण कार्यों पर लागू की गई है।
एक और दृष्टिकोण, जिसे सेंटेंस मिक्सअप कहा जाता है, ट्रांसफॉर्मर मॉडल के छिपे हुए राज्यों पर काम करता है। दो वाक्यों के छिपे हुए प्रतिनिधित्व को इंटरपोलेट करके, मॉडल फीचर स्थान में चिकनी निर्णय सीमाएं सीख सकता है। यह प्राकृतिक भाषा अनुमान और परिभाषा पहचान जैसे कार्यों पर प्रदर्शन में सुधार करने के लिए दिखाया गया है।
मिक्सअप को कम-संसाधन सेटिंग्स में डेटा ऑग्मेंटेशन के लिए बड़े भाषा मॉडल (LLM) के साथ भी जोड़ा गया है। उदाहरण के लिए, कुछ-शॉट लर्निंग परिदृश्यों में, मिक्सअप मौजूदा उदाहरणों के एम्बेडिंग के बीच इंटरपोलेट करके अतिरिक्त प्रशिक्षण उदाहरण उत्पन्न कर सकता है, जिससे मॉडल को कम संख्या में लेबल किए गए उदाहरणों से सामान्यीकरण करने में मदद मिलती है। हालांकि, जनरेटिव मॉडल के लिए मिक्सअप का अनुप्रयोग अनुसंधान का एक सक्रिय क्षेत्र बना हुआ है, क्योंकि पाठ का इंटरपोलेशन कभी-कभी शब्दार्थ रूप से असंगत नमूने उत्पन्न कर सकता है।
विविधताएं और विस्तार
मिक्सअप की सीमाओं को संबोधित करने या इसकी प्रयोज्यता का विस्तार करने के लिए कई विविधताएं प्रस्तावित की गई हैं। कटमिक्स, 2019 में पेश किया गया, एक छवि के आयताकार क्षेत्र को दूसरी छवि के पैच से बदल देता है और लेबल को पैच के क्षेत्र के अनुपात में समायोजित करता है। यह दृष्टिकोण मॉडल को छवि के कम प्रमुख हिस्सों पर ध्यान केंद्रित करने के लिए प्रोत्साहित करता है और कई बेंचमार्क पर मिक्सअप से बेहतर प्रदर्शन करने के लिए दिखाया गया है।
मैनिफोल्ड मिक्सअप, 2018 में प्रस्तावित, इनपुट स्थान के बजाय तंत्रिका नेटवर्क की छिपी हुई परतों में इंटरपोलेशन करता है। यह मॉडल को अधिक अमूर्त और अपरिवर्तनीय विशेषताओं को सीखने की अनुमति देता है, और डोमेन अनुकूलन और अर्ध-पर्यवेक्षित शिक्षण जैसे कार्यों पर प्रदर्शन में सुधार करने के लिए दिखाया गया है।
अन्य उल्लेखनीय विविधताओं में पज़ल मिक्स शामिल है, जो शब्दार्थ सामग्री को संरक्षित करने के तरीके से छवियों को मिश्रित करने के लिए सैलिएंसी-आधारित दृष्टिकोण का उपयोग करता है, और एफमिक्स, जो चिकनी मिश्रण पैटर्न बनाने के लिए फूरियर डोमेन मास्किंग का उपयोग करता है। विशिष्ट डेटा प्रकारों के लिए डिज़ाइन किए गए मिक्सअप के संस्करण भी हैं, जैसे भाषण पहचान के लिए ऑडियो मिक्सअप और ग्राफ तंत्रिका नेटवर्क में नोड वर्गीकरण के लिए ग्राफ मिक्सअप।
कार्यान्वयन और व्यावहारिक विचार
अधिकांश गहन शिक्षण ढांचे में मिक्सअप को लागू करना सीधा है। उदाहरण के लिए, PyTorch में, कोई डेटा का एक बैच नमूना कर सकता है, इसे यादृच्छिक रूप से क्रमबद्ध कर सकता है, और बीटा वितरण से खींचे गए स्केलर lambda का उपयोग करके उत्तल संयोजन की गणना कर सकता है। नुकसान की गणना तब इंटरपोलेटेड लेबल का उपयोग करके की जाती है, जो आमतौर पर नरम लक्ष्य होते हैं। इसके लिए नुकसान फ़ंक्शन को नरम लेबल का समर्थन करने की आवश्यकता होती है, जैसे नरम लक्ष्यों के साथ क्रॉस-एन्ट्रॉपी।
एक व्यावहारिक विचार alpha हाइपरपैरामीटर का चयन है। मूल पेपर में, लेखक छवि वर्गीकरण कार्यों के लिए 0.1 और 0.4 के बीच alpha मानों की सिफारिश करते हैं, बड़े मान मजबूत नियमितीकरण प्रदान करते हैं। हालांकि, इष्टतम alpha डेटासेट और मॉडल आर्किटेक्चर के आधार पर भिन्न हो सकता है, और इसे अक्सर सत्यापन सेट का उपयोग करके ट्यून किया जाता है।
मिक्सअप को अन्य नियमितीकरण तकनीकों, जैसे ड्रॉपआउट और वेट डेके के साथ जोड़ा जा सकता है, ताकि सामान्यीकरण में और सुधार हो सके। यह सीखने की दर अनुसूचियों और SGD और Adam जैसे अनुकूलकों के साथ भी संगत है। व्यवहार में, मिक्सअप को अक्सर केवल प्रशिक्षण के दौरान लागू किया जाता है और अनुमान के दौरान अक्षम किया जाता है, क्योंकि मॉडल का मूल्यांकन वास्तविक डेटा पर किया जाता है।
प्रभाव और स्वीकृति
मिक्सअप की शुरूआत ने मशीन लर्निंग समुदाय पर महत्वपूर्ण प्रभाव डाला है। मूल पेपर को हजारों बार उद्धृत किया गया है और इसने बड़ी मात्रा में अनुवर्ती कार्य को प्रेरित किया है। मिक्सअप अब कई चिकित्सकों के टूलबॉक्स में एक मानक उपकरण है, और यह लोकप्रिय गहन शिक्षण पुस्तकालयों और ढांचे में शामिल है।
मिक्सअप को औद्योगिक सेटिंग्स में भी अपनाया गया है। उदाहरण के लिए, Google, Meta और Amazon जैसी कंपनियों के शोधकर्ताओं ने उत्पादन में अपने मॉडल की मजबूती में सुधार के लिए मिक्सअप का उपयोग किया है। यह तकनीक विशेष रूप से अपनी सादगी और प्रभावशीलता के लिए मूल्यवान है, क्योंकि इसे मौजूदा प्रशिक्षण पाइपलाइनों में न्यूनतम परिवर्तन की आवश्यकता होती है।
अपनी सफलता के बावजूद, मिक्सअप सीमाओं के बिना नहीं है। उदाहरणों के बीच रैखिकता की धारणा हमेशा सही नहीं हो सकती है, विशेष रूप से जटिल डेटा वितरण के लिए। कुछ मामलों में, मिक्सअप अवास्तविक प्रशिक्षण उदाहरण उत्पन्न कर सकता है जो प्रदर्शन को नुकसान पहुंचाते हैं। शोधकर्ताओं ने अंतर्निहित डेटा मैनिफोल्ड का सम्मान करने वाली अधिक परिष्कृत मिश्रण रणनीतियों को विकसित करके इन मुद्दों को संबोधित किया है।
अन्य तकनीकों से संबंध
मिक्सअप अन्य डेटा ऑग्मेंटेशन और नियमितीकरण विधियों से निकटता से संबंधित है। यह लेबल स्मूथिंग के साथ समानताएं साझा करता है, जो लक्ष्य लेबल को भी नरम करता है, लेकिन मिक्सअप इनपुट को भी इंटरपोलेट करके आगे बढ़ता है। यह प्रतिकूल प्रशिक्षण से भी संबंधित है, क्योंकि दोनों विधियों का उद्देश्य मजबूती में सुधार करना है, हालांकि वे अलग-अलग तरीकों से काम करते हैं।
Data Augmentation के संदर्भ में, मिक्सअप प्रशिक्षण डेटा की विविधता बढ़ाने के लिए उपयोग की जाने वाली कई तकनीकों में से एक है। अन्य विधियों में कंप्यूटर विज़न में यादृच्छिक क्रॉपिंग, रोटेशन और रंग जिटर, और NLP में बैक-ट्रांसलेशन और समानार्थी प्रतिस्थापन शामिल हैं। मिक्सअप अद्वितीय है क्योंकि यह एक एकल उदाहरण को बदलने के बजाय मौजूदा उदाहरणों को जोड़कर नए उदाहरण बनाता है।
मिक्सअप को Machine learning और Deep learning के व्यापक क्षेत्र से भी जोड़ा गया है, जहां इसे ओवरफिटिंग को रोकने के लिए एक नियमितीकरणकर्ता के रूप में उपयोग किया जाता है। इसके सिद्धांतों को अन्य डोमेन, जैसे Generative AI तक बढ़ाया गया है, जहां इसका उपयोग जनरेटिव मॉडल के प्रशिक्षण में सुधार के लिए किया जा सकता है। यह तकनीक Neural network अनुसंधान के लिए भी प्रासंगिक है, क्योंकि यह अंतर्दृष्टि प्रदान करती है कि नेटवर्क कैसे सीखते और सामान्यीकरण करते हैं।
भविष्य की दिशाएं
मिक्सअप पर शोध विकसित होता रहता है। हाल के कार्य ने Large language model के प्रशिक्षण में मिक्सअप के उपयोग का पता लगाया है, जहां इसे एम्बेडिंग स्थान या आउटपुट लॉगिट्स पर लागू किया जा सकता है। Curriculum Learning और Reinforcement Learning from AI Feedback (RLAIF) जैसी अन्य उन्नत तकनीकों के साथ मिक्सअप को संयोजित करने में भी रुचि है, ताकि मॉडल प्रदर्शन में और सुधार हो सके।
एक और दिशा अनुकूली मिश्रण रणनीतियों का विकास है जो डेटा और मॉडल की वर्तमान स्थिति के आधार पर इष्टतम इंटरपोलेशन पैरामीटर स्वचालित रूप से निर्धारित करते हैं। यह अनुप्रयोगों की एक व्यापक श्रृंखला में मिक्सअप के अधिक कुशल और प्रभावी उपयोग की ओर ले जा सकता है।
जैसे-जैसे Artificial intelligence का क्षेत्र आगे बढ़ता है, मिक्सअप एक प्रासंगिक और उपयोगी तकनीक बने रहने की संभावना है। इसकी सादगी, प्रभावशीलता और व्यापक प्रयोज्यता इसे किसी भी मशीन लर्निंग चिकित्सक के टूलकिट में एक मूल्यवान जोड़ बनाती है।