ड्रॉपआउट एक नियमितीकरण तकनीक है जिसका उपयोग कृत्रिम तंत्रिका नेटवर्क में प्रशिक्षण डेटा पर जटिल सह-अनुकूलन को रोककर अति-फिटिंग को कम करने के लिए किया जाता है। इस तकनीक में प्रशिक्षण प्रक्रिया के दौरान न्यूरॉन्स के इनपुट और/या आउटपुट को यादृच्छिक रूप से शून्य पर सेट करना शामिल है, न कि अनुमान के दौरान। नेटवर्क से इकाइयों को अस्थायी रूप से हटाकर, ड्रॉपआउट शेष इकाइयों को अधिक मजबूत विशेषताएं सीखने के लिए मजबूर करता है जो अलगाव में अच्छी तरह से काम करती हैं, बजाय अन्य विशिष्ट इकाइयों की उपस्थिति पर निर्भर रहने के। यह दृष्टिकोण Deep learning और Machine learning में एक मानक उपकरण बन गया है, विशेष रूप से बड़े मॉडलों के प्रशिक्षण के लिए जहां अति-फिटिंग एक महत्वपूर्ण जोखिम है।
यह अवधारणा डाइल्यूशन नामक एक पुरानी तकनीक से निकटता से संबंधित है, जो यादृच्छिक रूप से वजन को शून्य की ओर घटाती है। डाइल्यूशन को आमतौर पर कमजोर डाइल्यूशन और मजबूत डाइल्यूशन में विभाजित किया जाता है, जो हटाए गए कनेक्शनों के अंश पर निर्भर करता है। जबकि ड्रॉपआउट को अक्सर डाइल्यूशन का एक विशेष मामला बताया जाता है, यह इस मायने में भिन्न है कि यह व्यक्तिगत वजन के बजाय पूरे नोड्स (वजन मैट्रिक्स में पंक्तियाँ) को हटाता है, जिसका गणितीय विश्लेषण और व्यावहारिक कार्यान्वयन पर प्रभाव पड़ता है।
ऐतिहासिक विकास
तंत्रिका नेटवर्क कनेक्शनों को यादृच्छिक रूप से perturb करने का विचार शोर इंजेक्शन और वजन क्षय पर पहले के काम में निहित है। डाइल्यूशन, ड्रॉपआउट के अग्रदूत के रूप में, 1980 और 1990 के दशक के दौरान हॉपफील्ड नेटवर्क और साहचर्य स्मृति मॉडल के संदर्भ में अध्ययन किया गया था। शोधकर्ताओं ने देखा कि कनेक्शनों के एक छोटे अंश को यादृच्छिक रूप से हटाने से सामान्यीकरण में सुधार हो सकता है, हालांकि सैद्धांतिक समझ सीमित थी।
आधुनिक ड्रॉपआउट को नितिश श्रीवास्तव और जेफ्री हिंटन द्वारा University of Toronto में 2012 के एक पेपर में पेश किया गया था, जिसमें 2014 में प्रकाशित एक अधिक विस्तृत जर्नल लेख था। छवि वर्गीकरण कार्यों में इसके सफल अनुप्रयोग के बाद इस तकनीक ने व्यापक ध्यान आकर्षित किया, जहां इसने पिछले तरीकों की तुलना में अति-फिटिंग को काफी कम कर दिया। 2014 के पेपर ने कई बेंचमार्क डेटासेटों पर सुधार की सूचना दी, जिसमें MNIST हस्तलिखित अंक डेटासेट और CIFAR-10 छवि डेटासेट पर परीक्षण त्रुटि में कमी शामिल है।
अपनी शुरुआत के बाद से, ड्रॉपआउट को विभिन्न रूपों में विस्तारित और अनुकूलित किया गया है, जिसमें इनवर्टेड ड्रॉपआउट शामिल है, जो प्रशिक्षण के दौरान सक्रियणों को स्केल करता है ताकि सुसंगत आउटपुट परिमाण बनाए रखा जा सके, और वैरिएशनल ड्रॉपआउट, जो तकनीक के लिए एक बायेसियन व्याख्या लागू करता है। इन वेरिएंट को कई Neural network आर्किटेक्चर में शामिल किया गया है और प्रमुख Machine learning फ्रेमवर्क द्वारा समर्थित हैं।
गणितीय सूत्रीकरण
एक सामान्यीकृत रैखिक नेटवर्क में, रैखिक नोड्स की एक परत से आउटपुट को \( y_i = \sum_j w_{ij} x_j \) के रूप में वर्णित किया जा सकता है, जहां \( y_i \) नोड \( i \) से आउटपुट है, \( w_{ij} \) डाइल्यूशन से पहले वास्तविक वजन है (जिसे हेब कनेक्शन शक्ति भी कहा जाता है), और \( x_j \) नोड \( j \) से इनपुट है। वेक्टर संकेतन में, इसे \( \mathbf{y} = \mathbf{W} \mathbf{x} \) के रूप में लिखा जाता है, जहां \( \mathbf{y} \) आउटपुट वेक्टर है, \( \mathbf{W} \) वजन मैट्रिक्स है, और \( \mathbf{x} \) इनपुट वेक्टर है।
कमजोर डाइल्यूशन के दौरान, हटाए गए कनेक्शनों का सीमित अंश छोटा होता है, जिससे एक छोटी अनिश्चितता उत्पन्न होती है। इस किनारे-मामले को माध्य क्षेत्र सिद्धांत के साथ सटीक रूप से हल किया जा सकता है। डाइल्यूटेड वजन \( \hat{w}_{ij} \) को \( \hat{w}_{ij} = c w_{ij} \) द्वारा दिया जाता है, जहां \( c \) एक यादृच्छिक चर है जो एक संभाव्यता वितरण \( P(c) \) का पालन करता है, जो वजन रखने की संभावना का प्रतिनिधित्व करता है। कमजोर डाइल्यूशन में, केवल वजन का एक छोटा और निश्चित अंश डाइल्यूट किया जाता है, और जब योग में पदों की संख्या अनंत तक जाती है, तो यह अनंत रहता है, जिससे माध्य क्षेत्र सिद्धांत लागू किया जा सकता है।
मजबूत डाइल्यूशन तब होता है जब हटाए गए कनेक्शनों का सीमित अंश बड़ा होता है, जिससे एक बड़ी अनिश्चितता उत्पन्न होती है। इस क्षेत्र में, माध्य क्षेत्र सिद्धांत के लिए धारणाएं अब मान्य नहीं हो सकती हैं, और विश्लेषण अधिक जटिल हो जाता है।
ड्रॉपआउट वजन समीकरण का एक विशेष मामला है जहां वेक्टर मैट्रिक्स में एक पूरी पंक्ति हटा दी जाती है, बजाय यादृच्छिक व्यक्तिगत वजन के। डाइल्यूटेड पंक्ति \( \hat{\mathbf{w}}_j \) को \( \hat{\mathbf{w}}_j = c \mathbf{w}_j \) द्वारा दिया जाता है, जहां \( c \) वजन मैट्रिक्स में एक पंक्ति रखने की संभावना है। क्योंकि ड्रॉपआउट एक पूरी पंक्ति हटाता है, कमजोर डाइल्यूशन के लिए पिछली धारणाएं और माध्य क्षेत्र सिद्धांत का उपयोग लागू नहीं होता है।
तंत्र और कार्यान्वयन
प्रशिक्षण के दौरान, ड्रॉपआउट प्रत्येक फॉरवर्ड पास पर न्यूरॉन सक्रियणों के एक अंश को यादृच्छिक रूप से शून्य पर सेट करता है। यह अंश, जिसे अक्सर ड्रॉपआउट दर कहा जाता है, एक हाइपरपैरामीटर है जो आमतौर पर 0.2 और 0.5 के बीच सेट होता है। प्रत्येक प्रशिक्षण उदाहरण के लिए, इकाइयों का एक अलग सेट हटा दिया जाता है, प्रभावी रूप से पतले नेटवर्कों का एक समूह बनाता है जो वजन साझा करते हैं। अनुमान के समय, सभी इकाइयों का उपयोग किया जाता है, लेकिन उनके आउटपुट को सक्रिय इकाइयों की बढ़ी हुई संख्या के लिए रखने की संभावना द्वारा स्केल किया जाता है।
जिस प्रक्रिया से एक नोड को शून्य पर ले जाया जाता है, चाहे वजन को शून्य पर सेट करके, नोड को हटाकर, या किसी अन्य माध्यम से, अंतिम परिणाम को प्रभावित नहीं करता है और एक नया और अद्वितीय मामला नहीं बनाता है। यदि तंत्रिका नेट को एक उच्च-प्रदर्शन डिजिटल ऐरे-गुणक द्वारा संसाधित किया जाता है, तो प्रक्रिया ग्राफ में मान को देर से शून्य पर ले जाना अधिक प्रभावी होने की संभावना है। यदि नेट को एक सीमित हार्डवेयर कार्यान्वयन द्वारा संसाधित किया जाता है, जैसे कि AMD या Intel त्वरक, विशिष्ट विधि दक्षता को प्रभावित कर सकती है लेकिन परिणाम को नहीं।
व्यवहार में, ड्रॉपआउट को कनवल्शनल परतों की तुलना में पूरी तरह से जुड़ी परतों पर अधिक बार लागू किया जाता है, हालांकि इसका उपयोग नेटवर्क के किसी भी हिस्से में किया जा सकता है। Large language model आर्किटेक्चर जैसे Transformer (architecture) के लिए, ड्रॉपआउट को अक्सर ध्यान परतों और फीड-फॉरवर्ड परतों के आउटपुट पर लागू किया जाता है, जिसकी दरें आमतौर पर लगभग 0.1 होती हैं। TensorFlow और PyTorch जैसे आधुनिक फ्रेमवर्क अंतर्निहित ड्रॉपआउट परतें प्रदान करते हैं जो स्केलिंग को स्वचालित रूप से संभालते हैं।
डाइल्यूशन से संबंध
डाइल्यूशन और ड्रॉपआउट संबंधित लेकिन अलग तकनीकें हैं। डाइल्यूशन यादृच्छिक रूप से वजन को शून्य की ओर घटाता है, जबकि ड्रॉपआउट पूरे न्यूरॉन सक्रियणों को शून्य पर सेट करता है। डाइल्यूशन को आमतौर पर कमजोर और मजबूत डाइल्यूशन में विभाजित किया जाता है, जिसमें उनके बीच की सीमा पर कोई स्पष्ट अंतर नहीं होता है, अक्सर एक विशिष्ट उपयोग-मामले के पूर्ववृत्त पर निर्भर करता है और सटीक समाधानों के लिए हल करने के तरीके पर प्रभाव डालता है।
कभी-कभी इनपुट में डंपिंग शोर जोड़ने के लिए डाइल्यूशन का उपयोग किया जाता है। उस मामले में, कमजोर डाइल्यूशन थोड़ी मात्रा में डंपिंग शोर जोड़ने को संदर्भित करता है, जबकि मजबूत डाइल्यूशन अधिक मात्रा में डंपिंग शोर जोड़ने को संदर्भित करता है। दोनों को वजन डाइल्यूशन के वेरिएंट के रूप में फिर से लिखा जा सकता है।
इन तकनीकों को कभी-कभी वजन की यादृच्छिक छंटाई के रूप में भी संदर्भित किया जाता है, लेकिन यह आमतौर पर एक गैर-आवर्ती एक-तरफ़ा ऑपरेशन है। नेटवर्क को छंटनी की जाती है, और फिर रखा जाता है यदि यह पिछले मॉडल पर सुधार है। डाइल्यूशन और ड्रॉपआउट दोनों एक पुनरावृत्त प्रक्रिया को संदर्भित करते हैं, जहां तकनीक लागू होने के बाद नेटवर्क सीखना जारी रखता है। इसके विपरीत, वजन छंटाई आमतौर पर यह नहीं दर्शाती है कि नेटवर्क सीखना जारी रखता है।
लाभ और सीमाएं
ड्रॉपआउट तंत्रिका नेटवर्क के प्रशिक्षण में कई लाभ प्रदान करता है। यह जटिल सह-अनुकूलन को रोककर अति-फिटिंग को कम करता है, जहां न्यूरॉन्स विशिष्ट अन्य न्यूरॉन्स पर बहुत अधिक निर्भर होते हैं। यह अदृश्य डेटा पर बेहतर सामान्यीकरण की ओर ले जाता है। ड्रॉपआउट मॉडल औसत के एक रूप के रूप में भी कार्य करता है, क्योंकि यह पतले नेटवर्कों के एक समूह को प्रशिक्षित करता है और अनुमान के समय उनकी भविष्यवाणियों का औसत करता है। यह मजबूती में सुधार कर सकता है और भविष्यवाणियों में भिन्नता को कम कर सकता है।
हालांकि, ड्रॉपआउट की सीमाएं हैं। यह प्रशिक्षण समय बढ़ाता है, क्योंकि नेटवर्क को यादृच्छिक रूप से लापता इकाइयों के साथ सीखना चाहिए, जो अभिसरण को धीमा कर सकता है। ड्रॉपआउट दर को सावधानीपूर्वक ट्यून किया जाना चाहिए; बहुत अधिक दर अंडरफिटिंग का कारण बन सकती है, जबकि बहुत कम दर थोड़ा नियमितीकरण लाभ प्रदान करती है। स्थानिक सहसंबंधों के साथ कनवल्शनल परतों के लिए ड्रॉपआउट कम प्रभावी है, जहां बैच सामान्यीकरण या वजन क्षय जैसी अन्य तकनीकों को प्राथमिकता दी जा सकती है।
Generative AI और Artificial intelligence प्रणालियों के संदर्भ में, ड्रॉपआउट का उपयोग अक्सर अन्य नियमितीकरण विधियों के साथ किया जाता है। उदाहरण के लिए, OpenAI और Google DeepMind द्वारा विकसित Transformer (architecture)-आधारित मॉडलों में, बड़े डेटासेटों पर अति-फिटिंग को रोकने के लिए ध्यान वजन और फीड-फॉरवर्ड परतों पर ड्रॉपआउट लागू किया जाता है।
आधुनिक AI में अनुप्रयोग
ड्रॉपआउट विभिन्न डोमेनों में गहरे तंत्रिका नेटवर्क के प्रशिक्षण में एक मानक घटक बन गया है। कंप्यूटर विज़न में, इसका उपयोग छवि वर्गीकरण और वस्तु पहचान के लिए कनवल्शनल नेटवर्क में किया जाता है। प्राकृतिक भाषा प्रसंस्करण में, इसे भाषा मॉडलिंग और अनुवाद जैसे कार्यों के लिए आवर्ती नेटवर्क और ट्रांसफार्मर में लागू किया जाता है। सुदृढीकरण सीखने में, ड्रॉपआउट का उपयोग नीति नेटवर्क और मूल्य कार्यों को नियमित करने के लिए किया जा सकता है।
Large language model प्रशिक्षण के लिए, ड्रॉपआउट को अक्सर कम दरों के साथ लागू किया जाता है, क्योंकि डेटा और मॉडल मापदंडों का विशाल पैमाना पहले से ही कुछ नियमितीकरण प्रदान करता है। हालांकि, यह छोटे मॉडलों या सीमित प्रशिक्षण डेटा के लिए उपयोगी बना हुआ है। Anthropic और Amazon Web Services जैसी कंपनियां विभिन्न AI सेवाओं के लिए अपनी प्रशिक्षण पाइपलाइनों में ड्रॉपआउट शामिल करती हैं।
ड्रॉपआउट अनिश्चितता अनुमान में भी अनुप्रयोग पाता है। अनुमान के समय ड्रॉपआउट लागू करके, जिसे मोंटे कार्लो ड्रॉपआउट के रूप में जाना जाता है, मॉडल विभिन्न हटाई गई इकाइयों के साथ कई भविष्यवाणियां उत्पन्न कर सकते हैं, जिससे भविष्य कहनेवाला अनिश्चितता का अनुमान लगाया जा सकता है। यह सुरक्षा-महत्वपूर्ण अनुप्रयोगों जैसे स्वायत्त ड्राइविंग में उपयोगी है, जहां Waymo या Tesla द्वारा विकसित प्रणालियां अनिश्चितता मात्रा निर्धारण से लाभान्वित हो सकती हैं।
सैद्धांतिक दृष्टिकोण
सैद्धांतिक दृष्टिकोण से, ड्रॉपआउट को स्टोकेस्टिक नियमितीकरण के एक रूप के रूप में व्याख्या किया जा सकता है। यह प्रशिक्षण प्रक्रिया में शोर पेश करता है, जिसे सुविधा स्तर पर डेटा वृद्धि के एक प्रकार के रूप में देखा जा सकता है। कुछ शोधकर्ताओं ने ड्रॉपआउट को बायेसियन अनुमान से जोड़ा है, जहां ड्रॉपआउट दर नेटवर्क वजन पर एक पूर्व के अनुरूप होती है।
Stanford AI Lab और BAIR (Berkeley AI Research) जैसे संस्थानों के शोधकर्ताओं ने ड्रॉपआउट के सैद्धांतिक गुणों का अध्ययन किया है, जिसमें हानि परिदृश्य और सामान्यीकरण सीमाओं पर इसका प्रभाव शामिल है। जबकि एक पूर्ण सैद्धांतिक समझ एक खुली समस्या बनी हुई है, अनुभवजन्य साक्ष्य इसकी प्रभावशीलता का दृढ़ता से समर्थन करते हैं।
निष्कर्ष
ड्रॉपआउट एक सरल लेकिन शक्तिशाली नियमितीकरण तकनीक है जिसका Deep learning के क्षेत्र पर गहरा प्रभाव पड़ा है। प्रशिक्षण के दौरान यादृच्छिक रूप से इकाइयों को हटाकर, यह अति-फिटिंग को रोकता है और सामान्यीकरण में सुधार करता है, जिससे यह Machine learning चिकित्सक के टूलकिट में एक मौलिक उपकरण बन जाता है। डाइल्यूशन के साथ इसका संबंध स्टोकेस्टिक नियमितीकरण विधियों के एक व्यापक परिवार को उजागर करता है, और आधुनिक आर्किटेक्चर में इसका निरंतर उपयोग इसकी स्थायी प्रासंगिकता को रेखांकित करता है।