मोंटे कार्लो ड्रॉपआउट तंत्रिका नेटवर्क में ड्रॉपआउट को अनुमान समय पर सक्रिय करके भविष्यवाणी संबंधी अनिश्चितता का अनुमान लगाने की एक विधि है। प्रशिक्षण के बाद ड्रॉपआउट को अक्षम करने के बजाय, नेटवर्क को विभिन्न ड्रॉपआउट मास्क के साथ कई बार चलाया जाता है, और परिणामी भविष्यवाणियों को औसत करके एक अंतिम आउटपुट बनाया जाता है जिसमें संबंधित प्रसरण होता है। यह प्रसरण मॉडल की अधिज्ञानात्मक अनिश्चितता के अनुमान के रूप में कार्य करता है, जो दर्शाता है कि नेटवर्क प्रशिक्षण डेटा के आधार पर अपनी भविष्यवाणियों में कितना आश्वस्त है।
यह तकनीक यारिन गैल और ज़ौबिन घहरामनी द्वारा उनके 2016 के पेपर, "ड्रॉपआउट एज़ ए बेयesian एप्रोक्सिमेशन: रिप्रेजेंटिंग मॉडल अनसर्टेन्टी इन डीप लर्निंग" में पेश की गई थी। उन्होंने प्रदर्शित किया कि ड्रॉपआउट के साथ प्रशिक्षित तंत्रिका नेटवर्क गणितीय रूप से एक गाऊसी प्रक्रिया के परिवर्तनशील अनुमान के बराबर है, और परीक्षण समय पर ड्रॉपआउट लागू करना इस अनुमानित पश्च वितरण से नमूने लेता है। इस अंतर्दृष्टि ने व्यावहारिक गहन शिक्षण और औपचारिक बेयesian अनुमान के बीच की खाई को पाट दिया, जिससे वास्तुशिल्प परिवर्तनों के बिना मानक संरचनाओं के लिए अनिश्चितता मापन सुलभ हो गया।
सैद्धांतिक आधार
गैल और घहरामनी के कार्य ने स्थापित किया कि ड्रॉपआउट प्रशिक्षण नेटवर्क भारों पर सही पश्च वितरण और बर्नौली यादृच्छिक चरों द्वारा परिभाषित परिवर्तनशील वितरण के बीच कुल्बैक-लाइब्लर विचलन को न्यूनतम करता है। इस ढांचे के तहत, ड्रॉपआउट के साथ प्रत्येक अग्र पास अनुमानित पश्च वितरण से एक नमूना खींचने के अनुरूप है। कई स्टोकेस्टिक अग्र पास करके, भविष्यवाणी वितरण का मोंटे कार्लो अनुमान प्राप्त होता है।
यह अनुमान मनमाने गहराई और अरेखीयता वाले नेटवर्क के लिए मान्य है, बशर्ते प्रशिक्षण के दौरान ड्रॉपआउट संभावना स्थिर रहे। लेखकों ने दिखाया कि परिवर्तनशील वितरण के तहत अपेक्षित हानि, एक स्थिरांक तक, मानक ड्रॉपआउट प्रशिक्षण उद्देश्य के बराबर है। यह समानता ड्रॉपआउट को न केवल एक नियमितीकरणकर्ता के रूप में बल्कि अनिश्चितता अनुमान के लिए एक उपकरण के रूप में भी उपयोग करने का औचित्य सिद्ध करती है।
कार्यान्वयन और प्रक्रिया
मोंटे कार्लो ड्रॉपआउट लागू करने के लिए, एक व्यवसायी पहले सामान्य रूप से ड्रॉपआउट के साथ नेटवर्क को प्रशिक्षित करता है। अनुमान समय पर, ड्रॉपआउट सक्रिय रहता है, और इनपुट को नेटवर्क के माध्यम से T बार पारित किया जाता है, जहाँ T आमतौर पर 10 और 100 के बीच होता है। प्रत्येक पास एक अलग यादृच्छिक ड्रॉपआउट मास्क का उपयोग करता है। अंतिम भविष्यवाणी T आउटपुट का औसत होती है, और अनिश्चितता को इन आउटपुटों के बीच प्रसरण या मानक विचलन के रूप में गणना की जाती है।
वर्गीकरण कार्यों के लिए, प्रत्येक पास से सॉफ्टमैक्स संभावनाओं को औसत किया जाता है, और औसत वितरण की एन्ट्रापी को अनिश्चितता माप के रूप में उपयोग किया जा सकता है। प्रतिगमन कार्यों के लिए, नमूना प्रसरण सीधे भविष्यवाणी संबंधी अनिश्चितता को मापता है। T का चयन एक व्यापार-बंद शामिल करता है: बड़ा T अधिक स्थिर अनुमान उत्पन्न करता है लेकिन कम्प्यूटेशनल लागत बढ़ाता है। व्यवहार में, कई अनुप्रयोगों के लिए T मान 20 से 50 सामान्य हैं।
वैकल्पिक विधियों पर लाभ
मोंटे कार्लो ड्रॉपआउट अन्य बेयesian अनुमान तकनीकों की तुलना में कई व्यावहारिक लाभ प्रदान करता है। इसमें नेटवर्क वास्तुकला या प्रशिक्षण प्रक्रिया में कोई बदलाव की आवश्यकता नहीं होती, जिससे यह मौजूदा मॉडलों में एक ड्रॉप-इन जोड़ बन जाता है। गाऊसी पूर्व वितरणों के साथ परिवर्तनशील अनुमान जैसी विधियों के विपरीत, यह प्रशिक्षण के दौरान अतिरिक्त पैरामीटर या कम्प्यूटेशनल ओवरहेड प्रस्तुत नहीं करता। तकनीक किसी भी मानक अनुकूलक के साथ भी काम करती है, जिसमें एडम और एसजीडी वेरिएंट शामिल हैं, और बैच नॉर्मलाइज़ेशन और लेयर नॉर्मलाइज़ेशन जैसी सामान्य नियमितीकरण तकनीकों के साथ संगत है।
एन्सेम्बल विधियों की तुलना में, जो कई स्वतंत्र मॉडल प्रशिक्षित करते हैं, मोंटे कार्लो ड्रॉपआउट कम्प्यूटेशनल लागत के एक अंश पर समान अनिश्चितता अनुमान प्राप्त करता है। यह कई मॉडलों को संग्रहीत करने की आवश्यकता से भी बचाता है, क्योंकि एक प्रशिक्षित नेटवर्क पर्याप्त है। यह दक्षता इसे संसाधन-सीमित वातावरणों, जैसे एज डिवाइस या वास्तविक समय प्रणालियों में परिनियोजन के लिए विशेष रूप से आकर्षक बनाती है।
गहन शिक्षण में अनुप्रयोग
मोंटे कार्लो ड्रॉपआउट को गहन शिक्षण के विभिन्न क्षेत्रों में व्यापक रूप से अपनाया गया है। कंप्यूटर दृष्टि में, इसका उपयोग अर्थविषयक विभाजन और वस्तु पहचान के लिए किया गया है ताकि उन क्षेत्रों की पहचान की जा सके जहाँ मॉडल अनिश्चित है, जो वेमो और टेस्ला ऑटोपायलट जैसी स्वायत्त ड्राइविंग प्रणालियों के लिए महत्वपूर्ण है। चिकित्सा इमेजिंग में, तकनीक आगे की समीक्षा के लिए अस्पष्ट स्कैन को चिह्नित करने में मदद करती है, जिससे निदान विश्वसनीयता में सुधार होता है।
प्राकृतिक भाषा प्रसंस्करण में, मोंटे कार्लो ड्रॉपआउट को बड़े भाषा मॉडल और ट्रांसफार्मर पर लागू किया गया है ताकि उत्पन्न पाठ में आत्मविश्वास का आकलन किया जा सके। यह विशेष रूप से भ्रामक सामग्री या निम्न-गुणवत्ता वाले आउटपुट का पता लगाने के लिए उपयोगी है। विधि का उपयोग सुदृढीकरण सीखने में अन्वेषण को निर्देशित करने के लिए भी किया गया है, जहाँ अनिश्चितता अनुमान एजेंट के नई क्रियाओं को आज़माने के निर्णय को सूचित करते हैं।
सीमाएँ और विचार
मोंटे कार्लो ड्रॉपआउट की प्राथमिक सीमा यह है कि यह केवल सच्ची बेयesian अनिश्चितता का अनुमान प्रदान करता है। परिवर्तनशील वितरण बर्नौली चरों तक सीमित है, जो जटिल पश्च सहसंबंधों को पकड़ने में सक्षम नहीं हो सकता है। नतीजतन, अनिश्चितता अनुमान गलत-अंशांकित हो सकते हैं, जिसका अर्थ है कि अनुमानित प्रसरण वास्तविक त्रुटि दरों के साथ संरेखित नहीं हो सकता है। तापमान स्केलिंग जैसी अंशांकन तकनीकें इस समस्या को आंशिक रूप से कम कर सकती हैं।
एक और विचार अनुमान समय पर कम्प्यूटेशनल लागत है। कई अग्र पास चलाने से विलंबता बढ़ती है, जो वास्तविक समय अनुप्रयोगों के लिए निषेधात्मक हो सकती है। हालाँकि, इस लागत को आधुनिक हार्डवेयर, जैसे एनवीडिया जीपीयू या गूगल क्लाउड टीपीयू पर पासों को समानांतर करके कम किया जा सकता है। इसके अतिरिक्त, ड्रॉपआउट संभावना का चयन अनिश्चितता अनुमान की गुणवत्ता को प्रभावित करता है; बहुत अधिक या बहुत कम मान प्रदर्शन को खराब कर सकते हैं।
अन्य अनिश्चितता विधियों से संबंध
मोंटे कार्लो ड्रॉपआउट गहन शिक्षण में अनिश्चितता मापन के कई दृष्टिकोणों में से एक है। इसकी तुलना अक्सर गहन एन्सेम्बल से की जाती है, जो विभिन्न प्रारंभिकरणों के साथ कई नेटवर्क प्रशिक्षित करते हैं और उनकी भविष्यवाणियों का औसत करते हैं। एन्सेम्बल आम तौर पर बेहतर अंशांकित अनिश्चितता प्रदान करते हैं लेकिन काफी अधिक प्रशिक्षण कम्प्यूटेशन की आवश्यकता होती है। एक और संबंधित विधि परीक्षण-समय संवर्धन है, जो अनुमान के दौरान डेटा परिवर्तन लागू करती है, लेकिन यह अधिज्ञानात्मक अनिश्चितता के बजाय अवसरजन्य अनिश्चितता को पकड़ती है।
तकनीक मशीन लर्निंग और कृत्रिम बुद्धिमत्ता के व्यापक क्षेत्र से भी जुड़ती है, जहाँ सुरक्षित परिनियोजन के लिए अनिश्चितता अनुमान महत्वपूर्ण है। सक्रिय शिक्षण में, मोंटे कार्लो ड्रॉपआउट लेबलिंग के लिए सबसे सूचनात्मक डेटा बिंदुओं का चयन करने में मदद करता है, जिससे एनोटेशन लागत कम होती है। वितरण-बाह्य पहचान में, स्टोकेस्टिक अग्र पासों से प्रसरण उन इनपुटों की पहचान कर सकता है जो प्रशिक्षण वितरण के बाहर आते हैं।
विस्तार और वेरिएंट
मोंटे कार्लो ड्रॉपआउट के कई विस्तार प्रस्तावित किए गए हैं। कंक्रीट ड्रॉपआउट प्रशिक्षण के दौरान ड्रॉपआउट संभावना को सीखता है, जिससे मॉडल प्रति परत शोर स्तर को अनुकूलित कर सकता है। परिवर्तनशील ड्रॉपआउट बर्नौली मास्क के बजाय निरंतर शोर वितरण का उपयोग करता है, जो एक समृद्ध अनुमान प्रदान करता है। कुछ कार्यों ने अनिश्चितता अनुमानों को और बेहतर बनाने के लिए मोंटे कार्लो ड्रॉपआउट को डेटा संवर्धन के साथ जोड़ा है।
हाल के वर्षों में, तकनीक को जनरेटिव एआई और अनुक्रम-से-अनुक्रम मॉडलों के ढांचे में एकीकृत किया गया है। उदाहरण के लिए, तंत्रिका मशीन अनुवाद में, मोंटे कार्लो ड्रॉपआउट प्रत्येक अनुवादित खंड के लिए आत्मविश्वास स्कोर प्रदान कर सकता है, जिससे मानव समीक्षकों को सहायता मिलती है। विधि को चिकित्सा छवि विभाजन के लिए यू-नेट वास्तुकलाओं में भी खोजा गया है, जहाँ अनिश्चितता मानचित्र उन क्षेत्रों को उजागर करते हैं जिन्हें विशेषज्ञ ध्यान की आवश्यकता होती है।
व्यावहारिक मार्गदर्शन
मोंटे कार्लो ड्रॉपआउट लागू करते समय, व्यवसायियों को यह सुनिश्चित करना चाहिए कि ड्रॉपआउट उन सभी परतों पर लगातार लागू हो जिन्होंने प्रशिक्षण के दौरान इसका उपयोग किया था। पुनरुत्पादन के लिए यादृच्छिक बीज को उचित रूप से सेट करना भी महत्वपूर्ण है। अवशिष्ट कनेक्शन या मल्टी-हेड अटेंशन वाले मॉडलों के लिए, ड्रॉपआउट को मूल प्रशिक्षण कॉन्फ़िगरेशन का पालन करते हुए उचित उप-परतों पर लागू किया जाना चाहिए।
अंशांकन को बेहतर बनाने के लिए एक मान्यता सेट का उपयोग करके आगे पासों की संख्या T और ड्रॉपआउट संभावना को ट्यून किया जा सकता है। कुछ मामलों में, अनुमान पर प्रशिक्षण की तुलना में थोड़ी कम ड्रॉपआउट संभावना का उपयोग करने से बेहतर अंशांकित अनिश्चितता प्राप्त होती है। 2025 तक, मोंटे कार्लो ड्रॉपआउट अनिश्चितता मापन अनुसंधान में एक मानक आधार रेखा बना हुआ है, जिसका उपयोग अक्सर नई विधियों का मूल्यांकन करने के लिए संदर्भ बिंदु के रूप में किया जाता है।
भविष्य की दिशाएँ
अनुसंधान मोंटे कार्लो ड्रॉपआउट को परिष्कृत करने और इसकी सीमाओं को संबोधित करने के लिए जारी है। भारों के बीच सहसंबंधों को पकड़ने वाले बेहतर परिवर्तनशील वितरण विकसित करने के प्रयास चल रहे हैं। अनिश्चितता-जागरूक कुशल मॉडल बनाने के लिए मोंटे कार्लो ड्रॉपआउट को मॉडल प्रूनिंग के साथ संयोजित करने में भी रुचि है। जैसे-जैसे गहन शिक्षण मॉडल पैमाने में बढ़ते हैं, कुशल अनिश्चितता अनुमान तेजी से महत्वपूर्ण होता जाता है, और मोंटे कार्लो ड्रॉपआउट की सरलता इसकी निरंतर प्रासंगिकता सुनिश्चित करती है।
संक्षेप में, मोंटे कार्लो ड्रॉपआउट मानक तंत्रिका नेटवर्क से अनिश्चितता अनुमान प्राप्त करने का एक व्यावहारिक और सैद्धांतिक रूप से आधारित तरीका प्रदान करता है। इसकी कार्यान्वयन में आसानी और व्यापक प्रयोज्यता ने इसे क्षेत्र में एक आधारशिला तकनीक बना दिया है, जो गहन शिक्षण और बेयesian अनुमान के बीच की खाई को पाटता है।