कृत्रिम तंत्रिका नेटवर्क में, किसी नोड का सक्रियण फलन एक फलन है जो नोड के व्यक्तिगत इनपुट और उनके भार के आधार पर नोड के आउटपुट की गणना करता है। यदि सक्रियण फलन अरैखिक है, तो केवल कुछ नोड्स का उपयोग करके गैर-तुच्छ समस्याओं को हल किया जा सकता है। सक्रियण फलन तंत्रिका नेटवर्क का एक मुख्य घटक हैं, जो यह निर्धारित करते हैं कि संकेत परतों के माध्यम से कैसे प्रसारित होते हैं और नेटवर्क को डेटा में जटिल पैटर्न सीखने में सक्षम बनाते हैं। इनका उपयोग लगभग हर आधुनिक मशीन लर्निंग मॉडल में किया जाता है, जिसमें डीप लर्निंग सिस्टम जैसे बड़े भाषा मॉडल और ट्रांसफॉर्मर शामिल हैं।
सक्रियण फलनों को उनके गणितीय गुणों, जैसे अरैखिकता, परिसर और अवकलनीयता, के आधार पर वर्गीकृत किया जा सकता है, जो प्रशिक्षण स्थिरता और दक्षता को प्रभावित करते हैं। वर्षों से, शोधकर्ताओं ने कई सक्रियण फलन विकसित किए हैं, जिनमें से प्रत्येक के विशिष्ट लाभ और व्यापार-नुकसान हैं। सक्रियण फलन का चुनाव मॉडल के प्रदर्शन, अभिसरण गति और लुप्त ग्रेडिएंट जैसी समस्याओं से बचने की क्षमता को महत्वपूर्ण रूप से प्रभावित कर सकता है।
ऐतिहासिक विकास
सक्रियण फलनों की अवधारणा प्रारंभिक कृत्रिम न्यूरॉन मॉडलों से जुड़ी है, जैसे कि 1958 में फ्रैंक रोसेनब्लैट द्वारा प्रस्तुत पर्सेप्ट्रॉन, जिसमें बाइनरी स्टेप सक्रियण का उपयोग किया गया था। हालाँकि, स्टेप फलन अवकलनीय नहीं है, जो ग्रेडिएंट-आधारित अनुकूलन में इसके उपयोग को सीमित करता है। 1980 के दशक में, लॉजिस्टिक सिग्मॉइड फलन लोकप्रिय हो गया क्योंकि यह स्मूथ और अवकलनीय है, जिससे बैकप्रोपेगेशन संभव हुआ। 1986 में, डेविड रुमेलहार्ट, जेफ्री हिंटन और रोनाल्ड विलियम्स ने बैकप्रोपेगेशन को लोकप्रिय बनाया, जो अवकलनीय सक्रियण फलनों पर निर्भर करता है।
2010 के दशक में रेक्टिफाइड लीनियर यूनिट्स (ReLU) की ओर बदलाव देखा गया, जिसने लुप्त ग्रेडिएंट समस्या को कम करने में मदद की। ReLU का उपयोग 2012 के AlexNet कंप्यूटर विज़न मॉडल में किया गया था, जिसने ImageNet प्रतियोगिता जीती, और 2015 के ResNet मॉडल में, जिसने बहुत गहरे नेटवर्क के प्रशिक्षण को सक्षम किया। 2018 में, गाऊसी एरर लीनियर यूनिट (GELU) पेश किया गया और BERT मॉडल में उपयोग किया गया, जो प्राकृतिक भाषा प्रसंस्करण के लिए एक मौलिक ट्रांसफॉर्मर आर्किटेक्चर है। हाल ही में, 2017 में Google के शोधकर्ताओं द्वारा Swish (जिसे SiLU भी कहा जाता है) प्रस्तावित किया गया, जो एक स्मूथ, गैर-मोनोटोनिक विकल्प प्रदान करता है।
अरैखिकता और सार्वभौमिक सन्निकटन
सक्रियण फलनों का एक प्रमुख गुण अरैखिकता है। जब सक्रियण फलन अरैखिक होता है, तो दो-परत वाले तंत्रिका नेटवर्क को सार्वभौमिक फलन सन्निकटक साबित किया जा सकता है, जिसका अर्थ है कि यह किसी भी सतत फलन को एक कॉम्पैक्ट डोमेन पर मनमानी सटीकता तक अनुमानित कर सकता है। इसे सार्वभौमिक सन्निकटन प्रमेय के रूप में जाना जाता है। पहचान सक्रियण फलन इस गुण को संतुष्ट नहीं करता है; जब कई परतें पहचान सक्रियण फलन का उपयोग करती हैं, तो पूरा नेटवर्क एकल-परत मॉडल के बराबर होता है, जो जटिल फलनों का प्रतिनिधित्व करने की क्षमता खो देता है। अरैखिक सक्रियण फलन तंत्रिका नेटवर्क को डेटा में अरैखिक संबंध सीखने की अनुमति देते हैं, जो छवि पहचान, भाषण प्रसंस्करण और भाषा समझ जैसे कार्यों के लिए आवश्यक है।
परिसर और प्रशिक्षण स्थिरता
सक्रियण फलनों के अलग-अलग परिसर होते हैं, जो ग्रेडिएंट-आधारित प्रशिक्षण को प्रभावित करते हैं। जब सक्रियण फलन का परिसर परिमित होता है, तो ग्रेडिएंट-आधारित प्रशिक्षण विधियाँ अधिक स्थिर होती हैं, क्योंकि पैटर्न प्रस्तुतियाँ केवल सीमित भार को महत्वपूर्ण रूप से प्रभावित करती हैं। उदाहरण के लिए, सिग्मॉइड फलन 0 और 1 के बीच मान आउटपुट करता है, और tanh फलन -1 और 1 के बीच मान आउटपुट करता है। जब परिसर अनंत होता है, तो प्रशिक्षण आम तौर पर अधिक कुशल होता है क्योंकि पैटर्न प्रस्तुतियाँ अधिकांश भार को महत्वपूर्ण रूप से प्रभावित करती हैं, लेकिन अस्थिरता से बचने के लिए आमतौर पर छोटी सीखने की दर आवश्यक होती है। ReLU का एक असीमित सकारात्मक परिसर है, जो तेज़ सीखने की ओर ले जा सकता है लेकिन मृत न्यूरॉन्स जैसी संभावित समस्याएं भी पैदा कर सकता है।
अवकलनीयता और ग्रेडिएंट-आधारित अनुकूलन
निरंतर अवकलनीय सक्रियण फलन ग्रेडिएंट-आधारित अनुकूलन विधियों को सक्षम करने के लिए वांछनीय हैं, क्योंकि वे बैकप्रोपेगेशन के लिए ग्रेडिएंट की गणना की अनुमति देते हैं। ReLU शून्य पर निरंतर अवकलनीय नहीं है, लेकिन उपग्रेडिएंट का उपयोग करना या शून्य पर व्युत्पन्न को 0 या 1 के रूप में परिभाषित करना संभव है। बाइनरी स्टेप सक्रियण फलन 0 पर अवकलनीय नहीं है और अन्य सभी मानों के लिए 0 पर अवकलित होता है, इसलिए ग्रेडिएंट-आधारित विधियाँ इसके साथ कोई प्रगति नहीं कर सकती हैं। गैर-संतृप्त सक्रियण फलन, जैसे ReLU, संतृप्त सक्रियण फलनों से बेहतर हो सकते हैं क्योंकि उनमें लुप्त ग्रेडिएंट समस्या से ग्रस्त होने की संभावना कम होती है, जहां गहरे नेटवर्क में ग्रेडिएंट अत्यंत छोटे हो जाते हैं।
सामान्य सक्रियण फलन
सिग्मॉइड (लॉजिस्टिक)
सिग्मॉइड फलन, जिसे लॉजिस्टिक फलन भी कहा जाता है, को \( \sigma(x) = \frac{1}{1 + e^{-x}} \) के रूप में परिभाषित किया गया है। यह 0 और 1 के बीच मान आउटपुट करता है, जो इसे बाइनरी वर्गीकरण और संभावनाओं के लिए आउटपुट परत के रूप में उपयोगी बनाता है। हालाँकि, यह चरम मानों पर संतृप्ति से ग्रस्त है, जिससे लुप्त ग्रेडिएंट होते हैं। सिग्मॉइड का उपयोग 2012 में हिंटन एट अल. द्वारा विकसित भाषण पहचान मॉडल में किया गया था।
Tanh (हाइपरबोलिक टैन्जेंट)
tanh फलन को \( \tanh(x) = \frac{e^x - e^{-x}}{e^x + e^{-x}} \) के रूप में परिभाषित किया गया है, और यह -1 और 1 के बीच मान आउटपुट करता है। यह शून्य-केंद्रित है, जो अक्सर सिग्मॉइड की तुलना में अनुकूलन को आसान बनाता है। Tanh आमतौर पर आवर्तक तंत्रिका नेटवर्क और छिपी परत सक्रियण के रूप में उपयोग किया जाता है।
ReLU (रेक्टिफाइड लीनियर यूनिट)
ReLU को \( \text{ReLU}(x) = \max(0, x) \) के रूप में परिभाषित किया गया है। यह कम्प्यूटेशनल रूप से कुशल है और लुप्त ग्रेडिएंट को कम करने में मदद करता है, क्योंकि सकारात्मक इनपुट के लिए इसका व्युत्पन्न 1 है। हालाँकि, यह मृत न्यूरॉन्स से ग्रस्त हो सकता है, जहां इकाइयाँ स्थायी रूप से निष्क्रिय हो जाती हैं। ReLU का उपयोग AlexNet और ResNet में किया गया था।
लीकी ReLU और पैरामीट्रिक ReLU
लीकी ReLU नकारात्मक इनपुट के लिए एक छोटी सकारात्मक ढलान की अनुमति देता है, जैसे \( \text{LeakyReLU}(x) = \max(0.01x, x) \), ताकि मृत न्यूरॉन्स से बचा जा सके। पैरामीट्रिक ReLU (PReLU) प्रशिक्षण के दौरान ढलान पैरामीटर सीखता है, जो अधिक लचीलापन प्रदान करता है।
GELU (गाऊसी एरर लीनियर यूनिट)
GELU ReLU का एक स्मूथ सन्निकटन है, जिसे \( \text{GELU}(x) = x \cdot \Phi(x) \) के रूप में परिभाषित किया गया है, जहां \( \Phi \) मानक सामान्य वितरण का संचयी वितरण फलन है। इसका उपयोग BERT और कई आधुनिक ट्रांसफॉर्मर में किया गया था, जो स्मूथ ग्रेडिएंट और अक्सर बेहतर प्रदर्शन प्रदान करता है।
Swish / SiLU
Swish, जिसे SiLU (सिग्मॉइड लीनियर यूनिट) भी कहा जाता है, को \( \text{Swish}(x) = x \cdot \sigma(x) \) के रूप में परिभाषित किया गया है। यह स्मूथ और गैर-मोनोटोनिक है, जो कुछ गहरे नेटवर्क में प्रदर्शन में सुधार करने के लिए दिखाया गया है। Swish को 2017 में Google के शोधकर्ताओं द्वारा प्रस्तावित किया गया था।
सॉफ्टप्लस
सॉफ्टप्लस ReLU का एक स्मूथ सन्निकटन है, जिसे \( \text{softplus}(x) = \ln(1 + e^x) \) के रूप में परिभाषित किया गया है। इसका एक सख्ती से सकारात्मक परिसर है, जो इसे वैरिएशनल ऑटोएन्कोडर में भिन्नता की भविष्यवाणी के लिए उपयुक्त बनाता है।
गणितीय विवरण
सबसे सामान्य सक्रियण फलनों को तीन श्रेणियों में विभाजित किया जा सकता है: रिज फलन, रेडियल फलन और फोल्ड फलन। एक सक्रियण फलन \( f \) संतृप्त होता है यदि \( \lim_{|v| \to \infty} |\nabla f(v)| = 0 \), और गैर-संतृप्त होता है यदि सीमा शून्य नहीं है। गैर-संतृप्त फलन, जैसे ReLU, लुप्त ग्रेडिएंट के प्रति कम प्रवण होते हैं।
रिज सक्रियण फलन
रिज फलन बहुचर फलन होते हैं जो इनपुट चर के रैखिक संयोजन पर कार्य करते हैं। उदाहरणों में शामिल हैं:
- रैखिक सक्रियण: \( \phi(\mathbf{v}) = a + \mathbf{v}'\mathbf{b} \)
- ReLU सक्रियण: \( \phi(\mathbf{v}) = \max(0, a + \mathbf{v}'\mathbf{b}) \)
- हेविसाइड सक्रियण: \( \phi(\mathbf{v}) = 1_{a + \mathbf{v}'\mathbf{b} > 0} \)
- लॉजिस्टिक सक्रियण: \( \phi(\mathbf{v}) = (1 + \exp(-a - \mathbf{v}'\mathbf{b}))^{-1} \)
जैविक रूप से प्रेरित तंत्रिका नेटवर्क में, सक्रियण फलन आमतौर पर कोशिका में क्रिया क्षमता फायरिंग की दर का प्रतिनिधित्व करने वाला एक अमूर्तन है। अपने सरलतम रूप में, यह फलन बाइनरी है, जिसका अर्थ है कि न्यूरॉन या तो फायर कर रहा है या नहीं। न्यूरॉन एक निश्चित दर से तेज़ फायर नहीं कर सकते हैं, जो सिग्मॉइड सक्रियण फलनों को प्रेरित करता है जिनका आउटपुट परिसर एक परिमित अंतराल तक सीमित है।
रेडियल सक्रियण फलन
रेडियल आधार फलन (RBF) के रूप में जाने जाने वाले सक्रियण फलनों का एक विशेष वर्ग RBF नेटवर्क में उपयोग किया जाता है। ये सक्रियण फलन कई रूप ले सकते हैं, लेकिन वे आमतौर पर गाऊसी फलनों के रूप में पाए जाते हैं: \( \phi(\mathbf{v}) = \exp(-\|\mathbf{v} - \mathbf{c}\|^2 / (2\sigma^2)) \), जहां \( \mathbf{c} \) केंद्र है और \( \sigma \) चौड़ाई को नियंत्रित करता है। RBF नेटवर्क फलन सन्निकटन के लिए इन स्थानीय ग्रहणशील क्षेत्रों का उपयोग करते हैं।
व्यावहारिक विचार
सक्रियण फलन चुनते समय, चिकित्सक कम्प्यूटेशनल लागत, ग्रेडिएंट व्यवहार और विशिष्ट कार्य जैसे कारकों पर विचार करते हैं। गहरे नेटवर्क के लिए, ReLU और इसके वेरिएंट अक्सर उनकी दक्षता और लुप्त ग्रेडिएंट से बचने की क्षमता के कारण पसंद किए जाते हैं। आउटपुट परतों के लिए, सिग्मॉइड का उपयोग बाइनरी वर्गीकरण के लिए, सॉफ्टमैक्स का उपयोग बहु-वर्ग वर्गीकरण के लिए, और रैखिक सक्रियण का उपयोग प्रतिगमन के लिए किया जाता है। ट्रांसफॉर्मर में, GELU आमतौर पर फीड-फॉरवर्ड परतों में उपयोग किया जाता है, जैसा कि BERT और GPT जैसे मॉडलों में देखा गया है। सक्रियण फलन का चुनाव बैच नॉर्मलाइज़ेशन और ड्रॉपआउट जैसी अन्य तकनीकों के साथ भी परस्पर क्रिया कर सकता है।
निष्कर्ष
सक्रियण फलन तंत्रिका नेटवर्क के संचालन के लिए मौलिक हैं, जो अरैखिकता प्रदान करते हैं जो जटिल पैटर्न सीखने को सक्षम बनाता है। प्रारंभिक स्टेप फलनों से लेकर GELU और Swish जैसे आधुनिक स्मूथ वेरिएंट तक, वे गहरे मॉडलों के प्रशिक्षण में चुनौतियों का समाधान करने के लिए विकसित हुए हैं। उनके गणितीय गुणों को समझना शोधकर्ताओं और इंजीनियरों को विशिष्ट अनुप्रयोगों के लिए उपयुक्त फलनों का चयन करने में मदद करता है, जो विभिन्न डोमेन में कृत्रिम बुद्धिमत्ता प्रणालियों की सफलता में योगदान देता है।