एक्सट्रीम लर्निंग मशीन (ELM) एक प्रकार का फीडफॉरवर्ड न्यूरल नेटवर्क है जिसमें एक ही छिपी हुई परत होती है, जिसे 2004 में गुआंग-बिन हुआंग और उनके सहयोगियों ने प्रस्तुत किया था। पारंपरिक नेटवर्कों के विपरीत, जिन्हें बैकप्रोपेगेशन के साथ पुनरावृत्त रूप से प्रशिक्षित किया जाता है, ELM छिपी हुई परत के लिए इनपुट भार और पूर्वाग्रहों को यादृच्छिक रूप से निर्धारित करता है, जो स्थिर रहते हैं, और फिर आउटपुट भार की गणना एक बंद-रूप समाधान के माध्यम से करता है, आमतौर पर न्यूनतम वर्ग या मूर-पेनरोज़ स्यूडोइनवर्स का उपयोग करके। यह डिज़ाइन ग्रेडिएंट-आधारित अनुकूलन की आवश्यकता को समाप्त करता है, जिससे प्रशिक्षण अत्यंत तेज़ और सरल हो जाता है, अक्सर तुलनीय कार्यों के लिए डीप लर्निंग दृष्टिकोणों की तुलना में परिमाण के क्रमों में तेज़।
ELM मुख्य रूप से वर्गीकरण, प्रतिगमन और फीचर लर्निंग के लिए उपयोग किए जाते हैं, विशेष रूप से उन परिदृश्यों में जहाँ प्रशिक्षण गति और कम्प्यूटेशनल दक्षता महत्वपूर्ण होती है। इन्हें बायोइन्फॉर्मेटिक्स, छवि पहचान और समय-श्रृंखला पूर्वानुमान जैसे क्षेत्रों में लागू किया गया है। हालाँकि, उनका प्रदर्शन छिपी हुई परत मापदंडों के यादृच्छिक आरंभीकरण के प्रति संवेदनशील हो सकता है, और उन्हें समान सटीकता प्राप्त करने के लिए बैकप्रोपेगेशन-प्रशिक्षित नेटवर्क की तुलना में अधिक छिपे हुए न्यूरॉन्स की आवश्यकता होती है। इन सीमाओं के बावजूद, ELM मशीन लर्निंग परिदृश्य में एक उल्लेखनीय विकल्प बने हुए हैं, विशेष रूप से संसाधन-सीमित वातावरण के लिए।
सैद्धांतिक आधार
ELM एल्गोरिथ्म एकल-छिपी-परत फीडफॉरवर्ड नेटवर्कों के लिए सार्वभौमिक सन्निकटन प्रमेय पर आधारित है। हुआंग के 2006 के प्रमाण ने प्रदर्शित किया कि यादृच्छिक रूप से उत्पन्न छिपे हुए नोड मापदंडों के साथ, एक ELM किसी भी सतत लक्ष्य फ़ंक्शन का सन्निकटन कर सकता है, बशर्ते सक्रियण फ़ंक्शन अनंत रूप से अवकलनीय हो (जैसे, सिग्मॉइड, रेडियल आधार फ़ंक्शन)। आउटपुट भार एक रैखिक प्रणाली को हल करके निर्धारित किए जाते हैं: N नमूनों के प्रशिक्षण सेट को देखते हुए, छिपी हुई परत आउटपुट मैट्रिक्स H की गणना की जाती है, और आउटपुट भार β को β = H†T के रूप में प्राप्त किया जाता है, जहाँ H†, H का स्यूडोइनवर्स है और T लक्ष्य मैट्रिक्स है। यह विश्लेषणात्मक समाधान सुनिश्चित करता है कि प्रशिक्षण त्रुटि पुनरावृत्त ट्यूनिंग के बिना न्यूनतम-वर्ग अर्थ में न्यूनतम हो।
एक प्रमुख सैद्धांतिक लाभ यह है कि इनपुट का उच्च-आयामी फीचर स्पेस में यादृच्छिक प्रक्षेपण डेटा को अधिक रैखिक रूप से वियोज्य बना सकता है, जिससे आउटपुट परत सरल हो जाती है। यह डीप लर्निंग मॉडलों के विपरीत है जो कई परतों के माध्यम से पदानुक्रमित फीचर सीखते हैं, लेकिन ELM गहराई को गति और सरलता के लिए त्याग देते हैं। बाद के संस्करण, जैसे वृद्धिशील ELM और कर्नेल ELM, ने ऑनलाइन लर्निंग और स्पष्ट छिपी हुई परत विस्तार के बिना अरैखिक मैपिंग को संभालने के लिए मूल सूत्रीकरण का विस्तार किया है।
प्रशिक्षण और कार्यान्वयन
ELM को प्रशिक्षित करने में तीन चरण शामिल हैं: (1) छिपी हुई परत के लिए इनपुट भार और पूर्वाग्रहों को यादृच्छिक रूप से निर्धारित करना, (2) चुने गए सक्रियण फ़ंक्शन का उपयोग करके छिपी हुई परत आउटपुट मैट्रिक्स H की गणना करना, और (3) स्यूडोइनवर्स के माध्यम से आउटपुट भार β की गणना करना। स्यूडोइनवर्स की गणना एकवचन मान अपघटन या ऑर्थोगोनल प्रक्षेपण विधि का उपयोग करके की जा सकती है, जो अधिकांश डेटासेट के लिए संख्यात्मक रूप से स्थिर है। चूँकि किसी पुनरावृत्त अद्यतन की आवश्यकता नहीं होती है, प्रशिक्षण समय प्रशिक्षण नमूनों की संख्या के साथ रैखिक रूप से बढ़ता है, जिससे ELM बड़े पैमाने की समस्याओं के लिए उपयुक्त होते हैं जहाँ डीप लर्निंग कम्प्यूटेशनल रूप से निषेधात्मक होगा।
व्यवहार में, छिपे हुए न्यूरॉन्स की संख्या एक हाइपरपैरामीटर है जिसे अक्सर क्रॉस-वैलिडेशन के माध्यम से ट्यून किया जाना चाहिए। आमतौर पर उपयोग किए जाने वाले सक्रियण फ़ंक्शन में सिग्मॉइड, हाइपरबोलिक टैन्जेंट और रेडियल आधार फ़ंक्शन शामिल हैं। ELM को लर्निंग-रेट शेड्यूल या एडम ऑप्टिमाइज़र समायोजन की आवश्यकता नहीं होती है, जिससे प्रशिक्षण पाइपलाइन सरल हो जाती है। कार्यान्वयन scikit-learn (तृतीय-पक्ष मॉड्यूल के माध्यम से) और MATLAB जैसी लोकप्रिय लाइब्रेरीज़ में उपलब्ध हैं, और उन्हें CPU या GPU पर आसानी से समानांतर किया जा सकता है। हार्डवेयर त्वरण के लिए, ELM विशेष AI चिप्स के बिना एएमडी या इंटेल प्रोसेसर पर कुशलता से चल सकते हैं, हालाँकि एडब्ल्यूएस ट्रेनियम या गूगल क्लाउड इंस्टेंस बहुत बड़े डेटासेट को संभाल सकते हैं।
अनुप्रयोग और उपयोग के मामले
ELM ने विविध डोमेन में व्यावहारिक अनुप्रयोग पाए हैं। बायोइन्फॉर्मेटिक्स में, उनका उपयोग जीन अभिव्यक्ति वर्गीकरण और प्रोटीन संरचना भविष्यवाणी के लिए किया जाता है, जहाँ उच्च-आयामी डेटा को देखते हुए तेज़ प्रशिक्षण फायदेमंद होता है। कंप्यूटर विज़न में, ELM कन्वोल्यूशनल नेटवर्क द्वारा निकाले गए छवि फीचर के लिए क्लासिफायर के रूप में कार्य करते हैं, कभी-कभी अंतिम सॉफ्टमैक्स परत के प्रतिस्थापन के रूप में। समय-श्रृंखला पूर्वानुमान के लिए, जैसे बिजली लोड या वित्तीय बाजार भविष्यवाणी, ELM नए डेटा आने पर तेज़ मॉडल अद्यतन प्रदान करते हैं, एक ऐसा कार्य जहाँ पुनरावृत्त डीप लर्निंग मॉडल पीछे रह सकते हैं।
औद्योगिक सेटिंग्स में, ELM को मशीनरी में दोष पहचान और विनिर्माण में गुणवत्ता नियंत्रण के लिए तैनात किया गया है, जो उनकी कम विलंबता का लाभ उठाते हैं। नोकिया बेल लैब्स और सैमसंग रिसर्च के शोध ने संचार प्रणालियों के लिए ELM-आधारित सिग्नल प्रोसेसिंग का पता लगाया है। इसके अतिरिक्त, ELM को एन्सेम्बल विधियों में एकीकृत किया गया है, जहाँ विभिन्न यादृच्छिक आरंभीकरण वाले कई ELM को मजबूती में सुधार के लिए संयोजित किया जाता है, जो रैंडम फॉरेस्ट दृष्टिकोण के समान है लेकिन न्यूरल नेटवर्क के लिए। प्राकृतिक भाषा प्रसंस्करण में ट्रांसफॉर्मर-आधारित मॉडलों से प्रतिस्पर्धा के बावजूद, ELM सारणीबद्ध और सेंसर डेटा कार्यों के लिए प्रासंगिक बने हुए हैं।
लाभ और सीमाएँ
ELM का प्राथमिक लाभ प्रशिक्षण गति है: वे डेटासेट पर सेकंड या मिनटों में प्रशिक्षित हो सकते हैं जिन्हें बैकप्रोपेगेशन-आधारित नेटवर्क के लिए घंटों लगेंगे। यह उन्हें तीव्र प्रोटोटाइपिंग और ऑनलाइन लर्निंग परिदृश्यों के लिए आदर्श बनाता है। वे लुप्त ग्रेडिएंट और स्थानीय न्यूनतम जैसी समस्याओं से भी बचते हैं, जो डीप लर्निंग प्रशिक्षण को प्रभावित करती हैं। यादृच्छिक छिपी हुई परत फीचर निष्कर्षण के एक रूप के रूप में कार्य करती है, जिससे मैन्युअल फीचर इंजीनियरिंग की आवश्यकता कम हो जाती है।
हालाँकि, ELM की उल्लेखनीय सीमाएँ हैं। यादृच्छिक आरंभीकरण विभिन्न रनों में असंगत प्रदर्शन का कारण बन सकता है, जिसके लिए कई परीक्षणों या एन्सेम्बल औसत की आवश्यकता होती है। उन्हें गहरे नेटवर्क की सटीकता से मेल खाने के लिए अक्सर बड़ी संख्या में छिपे हुए न्यूरॉन्स की आवश्यकता होती है, जिससे मेमोरी उपयोग बढ़ जाता है। ELM अनुक्रमिक डेटा या पदानुक्रमित अमूर्तता की आवश्यकता वाले कार्यों के लिए उपयुक्त नहीं हैं, जहाँ आवर्ती न्यूरल नेटवर्क या ट्रांसफॉर्मर आर्किटेक्चर उत्कृष्ट होते हैं। इसके अलावा, सैद्धांतिक गारंटी अनंत प्रशिक्षण नमूनों को मानती है, इसलिए परिमित-नमूना प्रदर्शन विचलित हो सकता है। शोधकर्ताओं ने सामान्यीकरण में सुधार के लिए न्यूनतम-वर्ग उद्देश्य में दंड शब्द जोड़ने जैसी नियमितीकरण तकनीकों का प्रस्ताव किया है, लेकिन यह जटिलता जोड़ता है।
डीप लर्निंग के साथ तुलना
ELM और डीप लर्निंग मॉडल विभिन्न व्यापार-बंदों का प्रतिनिधित्व करते हैं। गहरे नेटवर्क, जैसे अवशिष्ट नेटवर्क या यू-नेट, कई परतों के माध्यम से पदानुक्रमित रूप से फीचर सीखते हैं, जिससे छवि विभाजन और भाषा मॉडलिंग जैसे जटिल कार्यों पर अत्याधुनिक प्रदर्शन संभव होता है। उन्हें व्यापक हाइपरपैरामीटर ट्यूनिंग, बड़े डेटासेट और महत्वपूर्ण कम्प्यूटेशनल संसाधनों की आवश्यकता होती है, अक्सर जीपीयू क्लस्टर या एज़्योर या ओरेकल क्लाउड जैसी क्लाउड सेवाओं का उपयोग करते हुए। इसके विपरीत, ELM उन समस्याओं के लिए एक सरल, तेज़ विकल्प प्रदान करते हैं जहाँ एक ही छिपी हुई परत पर्याप्त होती है, जैसे कई प्रतिगमन कार्य या सरल वर्गीकरण बेंचमार्क।
अनुभवजन्य अध्ययन दिखाते हैं कि ELM उथले नेटवर्क से बेहतर प्रदर्शन कर सकते हैं और कभी-कभी सारणीबद्ध डेटासेट पर गहरे नेटवर्क से मेल खा सकते हैं, लेकिन वे छवियों या पाठ जैसे उच्च-आयामी संरचित डेटा पर पीछे रह जाते हैं। बड़े भाषा मॉडल और जनरेटिव एआई के उदय ने ध्यान को बड़े पैमाने पर डीप लर्निंग पर केंद्रित कर दिया है, लेकिन ELM का अध्ययन उनकी सैद्धांतिक सुंदरता और दक्षता के लिए जारी है। कुछ हाइब्रिड दृष्टिकोण ELM को गहरे फीचर निष्कर्षक में अंतिम क्लासिफायर के रूप में उपयोग करते हैं, दोनों प्रतिमानों की ताकतों को मिलाते हुए। 2020 के दशक के मध्य तक, ELM एक विशिष्ट लेकिन सक्रिय अनुसंधान क्षेत्र बने हुए हैं, जिनके प्रकाशन कृत्रिम बुद्धिमत्ता और न्यूरल कम्प्यूटेशन पर केंद्रित पत्रिकाओं में दिखाई देते हैं।
भविष्य की दिशाएँ
ELM पर चल रहे शोध कई सीमाओं की खोज करते हैं। एक दिशा यादृच्छिक छिपी हुई परत मापदंडों को अनुकूलित करने के लिए अनुकूली विधियों का विकास है, जैसे विकासवादी एल्गोरिदम या बायेसियन अनुकूलन का उपयोग, विचरण को कम करने के लिए। एक और गहरे आर्किटेक्चर के लिए ELM का विस्तार है, जिसे डीप ELM के रूप में जाना जाता है, जो कई यादृच्छिक परतों को स्टैक करता है लेकिन फिर भी बैकप्रोपेगेशन से बचता है। ये मॉडल प्रशिक्षण गति बनाए रखते हुए पदानुक्रमित फीचर को पकड़ने का लक्ष्य रखते हैं। इसके अतिरिक्त, हार्डवेयर-जागरूक कार्यान्वयन की जांच की जा रही है, जिसमें स्पाइकिंग न्यूरल नेटवर्क संस्करण और FPGA-आधारित डिज़ाइन शामिल हैं, ताकि सैमसंग इलेक्ट्रॉनिक्स स्मार्टफोन या एप्पल हार्डवेयर जैसे उपकरणों पर एज तैनाती सक्षम हो सके।
फेडरेटेड लर्निंग के संदर्भ में, ELM आकर्षक हैं क्योंकि उनके बंद-रूप समाधान पुनरावृत्त संचार के बिना वितरित नोड्स में एकत्र किए जा सकते हैं। एमआईटी सीएसएआईएल और बर्कले एआई रिसर्च के शोधकर्ताओं ने ऐसे ढाँचों का पता लगाया है। पाठ्यक्रम-आधारित लर्निंग या डेटा संवर्धन तकनीकों के साथ ELM का एकीकरण भी सामान्यीकरण में सुधार के लिए परीक्षण किया जा रहा है। जबकि ELM जटिल संज्ञानात्मक कार्यों के लिए डीप लर्निंग को प्रतिस्थापित करने की संभावना नहीं रखते हैं, उनकी सरलता और गति यह सुनिश्चित करती है कि वे मशीन लर्निंग टूलबॉक्स में एक मूल्यवान उपकरण बने रहें, विशेष रूप से वास्तविक समय और संसाधन-सीमित अनुप्रयोगों के लिए।