सामान्यीकृत हेबियन एल्गोरिथम (GHA) कृत्रिम तंत्रिका नेटवर्क के लिए एक अनुपरीक्षित शिक्षण नियम है जो प्रमुख घटक विश्लेषण (PCA) करता है। इसे टेरेंस डी. सेंगर ने 1989 में ओजा के नियम के विस्तार के रूप में प्रस्तुत किया था, जो केवल पहला प्रमुख घटक निकालता है। GHA एक एकल-परत रैखिक तंत्रिका नेटवर्क को इनपुट डेटा वितरण के पहले k प्रमुख घटकों को अनुक्रमिक तरीके से सीखने में सक्षम बनाता है, जिससे यह तंत्रिका नेटवर्क-आधारित आयामीता में कमी और विशेषता निष्कर्षण में एक मौलिक विधि बन जाता है।
लेबल किए गए डेटा की आवश्यकता वाले पर्यवेक्षित शिक्षण विधियों के विपरीत, GHA पूरी तरह से इनपुट सांख्यिकी पर कार्य करता है। यह हेबियन-प्रेरित अद्यतन नियम का पालन करता है, जहां सिनैप्टिक भार मजबूत होते हैं जब पूर्व- और पोस्ट-सिनैप्टिक सक्रियताएं सहसंबद्ध होती हैं, लेकिन एक महत्वपूर्ण सामान्यीकरण और असंबंधन चरण के साथ। यह असंबंधन, जो ग्राम-श्मिट जैसी प्रक्रिया के माध्यम से लागू किया जाता है, यह सुनिश्चित करता है कि प्रत्येक आउटपुट न्यूरॉन एक अलग प्रमुख घटक सीखता है, जो घटते विचरण के क्रम में होता है।
गणितीय सूत्रीकरण
इनपुट वेक्टर x ∈ ℝⁿ और आउटपुट वेक्टर y ∈ ℝᵏ के लिए, नेटवर्क y = W x की गणना करता है, जहां W एक k×n भार मैट्रिक्स है। प्रत्येक भार wᵢⱼ (इनपुट j को आउटपुट i से जोड़ने वाला) के लिए GHA अद्यतन नियम है:
Δwᵢⱼ = η yᵢ ( xⱼ - Σ_{p=1}^{i} wₚⱼ yₚ )
यहां, η सीखने की दर है, और p के 1 से i तक का योग एक अनुक्रमिक ऑर्थोगोनलाइजेशन करता है। पहले आउटपुट न्यूरॉन (i=1) के लिए, नियम ओजा के नियम में बदल जाता है: Δw₁ⱼ = η y₁ (xⱼ - w₁ⱼ y₁)। बाद के न्यूरॉन्स के लिए, यह पद पहले से सीखे गए भार वैक्टर पर इनपुट के प्रक्षेपणों को घटाता है, जिससे नया न्यूरॉन पिछले घटकों के लिए ऑर्थोगोनल विचरण को पकड़ने के लिए मजबूर होता है।
इस अद्यतन को ऑर्थोनॉर्मलिटी बाधाओं के अधीन, प्रत्येक आउटपुट द्वारा समझाए गए विचरण पर एक स्टोकेस्टिक ग्रेडिएंट वृद्धि के रूप में व्याख्या किया जा सकता है। सीखने की दर पर हल्की शर्तों के तहत (जैसे, शून्य की ओर घटती हुई), भार वैक्टर इनपुट सहप्रसरण मैट्रिक्स के eigenvectors में परिवर्तित हो जाते हैं, जो घटते eigenvalue के क्रम में होते हैं।
ओजा के नियम और PCA से संबंध
ओजा का नियम, जिसे एर्की ओजा ने 1982 में प्रस्तावित किया था, एक एकल-न्यूरॉन हेबियन नियम है जो भार वेक्टर को इकाई लंबाई में सामान्यीकृत करता है, जिससे यह पहले प्रमुख घटक में परिवर्तित हो जाता है। GHA इसे न्यूरॉन्स के एक कैस्केड का उपयोग करके सामान्यीकृत करता है, जहां प्रत्येक न्यूरॉन के अद्यतन में पिछले सभी न्यूरॉन्स से योगदान का घटाव शामिल होता है। यह ग्राम-श्मिट ऑर्थोगोनलाइजेशन प्रक्रिया के अनुरूप है, लेकिन इसे ऑनलाइन और स्टोकेस्टिक रूप से किया जाता है।
बैच PCA एल्गोरिथम (जैसे, eigenvalue अपघटन) की तुलना में, GHA पूरी तरह से वृद्धिशील है और डेटा स्ट्रीम को एक नमूने में संसाधित कर सकता है। इसे पूरे सहप्रसरण मैट्रिक्स को संग्रहीत करने की आवश्यकता नहीं होती है, जिससे यह उच्च-आयामी डेटा के लिए मेमोरी-कुशल बन जाता है। हालांकि, यह बैच विधियों की तुलना में धीमा परिवर्तित होता है और सीखने की दर अनुसूची के प्रति संवेदनशील है।
अनुप्रयोग और महत्व
GHA को विभिन्न क्षेत्रों में लागू किया गया है, जिसमें छवि संपीड़न, सिग्नल प्रोसेसिंग और पैटर्न पहचान शामिल हैं। 1990 के दशक में, इसका उपयोग हस्तलिखित अंक पहचान में विशेषता निष्कर्षण और रडार और सोनार डेटा में आयामीता कम करने के लिए किया गया था। इसकी ऑनलाइन प्रकृति ने इसे वास्तविक समय प्रणालियों, जैसे अनुकूली फिल्टर और रोबोटिक्स के लिए आकर्षक बना दिया।
Machine learning और Neural network अनुसंधान के संदर्भ में, GHA ने हेबियन शिक्षण और स्व-संगठन की सैद्धांतिक समझ में योगदान दिया। इसने प्रदर्शित किया कि सरल स्थानीय शिक्षण नियम वैश्विक सांख्यिकीय गुण प्राप्त कर सकते हैं, एक विषय जिसने बाद में Deep learning और अनुपरीक्षित प्रतिनिधित्व शिक्षण पर काम को प्रभावित किया। हालांकि आधुनिक गहरे नेटवर्क अक्सर बैकप्रोपेगेशन और Adam (Optimizer) का उपयोग करते हैं, GHA जैविक रूप से प्रशंसनीय शिक्षण का एक क्लासिक उदाहरण बना हुआ है।
सीमाएं और आधुनिक संदर्भ
GHA एक रैखिक नेटवर्क और गाऊसी-जैसी इनपुट सांख्यिकी मानता है, जो गैर-रैखिक संरचनाओं को पकड़ने की इसकी क्षमता को सीमित करता है। गैर-रैखिक PCA और कर्नेल-आधारित विधियों जैसे विस्तार इस समस्या का समाधान करते हैं, लेकिन वे सरल हेबियन रूप खो देते हैं। इसके अतिरिक्त, GHA को सीखने की दर के सावधानीपूर्वक समायोजन की आवश्यकता होती है; बहुत अधिक दर विचलन की ओर ले जाती है, बहुत कम दर अभिसरण को धीमा कर देती है। अनुक्रमिक प्रकृति का अर्थ यह भी है कि प्रारंभिक घटकों में त्रुटियां बाद के घटकों में फैल जाती हैं।
Deep learning और Transformer (architecture) आर्किटेक्चर के उदय के साथ, GHA शायद ही कभी अत्याधुनिक प्रणालियों में उपयोग किया जाता है। हालांकि, यह तंत्रिका गणना और Artificial intelligence पर पाठ्यक्रमों में एक शैक्षणिक आधारशिला बना हुआ है। इसके असंबंधन और विचरण अधिकतमीकरण के सिद्धांत Batch Normalization और Layer Normalization जैसी अधिक उन्नत तकनीकों को रेखांकित करते हैं, जो सक्रियताओं को स्थिर और असंबद्ध करने का भी लक्ष्य रखते हैं।
यह भी देखें
- ओजा का नियम (सूची में नहीं, लेकिन अवधारणात्मक रूप से जुड़ा हुआ)
- प्रमुख घटक विश्लेषण (सूची में नहीं)
- अनुपरीक्षित शिक्षण (सूची में नहीं)
- तंत्रिका नेटवर्क
- मशीन लर्निंग
संदर्भ
- सेंगर, टी. डी. (1989)। "एकल-परत रैखिक फीडफॉरवर्ड तंत्रिका नेटवर्क में इष्टतम अनुपरीक्षित शिक्षण।" न्यूरल नेटवर्क्स, 2(6), 459-473।
- ओजा, ई. (1982)। "प्रमुख घटक विश्लेषक के रूप में सरलीकृत न्यूरॉन मॉडल।" जर्नल ऑफ मैथमैटिकल बायोलॉजी, 15(3), 267-273।