तत्काल प्रशिक्षित तंत्रिका नेटवर्क फीडफॉरवर्ड कृत्रिम तंत्रिका नेटवर्क का एक वर्ग है जो सामने आए प्रत्येक नए प्रशिक्षण नमूने के लिए एक नया छिपा हुआ न्यूरॉन नोड बनाता है। इस नए बनाए गए छिपे हुए न्यूरॉन को सौंपे गए भार न केवल विशिष्ट प्रशिक्षण नमूने को अलग करने के लिए डिज़ाइन किए गए हैं, बल्कि उन अन्य नमूनों को भी अलग करते हैं जो उसके पास स्थित हैं, जिससे सामान्यीकरण का एक रूप मिलता है। यह पृथक्करण निकटतम हाइपरप्लेन का उपयोग करके प्राप्त किया जाता है जिसे पुनरावृत्तीय अनुकूलन के बिना तुरंत लिखा जा सकता है। दो सबसे प्रमुख कार्यान्वयनों में, सामान्यीकरण का पड़ोस या तो प्रशिक्षण नमूने के साथ बदलता है (CC1 नेटवर्क) या स्थिर रहता है (CC4 नेटवर्क)। ये नेटवर्क आमतौर पर इनपुट डेटा सेट के प्रभावी प्रतिनिधित्व के लिए यूनरी कोडिंग का उपयोग करते हैं।
यह अवधारणा पहली बार 1993 में सुभाष काक के एक पेपर में प्रस्तावित की गई थी। उस परिचय के बाद से, तत्काल प्रशिक्षित तंत्रिका नेटवर्क को जैविक प्रणालियों में अल्पकालिक सीखने के मॉडल के रूप में सुझाया गया है और व्यावहारिक कार्यों जैसे वेब खोज, वित्तीय समय श्रृंखला भविष्यवाणी, दस्तावेजों का तत्काल वर्गीकरण, और गहन शिक्षण और डेटा माइनिंग पाइपलाइनों में घटकों के रूप में लागू किया गया है। अधिकांश तंत्रिका नेटवर्कों की तरह, उनका सामान्य उपयोग सॉफ्टवेयर के रूप में होता है, लेकिन उन्हें फील्ड-प्रोग्रामेबल गेट एरे (FPGAs) और ऑप्टिकल कार्यान्वयन के माध्यम से हार्डवेयर में भी लागू किया गया है।
CC4 नेटवर्क आर्किटेक्चर
CC4 नेटवर्क एक तीन-चरणीय फीडफॉरवर्ड आर्किटेक्चर है। इसकी इनपुट परत में प्रशिक्षण वेक्टर के आकार के बराबर नोड्स की संख्या होती है और साथ ही एक अतिरिक्त नोड होता है, जो एक बायसिंग नोड के रूप में कार्य करता है जिसका इनपुट हमेशा 1 पर सेट होता है। बाइनरी इनपुट वैक्टर के लिए, इनपुट नोड्स से एक छिपे हुए न्यूरॉन (सूचकांक j द्वारा) के लिए भार, जो एक प्रशिक्षित वेक्टर के अनुरूप होता है, एक विशिष्ट सूत्र द्वारा परिभाषित किया जाता है। प्रत्येक इनपुट घटक xi के लिए, भार wij को -1 पर सेट किया जाता है यदि xi 0 के बराबर है, और +1 यदि xi 1 के बराबर है। बायसिंग नोड (i = n+1) के लिए, भार r - s + 1 पर सेट किया जाता है, जहां r सामान्यीकरण की त्रिज्या है और s बाइनरी अनुक्रम का हैमिंग भार (1s की संख्या) है।
छिपी हुई परत न्यूरॉन्स और आउटपुट परत न्यूरॉन्स दोनों एक थ्रेशोल्ड सक्रियण फ़ंक्शन का उपयोग करते हैं: वे 1 आउटपुट करते हैं यदि उनके इनपुट का भारित योग 0 या सकारात्मक है, और 0 यदि भारित योग नकारात्मक है। छिपी हुई परत से आउटपुट परत तक, भार या तो 1 या -1 होते हैं, जो इस बात पर निर्भर करता है कि संबंधित वेक्टर किसी दिए गए आउटपुट वर्ग से संबंधित है या नहीं। यह आर्किटेक्चर नेटवर्क को पहले से संग्रहीत प्रशिक्षण नमूनों से निकटता के आधार पर नए इनपुट को वर्गीकृत करने की अनुमति देता है, जिसमें त्रिज्या r सामान्यीकरण पड़ोस के आकार को नियंत्रित करती है।
CC1 नेटवर्क और विविधताएं
CC1 नेटवर्क CC4 नेटवर्क से भिन्न है क्योंकि सामान्यीकरण की त्रिज्या स्थिर नहीं होती है बल्कि प्रत्येक प्रशिक्षण नमूने के साथ बदलती है। यह नेटवर्क को अपने सामान्यीकरण व्यवहार को स्थानीय रूप से अनुकूलित करने की अनुमति देता है, संभावित रूप से अलग-अलग डेटा घनत्व वाले इनपुट स्थान के क्षेत्रों में बेहतर प्रदर्शन प्रदान करता है। CC4 नेटवर्क को गैर-बाइनरी इनपुट वैक्टर को स्वीकार करने के लिए भी संशोधित किया गया है, जिसमें सामान्यीकरण की अलग-अलग त्रिज्या होती है, प्रभावी रूप से CC4 ढांचे के भीतर एक CC1 कार्यान्वयन प्रदान करता है। ये संशोधन तत्काल प्रशिक्षित तंत्रिका नेटवर्क की प्रयोज्यता को पूरी तरह से बाइनरी डेटा से परे बढ़ाते हैं।
संबंधित तत्काल शिक्षण मॉडल
फीडफॉरवर्ड आर्किटेक्चर के अलावा, अन्य तंत्रिका नेटवर्क मॉडल भी तत्काल शिक्षण क्षमताओं का प्रदर्शन करते हैं। विलशॉ नेटवर्क, एक प्रकार की साहचर्य स्मृति, एक ही प्रस्तुति में पैटर्न को संग्रहीत और पुनर्प्राप्त कर सकता है। इसी तरह, हॉपफील्ड नेटवर्क, एक आवर्तक तंत्रिका नेटवर्क जो साहचर्य स्मृति और अनुकूलन के लिए उपयोग किया जाता है, एक-शॉट हेब्बियन शिक्षण नियम के माध्यम से पैटर्न को तुरंत सीख सकता है। ये फीडबैक नेटवर्क फीडफॉरवर्ड तत्काल प्रशिक्षित तंत्रिका नेटवर्क के साथ तीव्र, एक-पास शिक्षण की संपत्ति साझा करते हैं, हालांकि उनके परिचालन सिद्धांत और अनुप्रयोग भिन्न होते हैं।
अनुप्रयोग और कार्यान्वयन
तत्काल प्रशिक्षित तंत्रिका नेटवर्क अपनी तेज़ प्रशिक्षण गति और सरलता के कारण कई डोमेन में लागू किए गए हैं। वेब खोज में, उनका उपयोग दस्तावेजों के तत्काल वर्गीकरण के लिए किया गया है, जिससे वेब पेजों या खोज परिणामों के तेजी से वर्गीकरण की अनुमति मिलती है। वित्तीय समय श्रृंखला भविष्यवाणी में, पूरे नेटवर्क को फिर से प्रशिक्षित किए बिना नए डेटा बिंदुओं से सीखने की उनकी क्षमता उन्हें अनुकूली पूर्वानुमान के लिए उपयुक्त बनाती है। उन्हें संज्ञानात्मक विज्ञान में अल्पकालिक शिक्षण के मॉडल के रूप में भी खोजा गया है, जहां नई जानकारी का तेजी से अधिग्रहण एक प्रमुख विशेषता है। FPGAs का उपयोग करके हार्डवेयर कार्यान्वयन का प्रदर्शन किया गया है, और ऑप्टिकल कार्यान्वयन प्रस्तावित किए गए हैं, जो नेटवर्क की गणना की समानांतर प्रकृति का लाभ उठाते हैं।