न्यूरल ट्यूरिंग मशीन (NTM) एक आवर्तक तंत्रिका नेटवर्क मॉडल है जो ट्यूरिंग मशीन का प्रतिनिधित्व करता है। यह दृष्टिकोण 2014 में एलेक्स ग्रेव्स और अन्य द्वारा प्रकाशित किया गया था, जो तंत्रिका नेटवर्क की फजी पैटर्न मिलान क्षमताओं को प्रोग्रामेबल कंप्यूटरों की एल्गोरिदमिक शक्ति के साथ जोड़ता है। NTM को बाहरी मेमोरी का उपयोग करके उदाहरणों से सरल एल्गोरिदम सीखने के लिए डिज़ाइन किया गया है, जिसे गणना के दौरान पढ़ा और लिखा जा सकता है।
एक NTM में एक तंत्रिका नेटवर्क नियंत्रक शामिल होता है जो बाहरी मेमोरी संसाधनों से जुड़ा होता है, और यह ध्यान तंत्रों के माध्यम से उनके साथ अंतःक्रिया करता है। मेमोरी अंतःक्रियाएं अंत-से-अंत तक अवकलनीय होती हैं, जिससे उन्हें ग्रेडिएंट डिसेंट का उपयोग करके अनुकूलित करना संभव होता है। यह अवकलनीयता पूरे सिस्टम को मानक मशीन लर्निंग तकनीकों, जैसे बैकप्रोपेगेशन, के साथ प्रशिक्षित करने की अनुमति देती है, बिना असतत या गैर-अवकलनीय संचालन की आवश्यकता के।
आर्किटेक्चर और संचालन
NTM में नियंत्रक आमतौर पर एक आवर्तक तंत्रिका नेटवर्क होता है, जैसे कि लॉन्ग शॉर्ट-टर्म मेमोरी (LSTM) नेटवर्क, जो इनपुट प्राप्त करता है और आउटपुट उत्पन्न करता है, साथ ही बाहरी मेमोरी से पढ़ने और लिखने के आदेश भी जारी करता है। मेमोरी वास्तविक-मूल्य वाली प्रविष्टियों का एक मैट्रिक्स है, और नियंत्रक यह निर्धारित करने के लिए ध्यान भार का उपयोग करता है कि कौन से मेमोरी स्थानों तक पहुंचना है। ये भार सामग्री-आधारित एड्रेसिंग का उपयोग करके गणना किए जाते हैं, जो वर्तमान नियंत्रक स्थिति की तुलना मेमोरी सामग्री से करता है, और स्थान-आधारित एड्रेसिंग, जो पुनरावृत्ति जैसे संचालन का समर्थन करने के लिए ध्यान में बदलाव की अनुमति देता है।
पढ़ने और लिखने के संचालन अवकलनीय होने के लिए डिज़ाइन किए गए हैं। एक पढ़ने का संचालन मेमोरी पंक्तियों का भारित योग उत्पन्न करता है, जबकि एक लिखने का संचालन एक मिटाने वाले वेक्टर और एक जोड़ने वाले वेक्टर को जोड़ता है, जो ध्यान भार द्वारा पैमाना किया जाता है, ताकि मेमोरी प्रविष्टियों को अद्यतन किया जा सके। यह डिज़ाइन नेटवर्क को जानकारी संग्रहीत और पुनर्प्राप्त करने में सक्षम बनाता है, इस तरह से जो ग्रेडिएंट-आधारित अनुकूलन के लिए अनुकूल है।
सीखने की क्षमताएं
LSTM नेटवर्क नियंत्रक के साथ एक NTM अकेले उदाहरणों से कॉपी करना, छांटना, और साहचर्य स्मरण जैसे सरल एल्गोरिदम का अनुमान लगा सकता है। प्रयोगों में, NTM ने पारंपरिक आवर्तक नेटवर्कों की तुलना में कम प्रशिक्षण उदाहरणों के साथ इन कार्यों को सीखने की क्षमता प्रदर्शित की है, और वे प्रशिक्षण के दौरान देखे गए इनपुट अनुक्रमों से लंबे अनुक्रमों में सामान्यीकरण कर सकते हैं। यह क्षमता स्पष्ट बाहरी मेमोरी से उत्पन्न होती है, जो एक स्थिर भंडारण माध्यम प्रदान करती है जिसे नियंत्रक हेरफेर करना सीख सकता है।
ग्रेव्स और सहयोगियों के मूल पेपर ने दिखाया कि NTM किसी भी लंबाई के अनुक्रम की प्रतिलिपि बनाना, संख्याओं की सूची को छांटना, और साहचर्य स्मरण करना सीख सकते हैं, जहां नेटवर्क आंशिक संकेत के आधार पर संग्रहीत वस्तु को पुनर्प्राप्त करता है। ये कार्य पैटर्न पहचान को एल्गोरिदमिक तर्क के साथ संयोजित करने की मॉडल की क्षमता को उजागर करते हैं।
कार्यान्वयन और चुनौतियां
मूल NTM पेपर के लेखकों ने अपना स्रोत कोड प्रकाशित नहीं किया। पहला स्थिर ओपन-सोर्स कार्यान्वयन 2018 में 27वें अंतर्राष्ट्रीय सम्मेलन ऑन आर्टिफिशियल न्यूरल नेटवर्क में प्रकाशित हुआ, जिसे सर्वश्रेष्ठ पेपर पुरस्कार मिला। अन्य ओपन-सोर्स कार्यान्वयन मौजूद हैं, लेकिन 2018 तक वे उत्पादन उपयोग के लिए पर्याप्त स्थिर नहीं हैं। इन कार्यान्वयनों के डेवलपर्स ने विभिन्न समस्याओं की सूचना दी है, जिनमें कभी-कभी प्रशिक्षण के दौरान अज्ञात कारणों से NaN बनने वाले ग्रेडिएंट शामिल हैं, जिससे प्रशिक्षण विफल हो जाता है; धीमी अभिसरण; या सीखने की गति पर रिपोर्टिंग की कमी।
ये चुनौतियां बाहरी मेमोरी के साथ आवर्तक नेटवर्कों के प्रशिक्षण की जटिलता से उत्पन्न होती हैं, क्योंकि ध्यान तंत्र और मेमोरी अद्यतन अस्थिर ग्रेडिएंट्स का कारण बन सकते हैं। 2018 के पुरस्कार विजेता कार्यान्वयन ने वास्तुशिल्प परिष्करण और प्रशिक्षण रणनीतियों को पेश करके इनमें से कुछ मुद्दों को संबोधित किया, लेकिन व्यापक अपनाना सीमित रहा।
प्रभाव और विस्तार
डिफरेंशिएबल न्यूरल कंप्यूटर न्यूरल ट्यूरिंग मशीनों का एक विकास हैं, जिनमें ध्यान तंत्र होते हैं जो नियंत्रित करते हैं कि मेमोरी कहां सक्रिय है, और प्रदर्शन में सुधार करते हैं। Google डीपमाइंड के शोधकर्ताओं द्वारा 2016 में पेश किए गए, डिफरेंशिएबल न्यूरल कंप्यूटर NTM को अधिक परिष्कृत मेमोरी एक्सेस पैटर्न, जैसे अस्थायी लिंकिंग और मेमोरी आवंटन, के साथ विस्तारित करते हैं, जिससे वे ग्राफ ट्रैवर्सल और प्रश्न उत्तरण जैसे कार्यों को हल करने में सक्षम होते हैं।
NTM अवधारणा ने गहन शिक्षा और कृत्रिम बुद्धिमत्ता में व्यापक रूप से अनुसंधान को भी प्रभावित किया है, विशेष रूप से उन क्षेत्रों में जहां मॉडलों को लंबे समय के क्षितिज पर संरचित जानकारी संग्रहीत और हेरफेर करने की आवश्यकता होती है। जबकि ट्रांसफॉर्मर जैसे बड़े पैमाने के मॉडल ने कई अनुप्रयोगों में NTM को काफी हद तक विस्थापित कर दिया है, अवकलनीय बाहरी मेमोरी का विचार तंत्रिका आर्किटेक्चर के अध्ययन में एक मौलिक अवधारणा बना हुआ है जो सीखने को प्रतीकात्मक गणना के साथ जोड़ता है।
सीमाएं
अपनी सैद्धांतिक अपील के बावजूद, NTM की व्यावहारिक सीमाएं हैं। प्रशिक्षण कम्प्यूटेशनल रूप से महंगा और अस्थिर हो सकता है, जैसा कि कार्यान्वयन चुनौतियों में उल्लेख किया गया है। मॉडल बहुत बड़ी मेमोरी आकारों के साथ भी संघर्ष करते हैं, क्योंकि ध्यान तंत्र मेमोरी आयामों के साथ पैमाना करते हैं। इसके अतिरिक्त, NTM को उत्पादन प्रणालियों में व्यापक रूप से नहीं अपनाया गया है, अधिकांश व्यावहारिक अनुप्रयोग उन आर्किटेक्चर को पसंद करते हैं जो प्रशिक्षित करने और पैमाना करने में आसान होते हैं, जैसे कि बड़े भाषा मॉडल में उपयोग किए जाने वाले ट्रांसफॉर्मर।
मेमोरी-संवर्धित तंत्रिका नेटवर्कों में सुधार पर अनुसंधान जारी है, हाल के काम NTM की ताकत को आधुनिक आर्किटेक्चर के साथ जोड़ने वाले हाइब्रिड दृष्टिकोणों की खोज कर रहे हैं। हालांकि, 2010 के दशक के अंत तक, NTM मुख्य रूप से एक शोध उपकरण बने हुए हैं, एक तैनात तकनीक नहीं।
संदर्भ
ग्रेव्स, ए., वेन, जी., और दानिहेल्का, आई. (2014)। न्यूरल ट्यूरिंग मशीनें। arXiv प्रीप्रिंट arXiv:1410.5401।
कोलियर, एम., और बील, जे. (2018)। न्यूरल ट्यूरिंग मशीनों को लागू करना। 27वें अंतर्राष्ट्रीय सम्मेलन ऑन आर्टिफिशियल न्यूरल नेटवर्क की कार्यवाही में।