आवर्ती तंत्रिका नेटवर्क (RNN)

अंग्रेज़ी से अनुवादित

आवर्ती तंत्रिका नेटवर्क (RNN) कृत्रिम तंत्रिका नेटवर्क हैं जिनमें लूप होते हैं जो छिपी हुई अवस्था को बनाए रखकर अनुक्रमिक डेटा को संसाधित करते हैं, जिससे अस्थायी निर्भरताओं को सीखना संभव होता है। इनका व्यापक रूप से भाषण पहचान और मशीन अनुवाद जैसे कार्यों के लिए उपयोग किया जाता था, लेकिन इन्हें बड़े पैमाने पर [[transformer|ट्रांसफॉर्मर]] द्वारा प्रतिस्थापित कर दिया गया है।

आवर्तक तंत्रिका नेटवर्क (RNN) कृत्रिम तंत्रिका नेटवर्क की एक श्रेणी है जो अनुक्रमिक डेटा, जैसे पाठ, भाषण और समय श्रृंखला, को संसाधित करने के लिए डिज़ाइन की गई है, जहाँ तत्वों का क्रम अर्थ रखता है। फीडफॉरवर्ड तंत्रिका नेटवर्क के विपरीत, जो प्रत्येक इनपुट को स्वतंत्र रूप से मानते हैं, RNN आवर्तक कनेक्शन शामिल करते हैं: एक समय चरण पर एक न्यूरॉन का आउटपुट अगले समय चरण पर इनपुट के रूप में वापस भेजा जाता है। यह फीडबैक लूप नेटवर्क को एक छिपी हुई स्थिति बनाए रखने की अनुमति देता है - एक प्रकार की स्मृति जो वर्तमान इनपुट और पिछली छिपी हुई स्थिति के आधार पर प्रत्येक चरण पर अद्यतन की जाती है - जिससे यह अनुक्रम में अस्थायी निर्भरताओं और पैटर्न को पकड़ने में सक्षम होता है।

RNN को कई कार्यों पर लागू किया गया है, जिनमें अविभाजित हस्तलेखन पहचान, भाषण पहचान, प्राकृतिक भाषा प्रसंस्करण और मशीन अनुवाद शामिल हैं। अनुक्रमों को मॉडल करने की उनकी क्षमता ने उन्हें प्रारंभिक गहन शिक्षण अनुप्रयोगों की आधारशिला बना दिया, हालाँकि 2010 के दशक के मध्य से Transformer (architecture) वास्तुकला कई अनुक्रम-प्रसंस्करण कार्यों के लिए प्रमुख बन गई है। फिर भी, RNN उन अनुप्रयोगों के लिए प्रासंगिक बने हुए हैं जिन्हें कम्प्यूटेशनल दक्षता, वास्तविक समय प्रसंस्करण, या जहाँ डेटा की स्वाभाविक रूप से अनुक्रमिक प्रकृति महत्वपूर्ण है, की आवश्यकता होती है।

ऐतिहासिक पृष्ठभूमि

तंत्रिका नेटवर्क में आवर्तन की अवधारणा की जड़ें तंत्रिका विज्ञान और सांख्यिकीय यांत्रिकी दोनों में हैं। 20वीं शताब्दी की शुरुआत में, शरीर रचना विज्ञानियों ने मस्तिष्क में लूप-जैसी (आवर्तक) संरचनाएँ देखीं; सैंटियागो रामोन वाई काजल ने 1901 में अनुमस्तिष्क प्रांतस्था में "आवर्तक अर्धवृत्त" का वर्णन किया, और राफेल लोरेंते डे नो ने 1933 में "आवर्तक, पारस्परिक कनेक्शन" की पहचान की, यह प्रस्तावित करते हुए कि उत्तेजक लूप वेस्टिबुलो-ओकुलर रिफ्लेक्स में योगदान करते हैं। 1940 के दशक के दौरान, डोनाल्ड हेब्ब जैसे शोधकर्ताओं ने सुझाव दिया कि मस्तिष्क में "प्रतिध्वनित सर्किट" अल्पकालिक स्मृति की व्याख्या कर सकते हैं, जबकि वॉरेन मैककुलोच और वाल्टर पिट्स ने, 1943 के अपने तंत्रिका मॉडल पर पेपर में, चक्रों वाले नेटवर्क पर विचार किया। इन विचारों पर मैसी सम्मेलनों में व्यापक रूप से चर्चा की गई और प्रारंभिक तंत्रिका फीडबैक सिद्धांतों को प्रभावित किया।

1960 के दशक में, फ्रैंक रोसेनब्लाट ने अपने परसेप्ट्रॉन कार्य को हेब्बियन लर्निंग के साथ "क्लोज-लूप क्रॉस-कपल्ड" नेटवर्क शामिल करने के लिए विस्तारित किया, यह देखते हुए कि ऐसे नेटवर्क असीम रूप से गहरे फीडफॉरवर्ड नेटवर्क के बराबर थे। इसी तरह के आवर्तक डिज़ाइन बाद में काओरू नाकानो (1971), शुन'इची अमारी (1972), और विलियम ए. लिटिल (1974) द्वारा प्रकाशित किए गए। समानांतर में, सांख्यिकीय यांत्रिकी ने इसिंग मॉडल (1920 के दशक में विल्हेम लेन्ज़ और अर्न्स्ट इसिंग द्वारा विकसित) और स्पिन ग्लास का शेरिंगटन-किर्कपैट्रिक मॉडल (1975) योगदान दिया, जिसने फीडबैक वाले नेटवर्क के लिए एक गणितीय ढांचा प्रदान किया। जॉन हॉपफील्ड ने 1982 और 1984 के अपने प्रभावशाली पेपरों में इन विचारों को लागू किया, जिससे जो हॉपफील्ड नेटवर्क के रूप में जाना जाने लगा, वह पेश किया - सांख्यिकीय यांत्रिकी के माध्यम से तंत्रिका गतिशीलता का अध्ययन करने के लिए एक मानक मॉडल।

आधुनिक विकास

1980 और 1990 के दशक में तंत्रिका नेटवर्क अनुसंधान के पुनरुत्थान के दौरान, अधिक व्यावहारिक आवर्तक वास्तुकलाएँ उभरीं। माइकल आई. जॉर्डन ने 1986 में जॉर्डन नेटवर्क प्रस्तावित किया, और जेफ्री एलमैन ने 1990 में एलमैन नेटवर्क पेश किया; दोनों अनुक्रम मॉडलिंग के लिए मौलिक बन गए। एक महत्वपूर्ण सफलता 1997 में आई जब सेप होचरेइटर और जुर्गन श्मिधुबर ने लॉन्ग शॉर्ट-टर्म मेमोरी (LSTM) वास्तुकला पेश की, जो पहले के RNN को परेशान करने वाली लुप्त ग्रेडिएंट समस्या को कम करती है, जिससे लंबी दूरी की निर्भरताओं को सीखना संभव होता है। उसी वर्ष, माइक शूस्टर और कुलदीप के. पालीवाल ने द्विदिशात्मक आवर्तक तंत्रिका नेटवर्क (BRNN) प्रस्तावित किए, जो अनुक्रमों को आगे और पीछे दोनों दिशाओं में संसाधित करते हैं, और LSTM के साथ द्विदिशात्मकता का संयोजन (BiLSTM) अत्यधिक प्रभावी साबित हुआ; 2000 के दशक के मध्य तक, BiLSTM नेटवर्क ने भाषण पहचान में अत्याधुनिक परिणाम प्राप्त किए और Google की वॉयस सर्च में उपयोग किए गए।

आवर्तक नेटवर्क ने भाषा मॉडलिंग को भी आगे बढ़ाया। 2010 में, तोमास मिकोलोव और सहकर्मियों ने प्रदर्शित किया कि RNN-आधारित भाषा मॉडल पारंपरिक n-ग्राम मॉडल से बेहतर प्रदर्शन कर सकते हैं। 2014 में, क्युंगह्यून चो और सहकर्मियों ने मशीन अनुवाद के लिए एक RNN एनकोडर-डिकोडर प्रस्तावित किया, और एक अन्य 2014 अध्ययन ने दिखाया कि LSTM सामान्य अनुक्रम-से-अनुक्रम सीखने को कर सकते हैं। ये मॉडल अनुवाद में अत्याधुनिक बन गए और ध्यान तंत्रों के विकास और अंततः ट्रांसफॉर्मर के उदय में सहायक थे।

विन्यास और विविधताएँ

एक RNN-आधारित प्रणाली को दो भागों से मिलकर समझा जा सकता है: विन्यास और वास्तुकला। विन्यास से तात्पर्य है कि कई RNN डेटा प्रवाह में कैसे व्यवस्थित हैं - उदाहरण के लिए, स्टैक्ड परतें या द्विदिशात्मक प्रसंस्करण - जबकि वास्तुकला प्रत्येक व्यक्तिगत RNN इकाई की आंतरिक संरचना को संदर्भित करती है। सामान्य वास्तुकलाओं में मानक आवर्तक इकाई, अपने गेटिंग तंत्रों के साथ LSTM इकाई, और गेटेड आवर्तक इकाई (GRU) शामिल हैं, जिसे कम्प्यूटेशनल रूप से कुशल विकल्प के रूप में पेश किया गया।

RNN को विभिन्न विन्यासों में व्यवस्थित किया जा सकता है, जैसे कई-से-एक (वर्गीकरण के लिए), एक-से-कई (उत्पादन के लिए), और कई-से-कई (अनुक्रम लेबलिंग के लिए)। द्विदिशात्मक विन्यास अतीत और भविष्य के संदर्भ को पकड़ने के लिए डेटा को दोनों दिशाओं में संसाधित करते हैं, और एनकोडर-डिकोडर विन्यास एक अनुक्रम को दूसरे में मैप करते हैं, जो अनुवाद जैसे कार्यों के लिए उपयोगी है।

प्रशिक्षण और चुनौतियाँ

RNN को आमतौर पर समय के माध्यम से बैकप्रोपेगेशन का उपयोग करके प्रशिक्षित किया जाता है, जो Backpropagation का एक प्रकार है जो नेटवर्क को समय चरणों पर खोलता है। यह दृष्टिकोण लुप्त ग्रेडिएंट समस्या से ग्रस्त है, विशेष रूप से लंबे अनुक्रमों के लिए, जो लंबी दूरी की निर्भरताओं को सीखने की क्षमता को सीमित करता है; ग्रेडिएंट पीछे की ओर प्रसारित होने पर घातीय रूप से छोटे या बड़े हो सकते हैं। LSTM और GRU वास्तुकलाएँ सूचना प्रवाह को नियंत्रित करने वाले गेटिंग तंत्रों के माध्यम से इसे संबोधित करती हैं, जिससे ग्रेडिएंट कई चरणों में बने रहते हैं। Gradient Clipping, Dropout, और सावधान Weight Initialization जैसी अन्य तकनीकें भी प्रशिक्षण को स्थिर करने में मदद करती हैं।

RNN डेटा को अनुक्रमिक रूप से संसाधित करते हैं, जो उन्हें ट्रांसफॉर्मर की तुलना में कम समानांतर बनाता है, लेकिन वे अक्सर अधिक मेमोरी-कुशल होते हैं और छोटे अनुक्रमों पर अनुमान के लिए कम कम्प्यूटेशनल संसाधनों की आवश्यकता होती है। यह उन्हें वास्तविक समय प्रणालियों, एम्बेडेड उपकरणों और अन्य सीमित संसाधनों वाले सेटिंग्स के लिए आकर्षक बनाता है।

प्रासंगिकता और ट्रांसफॉर्मर के साथ तुलना

2017 में Transformer (architecture) वास्तुकला की शुरुआत के बाद से, जो आवर्तन के बजाय स्व-ध्यान पर निर्भर करती है, ट्रांसफॉर्मर अधिकांश प्राकृतिक भाषा प्रसंस्करण कार्यों के लिए प्रमुख विकल्प बन गए हैं, जिनमें जनरेटिव AI और LLM शामिल हैं, उनकी लंबी दूरी की निर्भरताओं के बेहतर संचालन और अधिक समानांतरता के कारण। हालाँकि, RNN अप्रचलित नहीं हैं। वे उन अनुप्रयोगों में उपयोग किए जाते रहते हैं जहाँ कम्प्यूटेशनल दक्षता, वास्तविक समय प्रसंस्करण, या डेटा की स्वाभाविक रूप से अनुक्रमिक प्रकृति महत्वपूर्ण है, जैसे डिवाइस-पर भाषण पहचान, वास्तविक समय भाषा मॉडलिंग, और कुछ समय श्रृंखला पूर्वानुमान कार्य। RNN और ट्रांसफॉर्मर के विचारों को मिलाने वाले हाइब्रिड मॉडलों में भी अनुसंधान जारी है, जो दक्षता और सटीकता को संतुलित करना चाहते हैं।

संक्षेप में, RNN मॉडलों की एक मौलिक श्रेणी है जिसने अनुक्रमिक डेटा प्रसंस्करण के लिए प्रमुख अवधारणाएँ पेश कीं, जिनमें छिपी हुई स्थितियाँ और आवर्तन शामिल हैं। उनकी विरासत उन वास्तुकलाओं में दिखाई देती है जो उनके बाद आईं, और वे व्यापक गहन शिक्षण परिदृश्य में एक विशिष्ट स्थान बनाए रखते हैं।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:recurrent-neural-network·sequential-data·neural-network-architecture·deep-learning
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास