लॉन्ग शॉर्ट‑टर्म मेमोरी (LSTM)

अंग्रेज़ी से अनुवादित

लॉन्ग शॉर्ट-टर्म मेमोरी (LSTM) एक आवर्तक तंत्रिका नेटवर्क वास्तुकला है जिसे गेटेड सेल्स का उपयोग करके अनुक्रमिक डेटा में दीर्घ-सीमा निर्भरताओं को संभालने के लिए डिज़ाइन किया गया है, जो लुप्त होती ढाल समस्या को कम करते हैं।

लॉन्ग शॉर्ट-टर्म मेमोरी (LSTM) एक प्रकार का आवर्तक तंत्रिका नेटवर्क (RNN) है जिसे पारंपरिक RNN को सीमित करने वाली लुप्त ग्रेडिएंट समस्या को हल करने के लिए पेश किया गया था। मानक RNN के विपरीत, LSTM इकाइयों में एक सेल अवस्था और तीन गेटिंग तंत्र शामिल होते हैं - एक इनपुट गेट, एक आउटपुट गेट, और एक भूलने वाला गेट - जो मनमाने समय अंतराल पर सूचना प्रवाह को नियंत्रित करते हैं। यह डिज़ाइन LSTM नेटवर्क को हजारों समय चरणों में निर्भरता बनाए रखने की अनुमति देता है, जिससे वे भाषण पहचान, मशीन अनुवाद, और समय श्रृंखला पूर्वानुमान जैसे अनुक्रम सीखने के कार्यों के लिए प्रभावी बनते हैं। यह नाम संज्ञानात्मक मनोविज्ञान की दीर्घकालिक और अल्पकालिक स्मृति की अवधारणाओं के सादृश्य को दर्शाता है, जिसका अध्ययन 20वीं सदी की शुरुआत से किया जा रहा है।

अंतराल लंबाई के प्रति LSTM की सापेक्ष असंवेदनशीलता इसे अन्य RNN, छिपे हुए मार्कोव मॉडल, और वैकल्पिक अनुक्रम सीखने के तरीकों पर लाभ देती है। यह वास्तुकला 1997 में सेप होचरेइटर और जुर्गन श्मिडहुबर द्वारा प्रस्तावित की गई थी, और तब से यह गहन शिक्षण में एक मूलभूत घटक बन गई है, विशेष रूप से ट्रांसफॉर्मर-आधारित मॉडल के उदय से पहले।

प्रेरणा

क्लासिक RNN सैद्धांतिक रूप से मनमानी दीर्घकालिक निर्भरता को पकड़ सकते हैं, लेकिन व्यवहार में वे बैकप्रोपेगेशन के दौरान लुप्त ग्रेडिएंट से पीड़ित होते हैं। बैकप्रोपेगेशन के साथ प्रशिक्षण करते समय, कई समय चरणों में प्रसारित होने वाले ग्रेडिएंट घातीय रूप से सिकुड़ सकते हैं, जिससे नेटवर्क प्रभावी ढंग से सीखना बंद कर देता है। LSTM इकाइयाँ सेल अवस्था के माध्यम से ग्रेडिएंट को कम क्षीणन के साथ प्रवाहित करने की अनुमति देकर इसे कम करती हैं, हालाँकि वे अभी भी विस्फोटक ग्रेडिएंट का सामना कर सकती हैं।

LSTM के पीछे की अंतर्ज्ञान एक ऐसा मॉड्यूल बनाना है जो सीखता है कि कब याद रखना है और कब जानकारी भूलना है। नेटवर्क सीखता है कि कौन सी जानकारी बाद में अनुक्रम में आवश्यक होने की संभावना है और वे कब अप्रासंगिक हो जाती हैं। उदाहरण के लिए, प्राकृतिक भाषा प्रसंस्करण में, वाक्य "डेव, अपने विवादास्पद दावों के परिणामस्वरूप, अब एक बहिष्कृत है" को संसाधित करने वाला एक LSTM सर्वनाम "अपने" की सही व्याख्या करने के लिए विषय "डेव" के व्याकरणिक लिंग और संख्या को याद रख सकता है, और फिर क्रिया "है" के बाद उस जानकारी को त्याग सकता है।

वास्तुकला

एक LSTM इकाई में एक सेल और तीन गेट होते हैं। सेल मनमाने समय अंतराल पर मानों को याद रखता है। भूलने वाला गेट पिछली अवस्था और वर्तमान इनपुट को 0 और 1 के बीच के मान पर मैप करके पिछली अवस्था से क्या त्यागना है, यह तय करता है, जहाँ 1 का मतलब बनाए रखना और 0 का मतलब त्यागना है। इनपुट गेट समान तंत्र का उपयोग करके सेल अवस्था में कौन सी नई जानकारी संग्रहीत करनी है, यह निर्धारित करता है। आउटपुट गेट पिछली और वर्तमान अवस्थाओं दोनों पर विचार करते हुए, 0 और 1 के बीच के मान का उपयोग करके वर्तमान सेल अवस्था के कौन से हिस्से को आउटपुट करना है, यह नियंत्रित करता है।

गणितीय रूप से, भूलने वाले गेट के साथ एक LSTM सेल का अग्रगामी पास वेक्टर संकेतन का उपयोग करके वर्णित किया जा सकता है। मान लें \(x_t\) समय चरण \(t\) पर इनपुट है, \(h_{t-1}\) पिछली छिपी हुई अवस्था है, और \(c_{t-1}\) पिछली सेल अवस्था है। गेटों की गणना इस प्रकार की जाती है:

  • भूलने वाला गेट: \(f_t = \sigma_g(W_f x_t + U_f h_{t-1} + b_f)\)
  • इनपुट गेट: \(i_t = \sigma_g(W_i x_t + U_i h_{t-1} + b_i)\)
  • आउटपुट गेट: \(o_t = \sigma_g(W_o x_t + U_o h_{t-1} + b_o)\)
  • उम्मीदवार सेल अवस्था: \(\tilde{c}_t = \tanh(W_c x_t + U_c h_{t-1} + b_c)\)
  • सेल अवस्था अद्यतन: \(c_t = f_t \odot c_{t-1} + i_t \odot \tilde{c}_t\)
  • छिपी हुई अवस्था: \(h_t = o_t \odot \tanh(c_t)\)

यहाँ, \(\sigma_g\) सिग्मॉइड सक्रियण फलन है, \(\tanh\) हाइपरबोलिक स्पर्शज्या है, और \(\odot\) तत्व-वार गुणन को दर्शाता है। भार मैट्रिक्स \(W_q\) और \(U_q\) (जहाँ \(q\) \(i\), \(o\), \(f\), या \(c\) हो सकता है) में क्रमशः इनपुट और आवर्तक कनेक्शन होते हैं।

विविधताएँ और विस्तार

LSTM की कई विविधताएँ प्रदर्शन में सुधार करने या विशिष्ट कार्यों के अनुकूल बनाने के लिए विकसित की गई हैं। सबसे आम विविधता भूलने वाले गेट के साथ LSTM है, जो अब मानक है। अन्य उल्लेखनीय विविधताओं में शामिल हैं:

  • गेटेड आवर्तक इकाई (GRU): एक सरलीकृत वास्तुकला जो इनपुट और भूलने वाले गेट को एक एकल अद्यतन गेट में जोड़ती है, जिससे कम्प्यूटेशनल जटिलता कम होती है।
  • द्विदिशात्मक LSTM: अनुक्रम को आगे और पीछे दोनों दिशाओं में संसाधित करता है, अतीत और भविष्य दोनों से संदर्भ को पकड़ता है।
  • पीहोल कनेक्शन: गेटों को सेल अवस्था तक सीधे पहुँचने की अनुमति देते हैं, जिससे समय और सटीकता में सुधार होता है।

ये विविधताएँ Deep learning अनुप्रयोगों में व्यापक रूप से अपनाई गई हैं, जिनमें Large language model और Neural network-आधारित सिस्टम शामिल हैं।

अनुप्रयोग

LSTM नेटवर्क को कई प्रकार के कार्यों पर लागू किया गया है, जिनमें वर्गीकरण, डेटा प्रसंस्करण, समय श्रृंखला विश्लेषण, भाषण पहचान, मशीन अनुवाद, भाषण गतिविधि पहचान, रोबोट नियंत्रण, वीडियो गेम, स्वास्थ्य देखभाल, और ऊर्जा पूर्वानुमान शामिल हैं। 2010 के दशक की शुरुआत में, LSTM-आधारित मॉडल ने भाषण पहचान और मशीन अनुवाद में अत्याधुनिक परिणाम प्राप्त किए, जिससे आधुनिक Artificial intelligence सिस्टम का मार्ग प्रशस्त हुआ।

2017 में Transformer (architecture) वास्तुकला के आगमन के साथ, अनुक्रम प्रसंस्करण में LSTM का प्रभुत्व कम हो गया है, विशेष रूप से बड़े पैमाने पर Generative AI मॉडल में। हालाँकि, LSTM कई अनुप्रयोगों के लिए प्रासंगिक बना हुआ है, विशेष रूप से उन लोगों के लिए जिनमें सीमित कम्प्यूटेशनल संसाधन हैं या जहाँ अनुक्रमिक प्रसंस्करण अंतर्निहित है, जैसे एम्बेडेड सिस्टम और वास्तविक समय नियंत्रण में।

सीमाएँ

अपने लाभों के बावजूद, LSTM में सीमाएँ हैं। यह अतिरिक्त गेटों के कारण सरल RNN की तुलना में कम्प्यूटेशनल रूप से अधिक महंगा है। यह अभी भी विस्फोटक ग्रेडिएंट से पीड़ित हो सकता है, हालाँकि ग्रेडिएंट क्लिपिंग जैसी तकनीकें मदद करती हैं। इसके अलावा, LSTM अनुक्रमों को क्रमिक रूप से संसाधित करता है, जिससे समय चरणों में समानांतर करना मुश्किल हो जाता है, जो एक प्रमुख कारण है कि ट्रांसफॉर्मर बड़े पैमाने पर मॉडल के लिए पसंदीदा बन गए हैं। फिर भी, अंतराल लंबाई के प्रति सापेक्ष असंवेदनशीलता के साथ दीर्घकालिक निर्भरता को मॉडल करने की LSTM की क्षमता इसे Machine learning टूलबॉक्स में एक मूल्यवान उपकरण बनाती है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:recurrent-neural-networks·deep-learning·sequence-modeling
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास