1997年सेवा होचरेइटर और जुर्गन श्मिधुबर द्वारा लिखित पेपर "लॉन्ग शॉर्ट-टर्म मेमोरी" ने LSTM आर्किटेक्चर पेश किया, जो एक प्रकार का पुनरावर्ती तंत्रिका नेटवर्क है, जिसे पारंपरिक RNN को प्रभावित करने वाली वैनिशिंग ग्रेडिएंट समस्या को हल करने के लिए डिज़ाइन किया गया था। न्यूरल कंप्यूटेशन जर्नल में प्रकाशित इस कार्य ने नेटवर्क को हजारों टाइमस्टेप्स तक जानकारी बनाए रखने की क्षमता प्रदान की, एक ऐसी क्षमता जिसे संज्ञानात्मक मनोविज्ञान में दीर्घकालिक और अल्पकालिक स्मृति के बीच अंतर के अनुरूप "लॉन्ग शॉर्ट-टर्म मेमोरी" नाम दिया गया। इस पेपर ने एक ऐसे मॉडल की नींव रखी जो बाद में मशीन लर्निंग और डीप लर्निंग प्रणालियों का आधार बन गया, जिसने वाक् पहचान से लेकर बड़े भाषा मॉडल तक के क्षेत्रों को प्रभावित किया।
LSTM इकाइयाँ मानक RNN न्यूरॉन्स से भिन्न होती हैं, क्योंकि उनमें एक मेमोरी सेल और तीन गेटिंग तंत्र शामिल होते हैं: एक इनपुट गेट, एक आउटपुट गेट, और एक फॉरगेट गेट। सेल मनमाने अंतराल पर जानकारी संग्रहीत करता है, जबकि गेट डेटा के प्रवाह को नियंत्रित करते हैं। फॉरगेट गेट, जो बाद के शोधनों में पेश किया गया लेकिन आर्किटेक्चर की प्रभावशीलता के लिए केंद्रीय है, पिछले राज्य और वर्तमान इनपुट को 0 और 1 के बीच के मान में मैप करके पिछले राज्य से क्या त्यागना है यह तय करता है, जहाँ 1 का अर्थ है बनाए रखना और 0 का अर्थ है त्यागना। इनपुट गेट यह निर्धारित करता है कि कौन सी नई जानकारी संग्रहीत की जाए, और आउटपुट गेट नियंत्रित करता है कि सेल राज्य से क्या उत्सर्जित किया जाए। यह गेटेड संरचना बैकप्रोपेगेशन के दौरान ग्रेडिएंट्स को न्यूनतम क्षीणन के साथ प्रवाहित करने की अनुमति देती है, जिससे वैनिशिंग ग्रेडिएंट समस्या कम होती है और लंबी दूरी की निर्भरताएँ सीखने में सक्षम बनती है।
प्रेरणा और समस्या संदर्भ
क्लासिक RNN सैद्धांतिक रूप से मनमानी दीर्घकालिक निर्भरताओं को ट्रैक कर सकते थे, लेकिन व्यवहार में वे कम्प्यूटेशनल मुद्दों के कारण विफल रहे। बैकप्रोपेगेशन के दौरान प्रशिक्षण में, कई टाइमस्टेप्स पर प्रसारित ग्रेडिएंट्स लुप्त हो जाते थे, शून्य की ओर सिकुड़ते हुए सीखने को रोक देते थे। यह समस्या विशेष रूप से उन अनुक्रमों के लिए गंभीर थी जिनमें सैकड़ों या हजारों तत्वों के अंतराल थे, जैसे प्राकृतिक भाषा या समय श्रृंखला डेटा में। LSTM पेपर ने एक अतिरिक्त मॉड्यूल बनाकर समाधान प्रस्तावित किया जो सीखता है कि कब याद रखना है और कब जानकारी भूलना है, प्रभावी रूप से एक अल्पकालिक स्मृति प्रदान करता है जो लंबे समय तक बनी रह सकती है। उदाहरण के लिए, "डेव, अपने विवादास्पद दावों के परिणामस्वरूप, अब एक बहिष्कृत है" जैसे वाक्य को संसाधित करने में, एक LSTM विषय "डेव" के व्याकरणिक लिंग और संख्या को सर्वनाम "उसके" के लिए आवश्यक होने तक बनाए रख सकता है, फिर क्रिया के बाद उस जानकारी को त्याग सकता है। यह क्षमता LSTM को अन्य अनुक्रम सीखने के तरीकों, जैसे छिपे हुए मार्कोव मॉडल, पर लाभ देती है, विशेष रूप से उन कार्यों में जहाँ प्रासंगिक जानकारी के बीच का अंतराल परिवर्तनशील और संभावित रूप से लंबा था।
आर्किटेक्चर और गणितीय सूत्रीकरण
पेपर में LSTM सेल के फॉरवर्ड पास समीकरणों का विवरण दिया गया, जिसमें वेक्टर संकेतन का उपयोग किया गया जहाँ लोअरकेस चर वैक्टर का प्रतिनिधित्व करते हैं। मैट्रिक्स \(W_q\) और \(U_q\) में इनपुट और पुनरावर्ती कनेक्शन के भार होते हैं, जिसमें सबस्क्रिप्ट \(q\) विशिष्ट गेट या सेल को दर्शाता है: इनपुट गेट \(i\), आउटपुट गेट \(o\), फॉरगेट गेट \(f\), या मेमोरी सेल \(c\)। सेल राज्य \(c_t \in \mathbb{R}^h\) \(h\) LSTM इकाइयों का प्रतिनिधित्व करता है, एक एकल न्यूरॉन नहीं। फॉरगेट गेट वाले सेल के लिए संक्षिप्त समीकरण हैं:
\[ f_t = \sigma_g(W_f x_t + U_f h_{t-1} + b_f) \]
\[ i_t = \sigma_g(W_i x_t + U_i h_{t-1} + b_i) \]
\[ o_t = \sigma_g(W_o x_t + U_o h_{t-1} + b_o) \]
जहाँ \(\sigma_g\) सिग्मॉइड सक्रियण फ़ंक्शन है, \(x_t\) समय \(t\) पर इनपुट है, \(h_{t-1}\) पिछला छिपा हुआ राज्य है, और \(b\) पद बायस हैं। ये गेट 0 और 1 के बीच मान उत्पन्न करते हैं, सूचना प्रवाह को नियंत्रित करते हैं। सेल राज्य अद्यतन फॉरगेट गेट की चयनात्मक प्रतिधारण को इनपुट गेट की नई जानकारी के साथ जोड़ता है, और आउटपुट गेट सेल राज्य को फ़िल्टर करके छिपा हुआ राज्य उत्पन्न करता है। यह सूत्रीकरण नेटवर्क को वर्तमान और भविष्य की भविष्यवाणियों के लिए उपयोगी दीर्घकालिक निर्भरताएँ बनाए रखने की अनुमति देता है।
अनुप्रयोग और प्रभाव
1997 का पेपर LSTM को एक बहुमुखी उपकरण के रूप में स्थापित करता है, और बाद के शोध ने कई डोमेन में इसके अनुप्रयोगों का विस्तार किया। कृत्रिम बुद्धिमत्ता में, LSTM नेटवर्क वर्गीकरण, डेटा प्रोसेसिंग और समय श्रृंखला विश्लेषण के लिए व्यापक रूप से उपयोग किए गए। विशिष्ट अनुप्रयोगों में वाक् पहचान, मशीन अनुवाद, वाक् गतिविधि पहचान, रोबोट नियंत्रण, वीडियो गेम, स्वास्थ्य देखभाल और ऊर्जा पूर्वानुमान शामिल थे। लंबी दूरी की निर्भरताओं के साथ अनुक्रमिक डेटा को संभालने की आर्किटेक्चर की क्षमता ने इसे प्राकृतिक भाषा प्रसंस्करण कार्यों के लिए विशेष रूप से प्रभावी बनाया, जहाँ इसे बाद में अनुक्रम-से-अनुक्रम मॉडल और एनकोडर-डिकोडर ढाँचों में एकीकृत किया गया। LSTM का प्रभाव ट्रांसफॉर्मर आर्किटेक्चर तक विस्तारित हुआ, जो बाद में उभरे और ध्यान तंत्र की अवधारणा पर आधारित थे, हालाँकि ट्रांसफॉर्मर ने अंततः अपनी समानांतरता के कारण कई बड़े पैमाने के अनुप्रयोगों में LSTM को पीछे छोड़ दिया।
विरासत और विकास
ट्रांसफॉर्मर और जनरेटिव एआई मॉडल के उदय के बावजूद, LSTM डीप लर्निंग शिक्षा और अनुसंधान में एक मौलिक अवधारणा बना हुआ है। इसके सिद्धांतों ने ग्रेडिएंट क्लिपिंग जैसी संबंधित तकनीकों के विकास को सूचित किया ताकि विस्फोटक ग्रेडिएंट्स को संबोधित किया जा सके, और लेयर नॉर्मलाइज़ेशन और बैच नॉर्मलाइज़ेशन प्रशिक्षण को स्थिर करने के लिए। पेपर के योगदान को तंत्रिका नेटवर्क इतिहास में एक मील का पत्थर के रूप में मान्यता दी गई, होचरेइटर और श्मिधुबर के काम को हजारों बाद के अध्ययनों में उद्धृत किया गया। LSTM नेटवर्क संसाधन-सीमित वातावरण और वास्तविक समय अनुप्रयोगों में उपयोग किए जा रहे हैं जहाँ उनकी अनुक्रमिक प्रसंस्करण और ट्रांसफॉर्मर की तुलना में कम कम्प्यूटेशनल आवश्यकताएँ फायदेमंद हैं। आर्किटेक्चर के डिज़ाइन ने आधुनिक अवशिष्ट नेटवर्क और अन्य गेटेड मॉडल को भी प्रभावित किया, जिससे मशीन लर्निंग के विकास में एक प्रमुख नवाचार के रूप में इसकी जगह मजबूत हुई।
संदर्भ और आगे पढ़ना
होचरेइटर, एस., और श्मिधुबर, जे. (1997)। लॉन्ग शॉर्ट-टर्म मेमोरी। न्यूरल कंप्यूटेशन, 9(8), 1735-1780। यह मौलिक पेपर LSTM आर्किटेक्चर के लिए प्राथमिक संदर्भ बना हुआ है। अन्य शोधकर्ताओं द्वारा बाद के कार्यों ने फॉरगेट गेट को परिष्कृत किया और विविधताओं की खोज की, लेकिन 1997 के मूल विचार समकालीन एआई प्रणालियों में बने हुए हैं, जिनमें ओपनएआई और गूगल डीपमाइंड जैसी कंपनियों द्वारा उनके भाषा मॉडल और अन्य अनुप्रयोगों में उपयोग किए जाने वाले शामिल हैं।