लॉन्ग शॉर्ट-टर्म मेमोरी, या LSTM, एक आवर्ती तंत्रिका नेटवर्क वास्तुकला है जिसे अनुक्रमिक डेटा में दीर्घकालिक निर्भरताएँ सीखने के लिए डिज़ाइन किया गया है, जिसमें गेटेड इकाइयों का उपयोग करके यह नियंत्रित किया जाता है कि जानकारी को एक स्थायी आंतरिक मेमोरी सेल में कैसे जोड़ा, बनाए रखा या हटाया जाता है। इसे विशेष रूप से लुप्त ग्रेडिएंट समस्या को हल करने के लिए पेश किया गया था, जिसके कारण साधारण RNN कई समय चरणों से अलग किए गए घटनाओं के बीच संबंध सीखने में असमर्थ थे।
इतिहास
LSTM को 1997 के एक पेपर में सेप होचरेइटर और जुर्गन श्मिडहुबर द्वारा पेश किया गया था, जो होचरेइटर के 1991 के डिप्लोमा थीसिस विश्लेषण पर आधारित था कि मानक आवर्ती तंत्रिका नेटवर्क में बैकप्रोपेगेशन के माध्यम से प्रशिक्षित होने पर ग्रेडिएंट क्यों लुप्त या विस्फोटित होते हैं। मूल वास्तुकला को अगले दशक में परिष्कृत किया गया, विशेष रूप से 2000 में फेलिक्स गेर्स और सहयोगियों द्वारा एक भूल गेट के जुड़ने के साथ, जिसने नेटवर्क को केवल जानकारी अनिश्चित काल तक जमा करने के बजाय सक्रिय रूप से अपने मेमोरी सेल को रीसेट करना सीखने की अनुमति दी। प्रकाशन के बाद वर्षों तक LSTM का सीमित उपयोग देखा गया, लेकिन 2010 के दशक में यह गहन शिक्षण में सबसे व्यापक रूप से उपयोग की जाने वाली वास्तुकलाओं में से एक बन गया, क्योंकि बड़े डेटासेट और GPU प्रशिक्षण ने सादे RNN पर इसके लाभों को स्पष्ट रूप से मापने योग्य बना दिया।
वास्तुकला
एक LSTM इकाई एक सेल स्थिति बनाए रखती है, जो समय चरणों में जानकारी को काफी हद तक अपरिवर्तित ले जाने वाली कन्वेयर बेल्ट की तरह कार्य करती है, साथ ही तीन गेट - इनपुट, भूल और आउटपुट गेट - जिनमें से प्रत्येक एक छोटी तंत्रिका परत है जो शून्य और एक के बीच मान उत्पन्न करती है ताकि यह नियंत्रित किया जा सके कि कितनी जानकारी गुजरती है। भूल गेट तय करता है कि सेल स्थिति से क्या त्यागना है, इनपुट गेट तय करता है कि कौन सी नई जानकारी जोड़नी है, और आउटपुट गेट तय करता है कि सेल स्थिति का कौन सा हिस्सा उस चरण पर इकाई के आउटपुट के रूप में प्रकट करना है। चूंकि सेल स्थिति को बार-बार गुणा के बजाय जोड़ के माध्यम से अद्यतन किया जाता है, ग्रेडिएंट कई समय चरणों में काफी हद तक अक्षुण्ण रूप से पीछे की ओर प्रवाहित हो सकते हैं, जो मूल तंत्र है जो LSTM को सैकड़ों चरणों तक फैली निर्भरताएँ सीखने की अनुमति देता है, जहाँ सादे RNN आमतौर पर कुछ ही चरणों से परे विफल हो जाते थे।
अनुप्रयोग
स्टैक्ड और द्विदिशात्मक LSTM 2010 के दशक में मशीन अनुवाद, वाक् पहचान और पाठ निर्माण के लिए मानक वास्तुकला बन गए, और ध्यान तंत्र के साथ LSTM-आधारित seq2seq मॉडल ट्रांसफॉर्मर वास्तुकला के प्रत्यक्ष पूर्ववर्ती थे। 2016 में तैनात Google का तंत्रिका मशीन अनुवाद प्रणाली, एक गहरी LSTM स्टैक का उपयोग करती थी और वास्तुकला के सबसे बड़े उत्पादन परिनियोजनों में से एक का प्रतिनिधित्व करती थी। LSTM का उपयोग भाषा के बाहर भी व्यापक रूप से किया गया, जिसमें समय-श्रृंखला पूर्वानुमान, हस्तलेखन पहचान, और प्रारंभिक सुदृढीकरण शिक्षण एजेंट शामिल हैं जिन्हें लंबी क्रिया अनुक्रमों में जानकारी याद रखने की आवश्यकता थी।
गिरावट और विरासत
2017 में ट्रांसफॉर्मर वास्तुकला की शुरुआत, जो गेटेड आवर्तन के माध्यम से अनुक्रमिक रूप से संसाधित करने के बजाय स्व-ध्यान का उपयोग करके पूरे अनुक्रमों को समानांतर में संसाधित करती है, ने GPU हार्डवेयर पर बेहतर प्रशिक्षण दक्षता और बड़े पैमाने पर बेहतर प्रदर्शन दोनों की पेशकश की, और कुछ वर्षों के भीतर LSTM को नए प्राकृतिक भाषा प्रसंस्करण और बड़े भाषा मॉडल प्रणालियों के लिए डिफ़ॉल्ट विकल्प के रूप में काफी हद तक विस्थापित कर दिया गया। होचरेइटर के समूह ने 2024 में xLSTM के साथ वास्तुकला को फिर से देखा, जो ट्रांसफॉर्मर से सीखी गई तकनीकों के साथ LSTM को आधुनिक बनाने का एक प्रयास था, यह तर्क देते हुए कि आवर्ती वास्तुकलाएँ बहुत लंबे अनुक्रमों के लिए प्रतिस्पर्धी रह सकती हैं, हालाँकि 2025 तक इसने मुख्यधारा के उपयोग में ट्रांसफॉर्मर या नए राज्य-स्थान मॉडल को विस्थापित नहीं किया है।