एलएसटीएम (लॉन्ग शॉर्ट-टर्म मेमोरी)

अंग्रेज़ी से अनुवादित

LSTM (लॉन्ग शॉर्ट-टर्म मेमोरी) एक आवर्ती तंत्रिका नेटवर्क वास्तुकला है जिसमें गेटेड मेमोरी सेल होते हैं, जो इसे अनुक्रमिक डेटा में दीर्घकालिक निर्भरताएँ सीखने की अनुमति देता है।

लॉन्ग शॉर्ट-टर्म मेमोरी, या LSTM, एक आवर्ती तंत्रिका नेटवर्क वास्तुकला है जिसे अनुक्रमिक डेटा में दीर्घकालिक निर्भरताएँ सीखने के लिए डिज़ाइन किया गया है, जिसमें गेटेड इकाइयों का उपयोग करके यह नियंत्रित किया जाता है कि जानकारी को एक स्थायी आंतरिक मेमोरी सेल में कैसे जोड़ा, बनाए रखा या हटाया जाता है। इसे विशेष रूप से लुप्त ग्रेडिएंट समस्या को हल करने के लिए पेश किया गया था, जिसके कारण साधारण RNN कई समय चरणों से अलग किए गए घटनाओं के बीच संबंध सीखने में असमर्थ थे।

इतिहास

LSTM को 1997 के एक पेपर में सेप होचरेइटर और जुर्गन श्मिडहुबर द्वारा पेश किया गया था, जो होचरेइटर के 1991 के डिप्लोमा थीसिस विश्लेषण पर आधारित था कि मानक आवर्ती तंत्रिका नेटवर्क में बैकप्रोपेगेशन के माध्यम से प्रशिक्षित होने पर ग्रेडिएंट क्यों लुप्त या विस्फोटित होते हैं। मूल वास्तुकला को अगले दशक में परिष्कृत किया गया, विशेष रूप से 2000 में फेलिक्स गेर्स और सहयोगियों द्वारा एक भूल गेट के जुड़ने के साथ, जिसने नेटवर्क को केवल जानकारी अनिश्चित काल तक जमा करने के बजाय सक्रिय रूप से अपने मेमोरी सेल को रीसेट करना सीखने की अनुमति दी। प्रकाशन के बाद वर्षों तक LSTM का सीमित उपयोग देखा गया, लेकिन 2010 के दशक में यह गहन शिक्षण में सबसे व्यापक रूप से उपयोग की जाने वाली वास्तुकलाओं में से एक बन गया, क्योंकि बड़े डेटासेट और GPU प्रशिक्षण ने सादे RNN पर इसके लाभों को स्पष्ट रूप से मापने योग्य बना दिया।

वास्तुकला

एक LSTM इकाई एक सेल स्थिति बनाए रखती है, जो समय चरणों में जानकारी को काफी हद तक अपरिवर्तित ले जाने वाली कन्वेयर बेल्ट की तरह कार्य करती है, साथ ही तीन गेट - इनपुट, भूल और आउटपुट गेट - जिनमें से प्रत्येक एक छोटी तंत्रिका परत है जो शून्य और एक के बीच मान उत्पन्न करती है ताकि यह नियंत्रित किया जा सके कि कितनी जानकारी गुजरती है। भूल गेट तय करता है कि सेल स्थिति से क्या त्यागना है, इनपुट गेट तय करता है कि कौन सी नई जानकारी जोड़नी है, और आउटपुट गेट तय करता है कि सेल स्थिति का कौन सा हिस्सा उस चरण पर इकाई के आउटपुट के रूप में प्रकट करना है। चूंकि सेल स्थिति को बार-बार गुणा के बजाय जोड़ के माध्यम से अद्यतन किया जाता है, ग्रेडिएंट कई समय चरणों में काफी हद तक अक्षुण्ण रूप से पीछे की ओर प्रवाहित हो सकते हैं, जो मूल तंत्र है जो LSTM को सैकड़ों चरणों तक फैली निर्भरताएँ सीखने की अनुमति देता है, जहाँ सादे RNN आमतौर पर कुछ ही चरणों से परे विफल हो जाते थे।

अनुप्रयोग

स्टैक्ड और द्विदिशात्मक LSTM 2010 के दशक में मशीन अनुवाद, वाक् पहचान और पाठ निर्माण के लिए मानक वास्तुकला बन गए, और ध्यान तंत्र के साथ LSTM-आधारित seq2seq मॉडल ट्रांसफॉर्मर वास्तुकला के प्रत्यक्ष पूर्ववर्ती थे। 2016 में तैनात Google का तंत्रिका मशीन अनुवाद प्रणाली, एक गहरी LSTM स्टैक का उपयोग करती थी और वास्तुकला के सबसे बड़े उत्पादन परिनियोजनों में से एक का प्रतिनिधित्व करती थी। LSTM का उपयोग भाषा के बाहर भी व्यापक रूप से किया गया, जिसमें समय-श्रृंखला पूर्वानुमान, हस्तलेखन पहचान, और प्रारंभिक सुदृढीकरण शिक्षण एजेंट शामिल हैं जिन्हें लंबी क्रिया अनुक्रमों में जानकारी याद रखने की आवश्यकता थी।

गिरावट और विरासत

2017 में ट्रांसफॉर्मर वास्तुकला की शुरुआत, जो गेटेड आवर्तन के माध्यम से अनुक्रमिक रूप से संसाधित करने के बजाय स्व-ध्यान का उपयोग करके पूरे अनुक्रमों को समानांतर में संसाधित करती है, ने GPU हार्डवेयर पर बेहतर प्रशिक्षण दक्षता और बड़े पैमाने पर बेहतर प्रदर्शन दोनों की पेशकश की, और कुछ वर्षों के भीतर LSTM को नए प्राकृतिक भाषा प्रसंस्करण और बड़े भाषा मॉडल प्रणालियों के लिए डिफ़ॉल्ट विकल्प के रूप में काफी हद तक विस्थापित कर दिया गया। होचरेइटर के समूह ने 2024 में xLSTM के साथ वास्तुकला को फिर से देखा, जो ट्रांसफॉर्मर से सीखी गई तकनीकों के साथ LSTM को आधुनिक बनाने का एक प्रयास था, यह तर्क देते हुए कि आवर्ती वास्तुकलाएँ बहुत लंबे अनुक्रमों के लिए प्रतिस्पर्धी रह सकती हैं, हालाँकि 2025 तक इसने मुख्यधारा के उपयोग में ट्रांसफॉर्मर या नए राज्य-स्थान मॉडल को विस्थापित नहीं किया है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:deep-learning·natural-language-processing·neural-networks
इस पृष्ठ को अंतिम बार संपादित किया गया 2 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास