गेटेड रिकरंट यूनिट (GRU) एक प्रकार का गेटिंग तंत्र है जिसका उपयोग पुनरावर्ती तंत्रिका नेटवर्क में किया जाता है, जिसे 2014 में क्यूंग-ह्यून चो और उनके सहयोगियों ने प्रस्तुत किया था। इसे मानक पुनरावर्ती नेटवर्क में आम वैनिशिंग ग्रेडिएंट समस्या को हल करने के लिए डिज़ाइन किया गया है, जिसमें दो गेट - एक अपडेट गेट और एक रीसेट गेट - का उपयोग करके यह नियंत्रित किया जाता है कि पिछली जानकारी कितनी बनाए रखी जाए या भुला दी जाए। लॉन्ग शॉर्ट-टर्म मेमोरी (LSTM) इकाई की तुलना में, GRU की संरचना सरल है: इसमें अलग संदर्भ वेक्टर और आउटपुट गेट का अभाव है, जिसके परिणामस्वरूप कम पैरामीटर और अक्सर तेज़ प्रशिक्षण होता है। इस सरलीकरण के बावजूद, GRU ने बहु-स्वर संगीत मॉडलिंग, भाषण संकेत मॉडलिंग, और प्राकृतिक भाषा प्रसंस्करण जैसे कार्यों पर LSTM के बराबर प्रदर्शन दिखाया है। योशुआ बेंजियो की टीम के शोध में पाया गया कि गेटिंग व्यापक रूप से लाभदायक है, लेकिन यह निश्चित निष्कर्ष नहीं निकाला गया कि GRU या LSTM सामान्य रूप से बेहतर हैं।
वास्तुकला
GRU इनपुट अनुक्रमों को चरणबद्ध तरीके से संसाधित करता है, एक छिपी हुई स्थिति बनाए रखता है जो समय चरणों में जानकारी ले जाती है। प्रत्येक समय चरण पर, इकाई एक अपडेट गेट और एक रीसेट गेट की गणना करती है, दोनों वर्तमान इनपुट और पिछली छिपी हुई स्थिति के फलन हैं। अपडेट गेट यह निर्धारित करता है कि पिछली स्थिति का कितना हिस्सा आगे ले जाना है, जबकि रीसेट गेट यह तय करता है कि उम्मीदवार सक्रियण की गणना करते समय पिछली स्थिति का कितना उपयोग करना है। अंतिम छिपी हुई स्थिति पिछली स्थिति और उम्मीदवार सक्रियण का एक उत्तल संयोजन है, जिसे अपडेट गेट द्वारा भारित किया जाता है।
गणितीय रूप से, इनपुट वेक्टर \(x_t\) और पिछली छिपी हुई स्थिति \(h_{t-1}\) के लिए, गेट और उम्मीदवार सक्रियण की गणना इस प्रकार की जाती है:
- अपडेट गेट: \(z_t = \sigma(W_z x_t + U_z h_{t-1} + b_z)\)
- रीसेट गेट: \(r_t = \sigma(W_r x_t + U_r h_{t-1} + b_r)\)
- उम्मीदवार सक्रियण: \(\hat{h}_t = \phi(W_h x_t + U_h (r_t \odot h_{t-1}) + b_h)\)
- अंतिम छिपी हुई स्थिति: \(h_t = (1 - z_t) \odot h_{t-1} + z_t \odot \hat{h}_t\)
यहाँ, \(\sigma\) सिग्मॉइड सक्रियण फलन है, \(\phi\) आमतौर पर हाइपरबोलिक टैंजेंट है, और \(\odot\) हैडामार्ड (तत्व-वार) गुणनफल को दर्शाता है। भार मैट्रिक्स \(W_z, W_r, W_h\) और \(U_z, U_r, U_h\) के साथ बायस वेक्टर \(b_z, b_r, b_h\) प्रशिक्षण के दौरान सीखे जाते हैं। प्रारंभिक छिपी हुई स्थिति आमतौर पर शून्य पर सेट होती है।
प्रकार
GRU के कई रूप मौजूद हैं, जो इस बात में भिन्न हैं कि गेट की गणना या संयोजन कैसे किया जाता है। एक उल्लेखनीय सरलीकृत संस्करण न्यूनतम गेटेड यूनिट है, जो कम्प्यूटेशनल जटिलता को कम करने के लिए केवल एक गेट (अक्सर अपडेट और रीसेट का संयोजन) का उपयोग करता है। अन्य रूप संचालन के क्रम या रीसेट गेट के पिछली स्थिति के साथ परस्पर क्रिया के तरीके को समायोजित कर सकते हैं। इन संशोधनों का उद्देश्य विशिष्ट कार्यों पर दक्षता या प्रदर्शन में सुधार करना है, लेकिन गेटेड सूचना प्रवाह का मूल सिद्धांत सुसंगत रहता है।
अनुप्रयोग
GRU का व्यापक रूप से अनुक्रम मॉडलिंग कार्यों में उपयोग किया गया है, जिसमें प्राकृतिक भाषा प्रसंस्करण (जैसे, मशीन अनुवाद, भाषा मॉडलिंग), भाषण पहचान, और संगीत निर्माण शामिल हैं। इनका उपयोग समय श्रृंखला पूर्वानुमान और हाइब्रिड वास्तुकला में भी किया जाता है, जहां उन्हें कनवल्शनल परतों या ध्यान तंत्र के साथ जोड़ा जाता है। कई स्थितियों में, GRU LSTM के लिए हल्के विकल्प के रूप में काम करते हैं, खासकर जब कम्प्यूटेशनल संसाधन सीमित हों या अनुक्रम की लंबाई मध्यम हो।
LSTM के साथ तुलना
GRU और LSTM दोनों वैनिशिंग ग्रेडिएंट समस्या को कम करने के लिए विकसित किए गए थे, लेकिन वे आंतरिक संरचना में भिन्न हैं। एक LSTM में तीन गेट (इनपुट, भूलने और आउटपुट) और एक अलग सेल स्थिति होती है, जबकि एक GRU में दो गेट और कोई अलग सेल स्थिति नहीं होती। यह GRU को पैरामीटर-कुशल और अक्सर प्रशिक्षित करने में तेज़ बनाता है। अनुभवजन्य रूप से, अध्ययनों ने पाया है कि GRU कई बेंचमार्क कार्यों पर LSTM के समान प्रदर्शन करता है, हालांकि परिणाम डेटासेट और कार्य के आधार पर भिन्न हो सकते हैं। कुछ शोध बताते हैं कि GRU छोटे डेटासेट पर बेहतर सामान्यीकरण कर सकता है, जबकि LSTM बड़े डेटासेट पर उत्कृष्ट हो सकता है, लेकिन कोई निश्चित लाभ स्थापित नहीं किया गया है।