अंग्रेज़ी से अनुवादित

गेटेड रिकरंट यूनिट (GRU) एक रिकरंट न्यूरल नेटवर्क गेटिंग तंत्र है, जिसे 2014 में क्यूंग-ह्यून चो एट अल. द्वारा पेश किया गया था। यह LSTM को सरल बनाता है, कम पैरामीटर के साथ, और भाषण तथा भाषा मॉडलिंग जैसे कार्यों में समान प्रदर्शन प्राप्त करता है।

गेटेड रिकरंट यूनिट (GRU) एक प्रकार का गेटिंग तंत्र है जिसका उपयोग रिकरंट न्यूरल नेटवर्क (RNN) में किया जाता है, जिसे 2014 में क्यूंगह्यून चो और उनके सहयोगियों द्वारा पेश किया गया था। इसे मानक RNN में आम वैनिशिंग ग्रेडिएंट समस्या को हल करने के लिए डिज़ाइन किया गया है, जिसमें सूचना के प्रवाह को नियंत्रित करने के लिए अपडेट और रीसेट गेट का उपयोग किया जाता है। लॉन्ग शॉर्ट-टर्म मेमोरी (LSTM) इकाई की तुलना में, GRU की संरचना सरल होती है, जिसमें अलग संदर्भ वेक्टर और आउटपुट गेट का अभाव होता है, जिसके परिणामस्वरूप कम पैरामीटर होते हैं। इस सरलीकरण के बावजूद, GRU ने पॉलीफोनिक संगीत मॉडलिंग, भाषण संकेत मॉडलिंग, और प्राकृतिक भाषा प्रसंस्करण जैसे कार्यों में LSTM के बराबर प्रदर्शन दिखाया है। योशुआ बेंगियो की टीम के शोध ने प्रदर्शित किया कि गेटिंग आम तौर पर लाभकारी है, लेकिन GRU या LSTM समग्र रूप से बेहतर हैं या नहीं, इस पर कोई निश्चित निष्कर्ष नहीं निकला।

आर्किटेक्चर

GRU एक छिपी हुई अवस्था \( h_t \) को बनाए रखते हुए अनुक्रमों को संसाधित करता है, जिसे प्रत्येक समय चरण पर अद्यतन किया जाता है। पूर्ण रूप से गेटेड इकाई के लिए मुख्य समीकरण इस प्रकार हैं:

\[ z_t = \sigma(W_z x_t + U_z h_{t-1} + b_z) \]

\[ r_t = \sigma(W_r x_t + U_r h_{t-1} + b_r) \]

\[ \hat{h}_t = \phi(W_h x_t + U_h (r_t \odot h_{t-1}) + b_h) \]

\[ h_t = (1 - z_t) \odot h_{t-1} + z_t \odot \hat{h}_t \]

यहाँ, \( \sigma \) सिग्मॉइड सक्रियण फलन है, \( \phi \) आम तौर पर हाइपरबोलिक टेंगेंट (tanh) है, और \( \odot \) हैडामार्ड (तत्व-वार) गुणन को दर्शाता है। इनपुट वेक्टर \( x_t \in \mathbb{R}^d \) है, और छिपी हुई अवस्था \( h_t \in \mathbb{R}^e \) है। अपडेट गेट \( z_t \) यह निर्धारित करता है कि पिछली छिपी हुई अवस्था का कितना हिस्सा बनाए रखना है, जबकि रीसेट गेट \( r_t \) नियंत्रित करता है कि उम्मीदवार सक्रियण \( \hat{h}_t \) की गणना करते समय पिछली जानकारी का कितना हिस्सा भूलना है। अंतिम छिपी हुई अवस्था पिछली अवस्था और उम्मीदवार के बीच एक रैखिक प्रक्षेप है, जो अपडेट गेट द्वारा भारित होती है।

विविधताएँ

GRU की कई विविधताएँ मौजूद हैं, जो गेट की गणना और संयोजन के तरीके में भिन्न हैं। सबसे आम विविधता ऊपर वर्णित पूर्ण रूप से गेटेड इकाई है। एक सरलीकृत संस्करण, जिसे न्यूनतम गेटेड इकाई (MGU) के रूप में जाना जाता है, केवल एक ही गेट का उपयोग करता है जो अपडेट और रीसेट कार्यों को जोड़ता है, जिससे पैरामीटर संख्या और कम हो जाती है। अन्य विविधताएँ बायस की स्थिति या संचालन के क्रम को बदल सकती हैं, लेकिन सभी सूचना प्रवाह को प्रबंधित करने के लिए गेटिंग के मूल सिद्धांत को बनाए रखती हैं।

अनुप्रयोग और प्रदर्शन

GRU को अनुक्रम मॉडलिंग कार्यों में व्यापक रूप से अपनाया गया है, जिसमें भाषण पहचान, मशीन अनुवाद, और समय श्रृंखला भविष्यवाणी शामिल हैं। तुलनात्मक अध्ययनों में, GRU ने कई बेंचमार्कों पर LSTM के प्रदर्शन को मात दी है, विशेष रूप से पॉलीफोनिक संगीत मॉडलिंग और भाषण संकेत मॉडलिंग में। उनकी कम पैरामीटर संख्या उन्हें कम्प्यूटेशनल रूप से अधिक कुशल बनाती है, जो बड़े डेटासेट पर प्रशिक्षण या संसाधन-सीमित वातावरण में लाभकारी है। हालाँकि, GRU और LSTM के बीच चुनाव अक्सर विशिष्ट कार्य और डेटासेट पर निर्भर करता है, जिसमें कोई सार्वभौमिक विजेता नहीं होता।

अन्य आर्किटेक्चर से संबंध

GRU कई डीप लर्निंग मॉडलों में एक मूलभूत घटक हैं, विशेष रूप से ट्रांसफॉर्मर आर्किटेक्चर के उदय से पहले। जबकि ट्रांसफॉर्मर बड़े भाषा मॉडल और जनरेटिव एआई में प्रमुख हो गए हैं, GRU उन कार्यों के लिए प्रासंगिक बने हुए हैं जिनमें अनुक्रमिक डेटा शामिल है जहाँ आवर्ती प्रसंस्करण लाभकारी है। वे हाइब्रिड मॉडल में भी उपयोग किए जाते हैं जो आवर्ती और ध्यान तंत्र को जोड़ते हैं। GRU के विकास ने न्यूरल नेटवर्क में गेटिंग तंत्र की व्यापक समझ में योगदान दिया, जिससे मॉडल डिज़ाइन में बाद के नवाचार प्रभावित हुए।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:neural-network·deep-learning·sequence-modeling
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास