T5 (टेक्स्ट-टू-टेक्स्ट ट्रांसफर ट्रांसफॉर्मर)

अंग्रेज़ी से अनुवादित

T5 (Text-to-Text Transfer Transformer) गूगल एआई द्वारा विकसित और 2019 में पेश किए गए एन्कोडर-डिकोडर बड़े भाषा मॉडल की एक श्रृंखला है, जो सभी प्राकृतिक भाषा प्रसंस्करण कार्यों को टेक्स्ट-टू-टेक्स्ट समस्याओं के रूप में तैयार करती है। ये मॉडल एक बड़े कोर्पस पर पूर्व-प्रशिक्षित होते हैं और विभिन्न अनुप्रयोगों के लिए फाइन-ट्यून किए जा सकते हैं।

T5 (Text-to-Text Transfer Transformer) बड़े भाषा मॉडल की एक श्रृंखला है जिसे Google AI द्वारा विकसित किया गया था और 2019 में पेश किया गया था। T5 का केंद्रीय डिज़ाइन सिद्धांत सभी प्राकृतिक भाषा प्रसंस्करण कार्यों को एक एकल टेक्स्ट-टू-टेक्स्ट प्रारूप में एकीकृत करना है: हर कार्य, चाहे वह अनुवाद हो, सारांशीकरण हो, या प्रश्न उत्तर, इनपुट टेक्स्ट लेने और आउटपुट टेक्स्ट उत्पन्न करने के रूप में तैयार किया जाता है। यह पहले के मॉडलों के विपरीत है जो अक्सर कार्य-विशिष्ट आउटपुट हेड या आर्किटेक्चर का उपयोग करते थे। मूल ट्रांसफॉर्मर मॉडल की तरह, T5 मॉडल एनकोडर-डिकोडर संरचना का उपयोग करते हैं, जहां एनकोडर इनपुट टेक्स्ट को संसाधित करता है और डिकोडर आउटपुट टेक्स्ट उत्पन्न करता है।

मूल T5 मॉडल क्लोसल क्लीन क्रॉल कॉर्पस (C4) पर पूर्व-प्रशिक्षित हैं, जो वेब से स्क्रैप किए गए टेक्स्ट और कोड वाला एक डेटासेट है। यह पूर्व-प्रशिक्षण मॉडल को सामान्य भाषा समझ और उत्पादन क्षमताओं को प्राप्त करने में सक्षम बनाता है। पूर्व-प्रशिक्षण के बाद, T5 मॉडल को विशिष्ट डाउनस्ट्रीम कार्यों पर फाइन-ट्यून किया जा सकता है, जो उनके सीखे गए प्रतिनिधित्व को विभिन्न अनुप्रयोगों में अच्छा प्रदर्शन करने के लिए अनुकूलित करता है, जिसमें चैटबॉट, कोड जनरेशन और रोबोटिक्स शामिल हैं।

प्री-ट्रेनिंग कार्य

T5 मॉडल का प्री-ट्रेनिंग विभिन्न प्रकार के कार्यों पर किया जाता है, सभी इनपुट टेक्स्ट के बाद आउटपुट टेक्स्ट के रूप में स्वरूपित होते हैं। एक प्राथमिक कार्य टेक्स्ट पुनर्स्थापना है, जहां इनपुट के कुछ हिस्सों को सेंटिनल टोकन (जैसे <X> और <Y>) से बदल दिया जाता है, और मॉडल को मूल टेक्स्ट का पुनर्निर्माण करना होता है। उदाहरण के लिए, इनपुट "Thank you <X> me to your party <Y> week." से "<X> for inviting <Y>" उत्पन्न होने की उम्मीद की जाएगी, जहां सेंटिनल टोकन लापता स्पैन का संकेत देते हैं। एक अन्य कार्य मशीन अनुवाद है, जहां मॉडल को स्रोत भाषा में टेक्स्ट दिया जाता है और लक्ष्य भाषा में अनुवाद उत्पन्न करना होता है। इसके अतिरिक्त, T5 को व्याकरणिक स्वीकार्यता निर्णय जैसे कार्यों पर प्रशिक्षित किया जाता है, जहां मॉडल को यह निर्धारित करना होता है कि कोई वाक्य भाषाई रूप से अच्छी तरह से निर्मित है या नहीं।

आर्किटेक्चर

T5 श्रृंखला में विभिन्न आकारों के कई मॉडल शामिल हैं, जिनमें से सभी एनकोडर-डिकोडर ट्रांसफॉर्मर हैं। एनकोडर इनपुट टेक्स्ट को संसाधित करता है, और डिकोडर आउटपुट टेक्स्ट उत्पन्न करता है, दोनों घटक सभी प्रकाशित कॉन्फ़िगरेशन में समान संख्या में परतें साझा करते हैं। मूल 2019 पेपर में पांच मॉडल वेरिएंट बताए गए थे: T5-small, T5-base, T5-large, T5-3B, और T5-11B। ये मॉडल परतों की संख्या, ध्यान हेड, एम्बेडिंग आयाम और फीडफॉरवर्ड नेटवर्क आकार में भिन्न हैं, पैरामीटर गिनती लगभग 60 मिलियन (T5-small) से लेकर 11 बिलियन (T5-11B) तक है।

मूल ट्रांसफॉर्मर आर्किटेक्चर की तुलना में, T5 ने कई संशोधन पेश किए: परत सामान्यीकरण अतिरिक्त पूर्वाग्रह के बिना लागू किया जाता है, परत सामान्यीकरण अवशिष्ट पथ के बाहर रखा जाता है, और सापेक्ष स्थितीय एम्बेडिंग का उपयोग किया जाता है। मॉडल 32,000 की शब्दावली आकार के साथ एक साझा WordPiece टोकनाइज़र का भी उपयोग करते हैं, जो अंग्रेजी, जर्मन, फ्रेंच और रोमानियाई टेक्स्ट के मिश्रण पर 10:1:1:1 के अनुपात में प्रशिक्षित होता है।

आर्किटेक्चर विवरण

T5 श्रृंखला पूरी तरह से एनकोडर-डिकोडर ट्रांसफॉर्मर आर्किटेक्चर पर बनी है। इस डिज़ाइन में, एनकोडर इनपुट टेक्स्ट लेता है और छिपे हुए प्रतिनिधित्व का एक अनुक्रम उत्पन्न करता है, जिसे डिकोडर फिर टोकन द्वारा टोकन आउटपुट टेक्स्ट को ऑटोरेग्रेसिव रूप से उत्पन्न करने के लिए उपयोग करता है। प्रत्येक एनकोडर और डिकोडर परत में स्व-ध्यान तंत्र, क्रॉस-अटेंशन (डिकोडर में), और फीडफॉरवर्ड नेटवर्क शामिल हैं। मॉडल सापेक्ष स्थिति एम्बेडिंग के उपयोग और परत सामान्यीकरण में पूर्वाग्रह पद को हटाने के माध्यम से मूल ट्रांसफॉर्मर से खुद को अलग करते हैं।

बड़े वेरिएंट (3B और 11B पैरामीटर) के लिए, मॉडल के आयाम सामान्य संबंध d_model = d_kv * n_heads का पालन नहीं करते हैं, जहां d_model एम्बेडिंग आयाम है, d_kv कुंजी/मान आयाम है, और n_heads ध्यान हेड की संख्या है। यह डिज़ाइन विकल्प मॉडल को स्केल करने में अधिक लचीलापन सक्षम करता है। सभी T5 वेरिएंट एक ही टोकनाइज़र साझा करते हैं, जो एनकोडर और डिकोडर के बीच साझा होता है।

वेरिएंट और बाद के मॉडल

मूल T5 रिलीज़ के बाद, कई वेरिएंट और व्युत्पन्न मॉडल विकसित किए गए, अक्सर गैर-मानकीकृत नामकरण परंपराओं का उपयोग करते हुए। T5 1.1 ने मूल ReLU के बजाय GEGLU सक्रियणों के साथ बेहतर संस्करण पेश किए, और 3B और 11B मॉडल को क्रमशः XL और XXL में नामांतरित किया। इस संस्करण में XL और XXL आकार भी संशोधित किए गए थे।

LM-अनुकूलित T5 मॉडल, 2021 में जारी, मूल T5 चेकपॉइंट्स से प्रारंभ किए गए थे और C4 से 100 बिलियन अतिरिक्त टोकन पर आगे प्रशिक्षित किए गए थे। स्विच ट्रांसफॉर्मर, जिसे 2021 में भी पेश किया गया, ने T5 पर मिश्रण-ऑफ-एक्सपर्ट्स दृष्टिकोण लागू किया, मानक फीडफॉरवर्ड परतों को विशेषज्ञ-आधारित परतों के साथ बदल दिया। T0 मॉडल, 2021 में जारी, LM-अनुकूलित T5 चेकपॉइंट्स से फाइन-ट्यून किए गए थे ताकि शून्य-शॉट सेटिंग में कार्य कर सकें, केवल कार्य निर्देशों का उपयोग करके। ByT5, भी 2021 से, टोकनयुक्त टेक्स्ट के बजाय UTF-8 बाइट्स पर काम करता है और बहुभाषी C4 डेटासेट पर प्रशिक्षित किया गया था।

Flan-T5-XL, 2022 में पेश, FLAN डेटासेट पर T5-XL चेकपॉइंट को निर्देश-ट्यूनिंग करके बनाया गया था। UL2, भी 2022 से, T5 आर्किटेक्चर का उपयोग करता है लेकिन 20 बिलियन पैरामीटर तक स्केल करता है और C4 पर मिश्रण-ऑफ-डेनोइज़र उद्देश्य के साथ प्रशिक्षित है; यह गलती से TPU क्लस्टर पर प्रशिक्षित किया गया था। T5X, 2022 में जारी, JAX में T5 कोडबेस का एक पुनर्निर्माण है, जबकि मूल कार्यान्वयन TensorFlow और MeshTF का उपयोग करता था।

अनुप्रयोग और प्रभाव

T5 मॉडल अपने लचीले टेक्स्ट-टू-टेक्स्ट इंटरफ़ेस के कारण विभिन्न प्राकृतिक भाषा प्रसंस्करण कार्यों के लिए व्यापक रूप से अपनाए गए हैं। उन्हें मशीन अनुवाद, सारांशीकरण, प्रश्न उत्तर, और व्याकरणिक त्रुटि सुधार के अलावा अन्य कार्यों पर लागू किया गया है। एक एकल ढांचे के भीतर कई कार्यों को संभालने की मॉडल की क्षमता ने तैनाती और प्रयोग को सरल बनाया। T5 ने मशीन लर्निंग में बाद के मॉडल परिवारों को भी प्रभावित किया, विशेष रूप से निर्देश-ट्यून मॉडल और मिश्रण-ऑफ-एक्सपर्ट्स आर्किटेक्चर के विकास में। इसका एनकोडर-डिकोडर डिज़ाइन बाद के मॉडलों के डिज़ाइन में प्रभावशाली बना हुआ है, हालांकि कई बाद के बड़े भाषा मॉडल, जैसे कि ओपनएआई और एंथ्रोपिक से, ने केवल-डिकोडर आर्किटेक्चर का समर्थन किया है।

मूल T5 पेपर ने GLUE और SuperGLUE सहित कई बेंचमार्क पर मजबूत प्रदर्शन की सूचना दी, और प्रदर्शित किया कि टेक्स्ट-टू-टेक्स्ट दृष्टिकोण न्यूनतम कार्य-विशिष्ट इंजीनियरिंग के साथ विविध कार्यों में अत्याधुनिक परिणाम प्राप्त कर सकता है। T5 कोडबेस और पूर्व-प्रशिक्षित चेकपॉइंट्स की रिलीज़ ने शैक्षणिक और औद्योगिक दोनों सेटिंग्स में अपनाने की सुविधा प्रदान की।

प्रभाव और विरासत

T5 ने सभी एनएलपी कार्यों को टेक्स्ट-टू-टेक्स्ट समस्याओं के रूप में तैयार करने की अवधारणा को लोकप्रिय बनाने में मदद की, एक विचार जिसने बाद के निर्देश-ट्यून मॉडल और बहु-कार्य सीखने के ढांचे को प्रभावित किया। T5 की रिलीज़ ने ट्रांसफॉर्मर-आधारित भाषा मॉडलों को स्केल करने की व्यापक प्रवृत्ति में भी योगदान दिया, 20 बिलियन पैरामीटर तक पहुंचने वाले वेरिएंट के साथ। C4 डेटासेट और T5 कोडबेस की उपलब्धता ने क्षेत्र में बाद के शोध के लिए एक ठोस संसाधन प्रदान किया। हालांकि नए आर्किटेक्चर उभरे हैं, T5 का आर्किटेक्चर और प्रशिक्षण प्रतिमान मशीन लर्निंग और डीप लर्निंग में चल रहे कार्यों को सूचित करना जारी रखता है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:natural-language-processing·google·transformer·language-model
इस पृष्ठ को अंतिम बार संपादित किया गया 8 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास