अंग्रेज़ी से अनुवादित

T5 (टेक्स्ट-टू-टेक्स्ट ट्रांसफर ट्रांसफॉर्मर) एन्कोडर-डिकोडर बड़े भाषा मॉडलों की एक श्रृंखला है, जिसे 2019 में Google AI द्वारा पेश किया गया था, C4 डेटासेट पर प्रीट्रेन किया गया था और विभिन्न पाठ-आधारित कार्यों के लिए अनुकूलनीय है।

T5 (Text-to-Text Transfer Transformer) बड़े भाषा मॉडलों की एक श्रृंखला है जिसे Google AI द्वारा विकसित किया गया था और 2019 में पेश किया गया था। मूल Transformer (architecture) मॉडल की तरह, T5 मॉडल Encoder-Decoder Architecture ट्रांसफॉर्मर हैं, जहाँ एनकोडर इनपुट टेक्स्ट को संसाधित करता है और डिकोडर आउटपुट टेक्स्ट उत्पन्न करता है। T5 मॉडल आमतौर पर टेक्स्ट और कोड के एक विशाल डेटासेट पर पूर्व-प्रशिक्षित होते हैं, जिसके बाद वे अपने पूर्व-प्रशिक्षण उद्देश्यों के समान टेक्स्ट-आधारित कार्य कर सकते हैं, और अन्य कार्यों के लिए फाइन-ट्यून किए जा सकते हैं। इन्हें चैटबॉट, मशीन अनुवाद, टेक्स्ट सारांशीकरण, कोड जनरेशन और रोबोटिक्स में लागू किया गया है।

प्रशिक्षण

मूल T5 मॉडलों को Colossal Clean Crawled Corpus (C4) पर पूर्व-प्रशिक्षित किया गया था, जिसमें इंटरनेट से स्क्रैप किया गया टेक्स्ट और कोड शामिल है। यह पूर्व-प्रशिक्षण मॉडलों को सामान्य भाषा समझ और जनरेशन सीखने में सक्षम बनाता है। T5 मॉडलों को फिर डाउनस्ट्रीम कार्यों पर फाइन-ट्यून किया जा सकता है। पूर्व-प्रशिक्षण में टेक्स्ट-टू-टेक्स्ट प्रारूप का उपयोग किया गया था, जहाँ प्रत्येक कार्य को <इनपुट टेक्स्ट> -> <आउटपुट टेक्स्ट> के रूप में तैयार किया जाता है। उदाहरणों में क्षतिग्रस्त टेक्स्ट को पुनर्स्थापित करना (जैसे, सेंटिनल द्वारा चिह्नित रिक्त स्थानों को भरना), अनुवाद (जैसे, अंग्रेज़ी से जर्मन), और व्याकरणिक स्वीकार्यता निर्णय (जैसे, CoLA वाक्य वर्गीकरण) शामिल हैं।

वास्तुकला

T5 श्रृंखला में विभिन्न आकारों के मॉडल शामिल हैं, सभी एनकोडर-डिकोडर ट्रांसफॉर्मर हैं। मूल पेपर में पाँच मॉडल बताए गए थे: T5-small (60M पैरामीटर), T5-base (220M), T5-large (770M), T5-3B (3B), और T5-11B (11B)। प्रत्येक मॉडल में एनकोडर और डिकोडर में समान संख्या में परतें होती हैं; उदाहरण के लिए, T5-small में प्रत्येक में 6 परतें हैं। प्रमुख वास्तुकला आयामों में परतों की संख्या, अटेंशन हेड्स, एम्बेडिंग आयाम, फीडफॉरवर्ड आयाम, और कुंजी/मान आयाम शामिल हैं। विशिष्ट ट्रांसफॉर्मर के विपरीत, 3B और 11B मॉडल d_model = d_kv * n_head संबंध को संतुष्ट नहीं करते हैं। मूल ट्रांसफॉर्मर की तुलना में, T5 बिना योगात्मक पूर्वाग्रह के लेयर नॉर्मलाइज़ेशन का उपयोग करता है, लेयर नॉर्मलाइज़ेशन को अवशिष्ट पथ के बाहर रखता है, और सापेक्ष स्थितीय एम्बेडिंग का उपयोग करता है। 32,000 की शब्दावली आकार वाला एक WordPiece टोकनाइज़र उपयोग किया गया था, जो इनपुट और आउटपुट में साझा किया गया था, और C4 से अंग्रेज़ी, जर्मन, फ्रेंच और रोमानियाई डेटा के मिश्रण पर 10:1:1:1 अनुपात में प्रशिक्षित किया गया था।

वेरिएंट

कई बाद के मॉडलों ने T5 वास्तुकला का उपयोग किया। उल्लेखनीय वेरिएंट में शामिल हैं:

  • T5 1.1 (2019-2020): ReLU के बजाय GEGLU सक्रियण के साथ बेहतर संस्करण; 3B और 11B को बदलकर XL और XXL नाम दिया गया और आकार संशोधित किए गए।
  • LM-adapted T5 (2021): T5 चेकपॉइंट से शुरू करके C4 से अतिरिक्त 100B टोकन पर आगे प्रशिक्षित किया गया।
  • Switch Transformer (2021): फीडफॉरवर्ड परतों को विशेषज्ञ परतों से बदलने वाला एक मिश्रण-विशेषज्ञ वेरिएंट।
  • T0 (2021): LM-adapted T5 से शुरू करके निर्देशों के आधार पर शून्य-शॉट कार्य करने के लिए प्रशिक्षित किया गया।
  • ByT5 (2021): टोकनाइज़र के बिना UTF-8 बाइट्स पर काम करने वाला बाइट-स्तरीय संस्करण, बहुभाषी C4 पर प्रशिक्षित।
  • Flan-T5-XL (2022): T5 XL से शुरू करके FLAN डेटासेट पर निर्देश-ट्यून किया गया।
  • T5X (2022): मूल T5 कोडबेस का JAX-आधारित पुनःकार्यान्वयन (मॉडल नहीं)।
  • UL2 20B (2022): 20B पैरामीटर तक स्केल किया गया, C4 पर डिनॉइज़र उद्देश्यों के मिश्रण के साथ प्रशिक्षित; विशेष रूप से TPU क्लस्टर पर एक महीने के लिए गलती से प्रशिक्षित किया गया।
  • Flan-UL2 20B (2022): FLAN पर निर्देश-फाइन-ट्यून किया गया UL2 20B।
  • Pile-T5 (2024): समान वास्तुकला लेकिन Llama टोकनाइज़र का उपयोग करता है और The Pile पर प्रशिक्षित, base, large, XL, और XXL आकारों में उपलब्ध।

अनुप्रयोग

T5 की एनकोडर-डिकोडर संरचना निर्देश अनुसरण की अनुमति देती है: एनकोडर निर्देश को एनकोड करता है, और डिकोडर उत्तर को ऑटोरेग्रेसिव रूप से उत्पन्न करता है। T5 एनकोडर एक टेक्स्ट एनकोडर के रूप में भी काम कर सकता है, जैसे BERT, डाउनस्ट्रीम कार्यों के लिए वेक्टर प्रतिनिधित्व उत्पन्न करता है। उदाहरण के लिए, Google Imagen अपने टेक्स्ट एनकोडर के रूप में T5-XXL का उपयोग करता है, और AuraFlow डिफ्यूज़न मॉडल Pile-T5-XL का उपयोग करता है। ये अनुप्रयोग जनरेटिव AI और उससे परे T5 की बहुमुखी प्रतिभा को प्रदर्शित करते हैं।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:large-language-model·transformer·google-deepmind·natural-language-processing
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास