T5 (Text-to-Text Transfer Transformer) बड़े भाषा मॉडलों की एक श्रृंखला है जिसे Google AI द्वारा विकसित किया गया था और 2019 में पेश किया गया था। ये मॉडल ट्रांसफॉर्मर आर्किटेक्चर पर आधारित हैं, विशेष रूप से एक एनकोडर-डिकोडर डिज़ाइन पर, जहां एनकोडर इनपुट टेक्स्ट को संसाधित करता है और डिकोडर आउटपुट टेक्स्ट उत्पन्न करता है। T5 की प्रमुख नवीनता इसका एकीकृत टेक्स्ट-टू-टेक्स्ट ढांचा है, जो हर प्राकृतिक भाषा प्रसंस्करण कार्य - अनुवाद से लेकर सारांशीकरण और प्रश्न उत्तरण तक - को एक टेक्स्ट-टू-टेक्स्ट समस्या के रूप में मानता है, जहां इनपुट और आउटपुट दोनों हमेशा टेक्स्ट स्ट्रिंग होते हैं।
मूल T5 पेपर, "एक्सप्लोरिंग द लिमिट्स ऑफ ट्रांसफर लर्निंग विद अ यूनिफाइड टेक्स्ट-टू-टेक्स्ट ट्रांसफॉर्मर," ने प्रदर्शित किया कि एक एकल मॉडल आर्किटेक्चर एक विशाल कोरपस पर प्रीट्रेनिंग करके और फिर विशिष्ट कार्यों के लिए फाइन-ट्यूनिंग करके कई NLP बेंचमार्कों पर अत्याधुनिक परिणाम प्राप्त कर सकता है। इस दृष्टिकोण ने बड़े भाषा मॉडल अनुसंधान में बाद के विकास को प्रभावित किया और जनरेटिव एआई के व्यापक क्षेत्र में योगदान दिया।
प्रशिक्षण
मूल T5 मॉडल को कोलोसल क्लीन क्रॉल्ड कोरपस (C4) पर प्रीट्रेन किया गया था, जो इंटरनेट से स्क्रैप किया गया टेक्स्ट और कोड युक्त एक डेटासेट है। इस प्रीट्रेनिंग प्रक्रिया ने मॉडलों को सामान्य भाषा समझ और उत्पादन क्षमताएं सीखने में सक्षम बनाया। प्रीट्रेनिंग के बाद, T5 मॉडल को विशिष्ट डाउनस्ट्रीम कार्यों पर फाइन-ट्यून किया जा सकता था, विभिन्न अनुप्रयोगों में अच्छा प्रदर्शन करने के लिए अपने ज्ञान को अनुकूलित करते हुए।
प्रीट्रेनिंग ने एक डीनॉइज़िंग उद्देश्य का उपयोग किया जहां मॉडल ने क्षतिग्रस्त टेक्स्ट को पुनर्निर्माण करना सीखा। उदाहरण के लिए, इनपुट "Thank you <X> me to your party <Y> week" दिए जाने पर, मॉडल को आउटपुट "<X> for inviting <Y> last <Z>" उत्पन्न करने के लिए प्रशिक्षित किया गया था, जहां <X> और <Y> भरे जाने वाले रिक्त स्थानों को दर्शाते हैं (मूल रिपोर्ट में "सेंटिनल" कहा जाता है) और <Z> आउटपुट के अंत को चिह्नित करता है। मॉडलों को अनुवाद (जैसे, "translate English to German: That is good." -> "Das ist gut.") और व्याकरणिक स्वीकार्यता निर्णय (जैसे, "The course is jumping well." -> "not acceptable") जैसे कार्यों पर भी प्रीट्रेन किया गया था।
आर्किटेक्चर
T5 श्रृंखला में विभिन्न आकारों के कई मॉडल शामिल हैं, सभी एनकोडर-डिकोडर ट्रांसफॉर्मर आर्किटेक्चर का उपयोग करते हैं। मूल पेपर ने पैरामीटर गणना द्वारा प्रतिष्ठित पांच मॉडल वेरिएंट की सूचना दी: T5-small, T5-base, T5-large, T5-3B, और T5-11B। एनकोडर और डिकोडर में हमेशा समान संख्या में परतें होती हैं; उदाहरण के लिए, T5-small में एनकोडर और डिकोडर दोनों में 6 परतें हैं।
प्रमुख आर्किटेक्चरल पैरामीटर में परतों की संख्या (n_layer), ध्यान हेड्स की संख्या (n_head), एम्बेडिंग वेक्टरों का आयाम (d_model), फीडफॉरवर्ड नेटवर्क का आयाम (d_ff), और कुंजी/मान वेक्टरों का आयाम (d_kv) शामिल हैं। विशिष्ट ट्रांसफॉर्मर के विपरीत, 3B और 11B मॉडल d_model = d_kv × n_head संबंध को संतुष्ट नहीं करते हैं।
मूल ट्रांसफॉर्मर की तुलना में, T5 ने कई मामूली संशोधन पेश किए: बिना योगात्मक पूर्वाग्रह के लेयर नॉर्मलाइज़ेशन, अवशिष्ट पथ के बाहर लेयर नॉर्मलाइज़ेशन रखना, और सापेक्ष स्थितीय एम्बेडिंग का उपयोग करना। सभी प्रयोगों ने शब्दावली आकार 32,000 के साथ एक WordPiece टोकनाइज़र का उपयोग किया, जो इनपुट और आउटपुट में साझा था, और C4 से अंग्रेजी, जर्मन, फ्रेंच और रोमानियाई डेटा के मिश्रण पर 10:1:1:1 के अनुपात में प्रशिक्षित किया गया था।
वेरिएंट
कई बाद के मॉडलों ने T5 आर्किटेक्चर का उपयोग किया, जिनमें गैर-मानकीकृत नामकरण परंपराएं थीं। उल्लेखनीय वेरिएंट में शामिल हैं:
- T5 1.1 (small, base, large, XL, XXL): लगभग समान पैरामीटरों के साथ बेहतर संस्करण, ReLU के बजाय GEGLU सक्रियण का उपयोग करते हुए, और 3B/11B का नाम बदलकर XL/XXL किया गया जिसमें आकार बदले गए।
- LM-adapted T5 (2021): T5 चेकपॉइंट्स से शुरू होकर C4 से अतिरिक्त 100B टोकन पर आगे प्रशिक्षित।
- Switch Transformer (2021): एक मिश्रण-ऑफ-एक्सपर्ट्स वेरिएंट जो फीडफॉरवर्ड परतों को मिश्रण-ऑफ-एक्सपर्ट परतों से बदलता है।
- T0 (2021): LM-adapted T5 चेकपॉइंट्स से शुरू होकर शून्य-शॉट कार्य निर्देश अनुसरण के लिए प्रशिक्षित।
- ByT5 (2021): एक बाइट-स्तरीय संस्करण जो टोकनाइज़र के बिना UTF-8 बाइट्स पर काम करता है, बहुभाषी C4 पर प्रशिक्षित।
- Flan-T5-XL (2022): T5 XL से शुरू होकर FLAN डेटासेट पर निर्देश-ट्यून किया गया।
- T5X (2022): मूल TensorFlow कोडबेस का JAX-आधारित पुनः कार्यान्वयन।
- UL2 20B (2022): "मिश्रण ऑफ डीनॉइज़र्स" उद्देश्य के साथ 20B पैरामीटरों तक स्केल किया गया, C4 पर प्रशिक्षित।
- Flan-UL2 20B (2022): UL2 20B को FLAN पर निर्देश-फाइन-ट्यून किया गया।
- Pile-T5 (2024): समान आर्किटेक्चर लेकिन Llama टोकनाइज़र का उपयोग करते हुए, The Pile पर प्रशिक्षित।
अनुप्रयोग
T5 मॉडल विभिन्न अनुप्रयोगों में उपयोग किए गए हैं, जिनमें चैटबॉट, मशीन अनुवाद प्रणाली, टेक्स्ट सारांशीकरण उपकरण, कोड जनरेशन और रोबोटिक्स शामिल हैं। एनकोडर-डिकोडर डिज़ाइन निर्देश अनुसरण की अनुमति देता है: एनकोडर निर्देश को संसाधित करता है और डिकोडर उत्तर को ऑटोरेग्रेसिव रूप से उत्पन्न करता है।
T5 एनकोडर एक टेक्स्ट एनकोडर के रूप में भी काम कर सकता है, जो BERT के समान है, डाउनस्ट्रीम अनुप्रयोगों के लिए वास्तविक-संख्या वेक्टर अनुक्रम उत्पन्न करता है। उदाहरण के लिए, Google Imagen एक डिफ्यूज़न मॉडल को कंडीशन करने के लिए T5-XXL को टेक्स्ट एनकोडर के रूप में उपयोग करता है, और AuraFlow डिफ्यूज़न मॉडल Pile-T5-XL का उपयोग करता है। ये अनुप्रयोग पारंपरिक NLP कार्यों से परे T5 की बहुमुखी प्रतिभा को प्रदर्शित करते हैं, जो मशीन लर्निंग और डीप लर्निंग में प्रगति में योगदान करते हैं।