टेक्स्ट-टू-टेक्स्ट फ्रेमवर्क प्राकृतिक भाषा प्रसंस्करण में एक पद्धति है जो सभी कार्यों को एक समान प्रारूप में पुनर्गठित करती है: एक इनपुट टेक्स्ट दिए जाने पर, मॉडल एक आउटपुट टेक्स्ट उत्पन्न करता है। यह दृष्टिकोण T5 (टेक्स्ट-टू-टेक्स्ट ट्रांसफर ट्रांसफॉर्मर) मॉडल द्वारा लोकप्रिय बनाया गया था, जिसे गूगल एआई द्वारा 2019 में पेश किया गया था। अनुवाद, सारांशीकरण और प्रश्न उत्तर जैसे कार्यों को एक एकल टेक्स्ट-टू-टेक्स्ट प्रतिमान में एकीकृत करके, यह फ्रेमवर्क मॉडल डिज़ाइन को सरल बनाता है और विविध कार्यों में ट्रांसफर लर्निंग को सक्षम बनाता है।
T5 मॉडल एनकोडर-डिकोडर ट्रांसफॉर्मर आर्किटेक्चर हैं, जहां एनकोडर इनपुट टेक्स्ट को संसाधित करता है और डिकोडर आउटपुट टेक्स्ट उत्पन्न करता है। यह डिज़ाइन मूल ट्रांसफॉर्मर मॉडल का अनुसरण करता है लेकिन सापेक्ष स्थितीय एम्बेडिंग और अवशिष्ट पथ के बाहर रखी गई लेयर नॉर्मलाइज़ेशन जैसे संशोधनों को शामिल करता है। फ्रेमवर्क की लचीलापन इसे व्याकरण संबंधी त्रुटि सुधार से लेकर कोड जनरेशन तक कई प्रकार के कार्यों को संभालने की अनुमति देती है।
प्रशिक्षण
मूल T5 मॉडल को कोलोसल क्लीन क्रॉल्ड कॉर्पस (C4) पर पूर्व-प्रशिक्षित किया गया था, जो इंटरनेट से स्क्रैप किए गए टेक्स्ट और कोड का एक विशाल डेटासेट है। पूर्व-प्रशिक्षण में एक डीनॉइज़िंग उद्देश्य शामिल था जहां मॉडल ने क्षतिग्रस्त टेक्स्ट का पुनर्निर्माण करना सीखा, लापता स्पैन को चिह्नित करने के लिए सेंटिनल टोकन का उपयोग करते हुए। उदाहरण के लिए, "Thank you <X> me to your party <Y> week." दिए जाने पर, मॉडल "<X> for inviting <Y> last <Z>" आउटपुट करना सीखता है, जहां <Z> आउटपुट के अंत को इंगित करता है।
पूर्व-प्रशिक्षण के बाद, T5 मॉडल को विशिष्ट डाउनस्ट्रीम कार्यों पर फाइन-ट्यून किया जा सकता है। फाइन-ट्यूनिंग मॉडल की सामान्य भाषा समझ को चैटबॉट, मशीन अनुवाद और टेक्स्ट सारांशीकरण जैसे अनुप्रयोगों में अच्छा प्रदर्शन करने के लिए अनुकूलित करती है। फ्रेमवर्क का एकीकृत प्रारूप यह सुनिश्चित करता है कि फाइन-ट्यूनिंग डेटा भी इनपुट-आउटपुट टेक्स्ट जोड़े के रूप में संरचित है, जिससे इसे नए कार्यों पर लागू करना सीधा हो जाता है।
आर्किटेक्चर
T5 श्रृंखला में विभिन्न आकारों के मॉडल शामिल हैं, सभी एनकोडर-डिकोडर संरचना साझा करते हैं। मूल पेपर ने पांच कॉन्फ़िगरेशन की सूचना दी: छोटा (60M पैरामीटर), बेस (220M), बड़ा (770M), 3B, और 11B। प्रत्येक मॉडल में एनकोडर और डिकोडर में समान संख्या में लेयर होते हैं; उदाहरण के लिए, T5-छोटा में प्रत्येक में 6 लेयर हैं। प्रमुख आर्किटेक्चरल आयामों में अटेंशन हेड्स की संख्या, एम्बेडिंग आयाम, फीडफॉरवर्ड नेटवर्क आकार और की/वैल्यू आयाम शामिल हैं। विशेष रूप से, 3B और 11B मॉडल उस विशिष्ट संबंध से विचलित होते हैं जहां एम्बेडिंग आयाम की/वैल्यू आयाम और हेड्स की संख्या के गुणनफल के बराबर होता है।
मूल ट्रांसफॉर्मर की तुलना में, T5 बिना एडिटिव बायस के लेयर नॉर्मलाइज़ेशन का उपयोग करता है, नॉर्मलाइज़ेशन को अवशिष्ट पथ के बाहर रखता है, और सापेक्ष स्थितीय एम्बेडिंग का उपयोग करता है। 32,000 की शब्दावली आकार वाला एक वर्डपीस टोकनाइज़र इनपुट और आउटपुट में साझा किया जाता है, जिसे C4 से अंग्रेजी, जर्मन, फ्रेंच और रोमानियाई डेटा के मिश्रण पर प्रशिक्षित किया जाता है।
वेरिएंट
कई बाद के मॉडल T5 आर्किटेक्चर पर आधारित थे, अक्सर गैर-मानकीकृत नामकरण के साथ। मूल मॉडल (2019) के बाद T5 1.1 (GEGLU सक्रियण और बड़े आकारों के लिए XL/XXL नामकरण के साथ बेहतर संस्करण) आए। LM-अनुकूलित T5 (2021) ने अतिरिक्त C4 टोकन पर प्रशिक्षण जारी रखा। स्विच ट्रांसफॉर्मर (2021) ने मिश्रण-ऑफ-एक्सपर्ट्स वेरिएंट पेश किया। T0 (2021) ने शून्य-शॉट निर्देश अनुसरण पर ध्यान केंद्रित किया। ByT5 (2021) ने टोकनाइज़र के बिना बाइट-स्तरीय टेक्स्ट पर काम किया। Flan-T5 (2022) ने निर्देश ट्यूनिंग जोड़ी। UL2 20B (2022) ने 20B पैरामीटर तक स्केल किया और डीनॉइज़र उद्देश्यों के मिश्रण का उपयोग किया। Pile-T5 (2024) ने लामा टोकनाइज़र का उपयोग किया और द पाइल पर प्रशिक्षित किया गया।
अनुप्रयोग
T5 फ्रेमवर्क का एनकोडर-डिकोडर डिज़ाइन निर्देश अनुसरण को सक्षम बनाता है: एनकोडर निर्देश को संसाधित करता है, और डिकोडर ऑटोरेग्रेसिव रूप से प्रतिक्रिया उत्पन्न करता है। T5 एनकोडर अन्य मॉडलों के लिए टेक्स्ट एनकोडर के रूप में भी काम कर सकता है, कंडीशनिंग के लिए वेक्टर प्रतिनिधित्व उत्पन्न करता है। उदाहरण के लिए, गूगल इमेजेन T5-XXL को अपने टेक्स्ट एनकोडर के रूप में उपयोग करता है, और AuraFlow Pile-T5-XL का उपयोग करता है। ये अनुप्रयोग पारंपरिक NLP कार्यों से परे फ्रेमवर्क की बहुमुखी प्रतिभा को प्रदर्शित करते हैं।
टेक्स्ट-टू-टेक्स्ट प्रतिमान ने बाद के बड़े भाषा मॉडल विकास को प्रभावित किया है, जो ट्रांसफर लर्निंग और मल्टी-टास्क प्रशिक्षण के लिए एकीकृत इनपुट-आउटपुट प्रारूप के लाभों पर जोर देता है।