MPT (MosaicML Pretrained Transformer) ओपन-सोर्स बड़े भाषा मॉडल का एक परिवार है, जिसे MosaicML द्वारा विकसित किया गया था, जो बाद में Databricks द्वारा अधिग्रहित कंपनी है। मॉडलों को व्यावसायिक रूप से उपयोग योग्य बनाने के लिए डिज़ाइन किया गया है, जिसका अर्थ है कि उन्हें अनुमेय लाइसेंसों के तहत जारी किया गया है जो व्यवसाय और अनुसंधान संदर्भों में व्यापक अनुप्रयोग की अनुमति देते हैं। MPT मॉडल Transformer (architecture) आर्किटेक्चर पर आधारित हैं और अपने कुशल प्रशिक्षण विधियों और लंबे संदर्भ विंडो के लिए उल्लेखनीय हैं, जो उन्हें OpenAI या Google DeepMind जैसे संगठनों के स्वामित्व वाले मॉडलों का एक व्यावहारिक विकल्प बनाता है।
पहला MPT मॉडल, MPT-7B, मई 2023 में जारी किया गया था, जिसके बाद जून 2023 में MPT-30B आया। इन मॉडलों को MosaicML प्लेटफ़ॉर्म का उपयोग करके प्रशिक्षित किया गया था, जो Gradient Clipping और Layer Normalization जैसी अनुकूलित प्रशिक्षण तकनीकों का लाभ उठाता है ताकि कम कम्प्यूटेशनल संसाधनों के साथ उच्च प्रदर्शन प्राप्त किया जा सके। MPT मॉडलों को Generative AI पारिस्थितिकी तंत्र में व्यापक रूप से अपनाया गया है, विशेष रूप से पाठ निर्माण, सारांशीकरण और कोड पूर्णता जैसे कार्यों के लिए।
आर्किटेक्चर और प्रशिक्षण
MPT मॉडल अन्य आधुनिक LLM के समान डिकोडर-केवल ट्रांसफॉर्मर आर्किचेक्चर का उपयोग करते हैं। हालाँकि, वे दक्षता और क्षमता में सुधार के लिए कई नवाचारों को शामिल करते हैं। विशेष रूप से, MPT मॉडल लंबे अनुक्रमों के समर्थन के साथ Multi-Head Attention का उपयोग करते हैं, जो ALiBi (Attention with Linear Biases) जैसी तकनीकों के माध्यम से प्राप्त किया जाता है, जो मॉडल को प्रशिक्षण के दौरान देखे गए संदर्भों से अधिक लंबे संदर्भों में एक्सट्रपलेट करने की अनुमति देता है। यह पारंपरिक Positional Encoding विधियों से एक विचलन है, जो MPT-7B को कुछ कॉन्फ़िगरेशन में 84,000 टोकन तक संभालने में सक्षम बनाता है।
प्रशिक्षण सार्वजनिक रूप से उपलब्ध पाठ और कोड के बड़े डेटासेट पर आयोजित किया गया था, जिसमें डेटा गुणवत्ता और विविधता पर ध्यान केंद्रित किया गया था। MosaicML ने बताया कि MPT-7B को 1 ट्रिलियन टोकन पर प्रशिक्षित किया गया था, जबकि MPT-30B को 1.2 ट्रिलियन टोकन पर प्रशिक्षित किया गया था। प्रशिक्षण प्रक्रिया में Adam (Optimizer) का उपयोग Learning Rate Scheduling के साथ किया गया, जिसमें वार्मअप और कोसाइन डिके शामिल थे। इसके अतिरिक्त, Weight Initialization को बड़े पैमाने पर प्रशिक्षण को स्थिर करने के लिए सावधानीपूर्वक ट्यून किया गया था।
व्यावसायिक उपयोगिता और लाइसेंसिंग
MPT मॉडलों का एक प्रमुख अंतर उनका लाइसेंसिंग है। MPT-7B को Apache 2.0 लाइसेंस के तहत जारी किया गया है, जो प्रतिबंधों के बिना उपयोग, संशोधन और वितरण की अनुमति देता है, जिसमें व्यावसायिक उद्देश्य शामिल हैं। MPT-30B को एक कस्टम लाइसेंस के तहत जारी किया गया है जो व्यावसायिक रूप से भी अनुमेय है, हालाँकि इसमें अन्य बड़े भाषा मॉडलों को बेहतर बनाने के लिए मॉडल का उपयोग करने पर प्रतिबंध शामिल है। यह लाइसेंसिंग रणनीति अपनाने को प्रोत्साहित करने के लिए डिज़ाइन की गई थी, जबकि MosaicML के प्रतिस्पर्धी हितों की रक्षा की जा सके।
MPT मॉडलों की व्यावसायिक उपयोगिता ने उन्हें स्टार्टअप्स और उद्यमों के लिए आकर्षक बना दिया, जो बंद मॉडलों से जुड़ी API लागत और डेटा गोपनीयता चिंताओं से बचना चाहते थे। कंपनियाँ MPT मॉडलों को अपने स्वयं के बुनियादी ढांचे पर तैनात कर सकती थीं, जैसे Amazon Web Services, Microsoft Azure, या Google Cloud जैसी क्लाउड सेवाओं का उपयोग करके, या AWS Trainium या Groq एक्सेलेरेटर जैसे विशेष हार्डवेयर पर।
प्रदर्शन और बेंचमार्क
MPT मॉडलों ने मानक बेंचमार्क पर प्रतिस्पर्धी प्रदर्शन प्रदर्शित किया है। उदाहरण के लिए, MPT-7B ने MMLU (Massive Multitask Language Understanding) और HellaSwag जैसे कार्यों पर मजबूत परिणाम प्राप्त किए, जो अक्सर रिलीज़ के समय समान आकार के अन्य ओपन-सोर्स मॉडलों से बेहतर प्रदर्शन करते थे। MPT-30B ने इन स्कोरों में और सुधार किया, कुछ डोमेन में बड़े स्वामित्व वाले मॉडलों के प्रदर्शन के करीब पहुँच गया।
कोड निर्माण कार्यों में, MPT मॉडलों ने HumanEval जैसे बेंचमार्क पर अच्छा प्रदर्शन किया, जो कोड-भारी डेटासेट पर उनके प्रशिक्षण के कारण था। मॉडलों ने निर्देश अनुसरण में भी मजबूत क्षमताएँ दिखाईं, विशेष रूप से Reinforcement Learning from AI Feedback (RLAIF) (Reinforcement Learning from AI Feedback) जैसी तकनीकों के साथ फाइन-ट्यूनिंग या क्यूरेटेड निर्देश डेटासेट पर पर्यवेक्षित फाइन-ट्यूनिंग के बाद।
पारिस्थितिकी तंत्र और प्रभाव
MPT मॉडल कई व्युत्पन्न कार्यों के लिए एक आधार बन गए। डेवलपर्स ने विशिष्ट कार्यों के लिए फाइन-ट्यून किए गए वेरिएंट बनाए, जैसे चैट, सारांशीकरण और डोमेन-विशिष्ट अनुप्रयोग। मॉडलों को Hugging Face जैसे प्लेटफ़ॉर्म में एकीकृत किया गया, जिससे प्रयोग और तैनाती के लिए उन्हें आसानी से सुलभ बनाया गया।
MPT की रिलीज़ ने ओपन-सोर्स LLM के व्यापक चलन में योगदान दिया, जो स्वामित्व वाले प्रभुत्व को चुनौती दे रहे हैं। इसने प्रदर्शित किया कि कुशल प्रशिक्षण तकनीकें तकनीकी दिग्गजों के विशाल बजट के बिना उच्च-गुणवत्ता वाले मॉडल उत्पन्न कर सकती हैं। MPT ने बाद के मॉडल विकासों को भी प्रभावित किया, जैसे Llama श्रृंखला, प्रशिक्षण दक्षता और लंबी-संदर्भ क्षमताओं के महत्व को उजागर करके।
सीमाएँ और भविष्य की दिशाएँ
अपनी ताकत के बावजूद, MPT मॉडलों में सीमाएँ हैं। वे अपने प्रशिक्षण डेटा में मौजूद पूर्वाग्रहों को प्रदर्शित कर सकते हैं, और उनकी तथ्यात्मक सटीकता हमेशा विश्वसनीय नहीं होती है, जो सभी LLM में एक सामान्य समस्या है। मॉडलों को अनुमान के लिए महत्वपूर्ण कम्प्यूटेशनल संसाधनों की भी आवश्यकता होती है, हालाँकि क्वांटाइज़ेशन और अन्य अनुकूलन तकनीकें इसे कम कर सकती हैं।
2023 में MosaicML के Databricks द्वारा अधिग्रहण के बाद, MPT लाइन का विकास अंततः DBRX जैसे अन्य मॉडलों द्वारा प्रतिस्थापित किया गया, जिसमें MPT से सीखे गए पाठ शामिल थे। हालाँकि, MPT ओपन-सोर्स AI के इतिहास में एक महत्वपूर्ण मील का पत्थर बना हुआ है, यह दर्शाता है कि व्यावसायिक रूप से व्यवहार्य LLM खुले तौर पर बनाए और साझा किए जा सकते हैं।
यह भी देखें
संदर्भ
MosaicML तकनीकी रिपोर्ट और ब्लॉग पोस्ट (2023)।
बाहरी लिंक
(कोई बाहरी लिंक प्रदान नहीं किया गया है।)