Mixtral 8x7B एक स्पार्स मिक्सचर-ऑफ-एक्सपर्ट्स (MoE) Large language model है, जिसे Mistral AI द्वारा दिसंबर 2023 में जारी किया गया था। यह एक डिकोडर-ओनली Transformer (architecture) आर्किटेक्चर का उपयोग करता है, जिसमें कुल 46.7 बिलियन पैरामीटर हैं, लेकिन प्रति इनपुट टोकन केवल 12.9 बिलियन पैरामीटर सक्रिय होते हैं, एक रूटिंग तंत्र के माध्यम से जो प्रत्येक परत में आठ फीडफॉरवर्ड मॉड्यूल से दो विशेषज्ञों का चयन करता है। यह डिज़ाइन मॉडल को बहुत बड़े डेंस मॉडल के बराबर या उससे बेहतर प्रदर्शन प्राप्त करने की अनुमति देता है, जबकि अनुमान लागत कम रखता है। रिलीज़ में एक बेस मॉडल और एक फाइन-ट्यून्ड इंस्ट्रक्शन-फॉलोइंग वेरिएंट, Mixtral 8x7B Instruct शामिल था, जिसके वेट्स को Apache 2.0 लाइसेंस के तहत सार्वजनिक रूप से उपलब्ध कराया गया था।
मॉडल की घोषणा 11 दिसंबर, 2023 को एक ब्लॉग पोस्ट और एक टोरेंट लिंक के माध्यम से की गई थी, जो ओपन-वेट Generative AI परिदृश्य में एक महत्वपूर्ण मील का पत्थर साबित हुआ। इसे Mistral AI द्वारा विकसित किया गया था, जो OpenAI और Google DeepMind के पूर्व शोधकर्ताओं द्वारा 2023 में स्थापित एक पेरिस-आधारित स्टार्टअप है। रिलीज़ ने Mixtral 8x7B को OpenAI के GPT-3.5 और Anthropic के Claude 2 जैसे मालिकाना मॉडलों के प्रत्यक्ष प्रतियोगी के रूप में स्थापित किया, साथ ही Meta और अन्य प्रयोगशालाओं के ओपन मॉडलों के प्रभुत्व को चुनौती दी। इसकी मिक्सचर-ऑफ-एक्सपर्ट्स आर्किटेक्चर ने कंडीशनल कम्प्यूटेशन में पहले के शोध पर आधारित था, जिसमें Nokia Bell Labs और Google DeepMind का काम शामिल था, लेकिन इसे ओपन-सोर्स रिलीज़ में पहले कभी न देखे गए पैमाने पर लागू किया गया।
आर्किटेक्चर और डिज़ाइन
Mixtral 8x7B ट्रांसफॉर्मर में प्रत्येक मानक फीडफॉरवर्ड नेटवर्क के स्थान पर एक स्पार्स MoE परत का उपयोग करता है। प्रत्येक परत में आठ विशेषज्ञ नेटवर्क होते हैं, और एक गेटिंग नेटवर्क (अक्सर सीखे गए लॉजिट्स पर सॉफ्टमैक्स) प्रत्येक टोकन को शीर्ष दो विशेषज्ञों की ओर रूट करता है। यह स्पार्स सक्रियण प्रति टोकन कम्प्यूटेशनल लागत को लगभग 12.9 बिलियन पैरामीटर वाले डेंस मॉडल के बराबर कम कर देता है, जबकि कुल पैरामीटर गिनती 46.7 बिलियन होने से बड़ी ज्ञान क्षमता की अनुमति मिलती है। मॉडल 32,768 टोकन का कॉन्टेक्स्ट विंडो उपयोग करता है और अंग्रेजी, फ्रेंच, जर्मन, स्पेनिश और इतालवी सहित कई भाषाओं का समर्थन करता है।
रूटिंग तंत्र को बिना सहायक लोड-बैलेंसिंग नुकसान के एंड-टू-एंड प्रशिक्षित किया जाता है, जो विशेषज्ञों के बीच टोकन वितरण के लिए प्राकृतिक विभेदन पर निर्भर करता है। यह पहले के MoE सिस्टम के विपरीत है, जिन्हें स्पष्ट बैलेंसिंग बाधाओं की आवश्यकता थी। मॉडल में Multi-Head Attention को ग्रुप्ड-क्वेरी अटेंशन के साथ भी शामिल किया गया है, जो अनुमान के दौरान की-वैल्यू कैश मेमोरी उपयोग को कम करता है। आर्किटेक्चर 2017 में पेश किए गए Transformer (architecture) ढांचे पर आधारित है, जिसमें स्पार्स कम्प्यूटेशन और कुशल स्केलिंग के लिए संशोधन किए गए हैं।
प्रशिक्षण और डेटा
प्रशिक्षण विवरण आंशिक रूप से रिलीज़ घोषणा में साझा किए गए थे। Mixtral 8x7B को सार्वजनिक रूप से उपलब्ध वेब कॉर्पोरा से प्राप्त डेटा पर प्रीट्रेन किया गया था, जिसमें कोई विशिष्ट आकार या संरचना आधिकारिक रूप से प्रकाशित नहीं की गई थी। प्रशिक्षण में Adam (Optimizer) का एक वेरिएंट कोसाइन Learning Rate Scheduling के साथ उपयोग किया गया, और स्थिरता के लिए Gradient Clipping और Layer Normalization को नियोजित किया गया। इंस्ट्रक्शन-ट्यून्ड वेरिएंट को प्रदर्शन डेटा पर पर्यवेक्षित फाइन-ट्यूनिंग और Reinforcement Learning from AI Feedback (RLAIF) (एआई फीडबैक से सुदृढीकरण सीखना) का उपयोग करके और परिष्कृत किया गया था, एक तकनीक जो RLHF के समान है, लेकिन एआई-जनरेटेड प्राथमिकता लेबल का उपयोग करती है।
बेस मॉडल को एक अनुक्रम में अगले टोकन की भविष्यवाणी करने के लिए प्रशिक्षित किया गया था, जिसमें मानक क्रॉस-एंट्रॉपी लॉस फंक्शन का उपयोग किया गया था। इंस्ट्रक्शन मॉडल को उपयोगकर्ता प्रॉम्प्ट का पालन करने और सहायक, सुरक्षित प्रतिक्रियाएँ उत्पन्न करने के लिए अनुकूलित किया गया था। Mistral AI ने प्रशिक्षण टोकन की सटीक संख्या का खुलासा नहीं किया, लेकिन स्वतंत्र विश्लेषणों ने सुझाव दिया कि मॉडल को एक बड़े कॉर्पस पर प्रशिक्षित किया गया था, संभवतः 1 ट्रिलियन टोकन से अधिक, बेंचमार्क प्रदर्शन और समान आकार के अन्य मॉडलों के साथ तुलना के आधार पर।
प्रदर्शन और बेंचमार्क
Mixtral 8x7B ने विभिन्न मानक बेंचमार्कों पर मजबूत प्रदर्शन दिखाया। MMLU (विशाल मल्टी-टास्क भाषा समझ) बेंचमार्क पर, इसे 5-शॉट सेटिंग में लगभग 70.6% स्कोर मिला, जो GPT-3.5 और Llama 2 70B से बेहतर था। HellaSwag सामान्य ज्ञान तर्क परीक्षण पर, यह लगभग 86.7% प्राप्त करता है, और WinoGrande कोरफेरेंस रिज़ॉल्यूशन कार्य पर, यह लगभग 81.2% स्कोर करता है। मॉडल ने गणित और कोड जनरेशन में भी उत्कृष्ट प्रदर्शन किया, बेस मॉडल के लिए GSM-8K (गणितीय तर्क) पर लगभग 74.5% और HumanEval (कोड पूर्णता) पर लगभग 40.2% स्कोर के साथ, जबकि Instruct वेरिएंट इसे सुधारकर 42.2% कर देता है।
प्रत्यक्ष तुलना में, Mixtral 8x7B ने अधिकांश कार्यों पर Llama 2 70B के प्रदर्शन को बराबर या उससे अधिक किया, जबकि अनुमान के दौरान केवल लगभग एक-छठे सक्रिय पैरामीटर का उपयोग किया। यह MMLU और HellaSwag सहित कई बेंचमार्कों पर बड़े GPT-3.5 से भी आगे रहा। मॉडल की दक्षता ने इसे एज डिवाइसों और लागत-संवेदनशील वातावरणों में तैनाती के लिए आकर्षक बना दिया, हालांकि FP16 में इसकी कुल मेमोरी फुटप्रिंट लगभग 90 GB होने से अभी भी पर्याप्त हार्डवेयर की आवश्यकता थी। रिलीज़ में एक क्वांटाइज़्ड (4-बिट) संस्करण शामिल था जो 24 GB VRAM वाले उपभोक्ता GPU पर चल सकता था।
प्रभाव और स्वागत
Mixtral 8x7B की रिलीज़ को Artificial intelligence समुदाय और मुख्यधारा प्रेस में व्यापक रूप से कवर किया गया। उच्च-प्रदर्शन भाषा मॉडलों तक पहुँच को लोकतांत्रिक बनाने के लिए इसकी प्रशंसा की गई, क्योंकि इसके ओपन वेट्स ने शोधकर्ताओं और डेवलपर्स को API लागत के बिना इसे फाइन-ट्यून और तैनात करने की अनुमति दी। मॉडल ने स्पार्स MoE आर्किटेक्चर में नई रुचि भी जगाई, जिसने Alibaba Cloud के Qwen-MoE और AI21 Labs के Jamba सहित अन्य प्रयोगशालाओं के बाद के रिलीज़ों को प्रभावित किया। स्वतंत्र मूल्यांकनों ने नोट किया कि Mixtral 8x7B ने मजबूत बहुभाषी क्षमताएँ और मजबूत तर्क दिखाया, हालांकि कुछ आलोचकों ने ओपन मॉडलों में सामान्य संभावित पूर्वाग्रहों और सुरक्षा सीमाओं की ओर इशारा किया।
रिलीज़ ओपन-वेट मॉडलों के प्रोप्राइटरी सिस्टम को चुनौती देने के व्यापक चलन के साथ हुई। इसके बाद अप्रैल 2024 में Mistral AI का बड़ा Mixtral 8x22B आया, जिसने समान आर्किटेक्चर को 141 बिलियन कुल पैरामीटरों तक बढ़ाया। Mixtral 8x7B की सफलता ने Mistral AI के मूल्यांकन में योगदान दिया, जो जून 2024 में घोषित फंडिंग राउंड में $6.2 बिलियन तक पहुँच गया। मॉडल ने Model Pruning और Data Augmentation अनुसंधान के लिए एक संदर्भ बिंदु के रूप में भी काम किया, क्योंकि इसकी स्पार्स संरचना ने दक्षता तकनीकों के लिए एक प्राकृतिक परीक्षण आधार प्रदान किया।
तकनीकी विवरण और उपलब्धता
Mixtral 8x7B को Apache 2.0 लाइसेंस के तहत जारी किया गया था, जो व्यावसायिक उपयोग और संशोधन की अनुमति देता है। मॉडल वेट्स को Hugging Face और एक BitTorrent लिंक के माध्यम से वितरित किया गया था, जो ओपन एक्सेस के प्रति Mistral AI की प्रतिबद्धता को दर्शाता है। बेस मॉडल और Instruct वेरिएंट FP16 और BF16 प्रारूपों में प्रदान किए गए थे, साथ ही कम-परिशुद्धता अनुमान के लिए समुदाय-निर्मित क्वांटाइज़ेशन भी उपलब्ध थे। मॉडल को प्रमुख अनुमान ढांचों में एकीकृत किया गया था, जिसमें vLLM, TensorRT-LLM, और Groq का LPU-आधारित हार्डवेयर शामिल था, जिसने मॉडल की स्पार्स सक्रियण के कारण विशेष रूप से कम विलंबता प्राप्त की।
डेवलपर्स के लिए, मॉडल को FP16 में लगभग 90 GB GPU मेमोरी, या 4-बिट क्वांटाइज़ेशन में लगभग 24 GB की आवश्यकता थी। यह 32,768 टोकन की कॉन्टेक्स्ट लंबाई का समर्थन करता था, जिससे लंबे दस्तावेज़ प्रसंस्करण संभव था। इंस्ट्रक्शन मॉडल को चैट और कार्य पूर्णता के लिए अनुकूलित किया गया था, जिसमें अन्य चैट मॉडलों के समान एक सिस्टम प्रॉम्प्ट प्रारूप था। Mistral AI ने होस्टेड एक्सेस के लिए एक API भी प्रदान किया, लेकिन ओपन वेट्स ने कई संगठनों के लिए स्थानीय तैनाती को व्यवहार्य बना दिया। रिलीज़ दस्तावेज़ीकरण में बेंचमार्क, एक मॉडल कार्ड और उदाहरण कोड शामिल थे, जिससे Amazon Web Services से लेकर Microsoft Azure और Google Cloud तक के उद्योगों में तेजी से अपनाने में सुविधा हुई।