DBRX एक बड़ा भाषा मॉडल (LLM) है जिसे Mosaic द्वारा अपनी मूल कंपनी Databricks के अधीन विकसित किया गया है। 27 मार्च, 2024 को Databricks Open Model License के तहत जारी, यह एक मिश्रण-ऑफ-एक्सपर्ट्स ट्रांसफॉर्मर मॉडल है जिसमें 132 बिलियन कुल पैरामीटर हैं, जिनमें से 36 बिलियन प्रत्येक टोकन के लिए सक्रिय हैं। रिलीज़ में एक आधार फाउंडेशन मॉडल और एक इंस्ट्रक्शन-ट्यून्ड वैरिएंट दोनों शामिल हैं, जो भाषा समझ, प्रोग्रामिंग और गणित में अग्रणी खुले और मालिकाना मॉडलों के साथ प्रतिस्पर्धा करने के लिए डिज़ाइन किए गए हैं।
मॉडल की वास्तुकला और प्रशिक्षण दृष्टिकोण Generative AI में कुशल स्केलिंग की ओर एक व्यापक प्रवृत्ति को दर्शाता है, जो उच्च क्षमता बनाए रखते हुए कम्प्यूटेशनल लागत को कम करने के लिए स्पार्स सक्रियण का उपयोग करता है। DBRX को अन्य ओपन-वेट मॉडलों के लिए एक सीधा चैलेंजर के रूप में स्थापित किया गया था, और रिलीज़ के समय इसका प्रदर्शन सार्वजनिक रूप से उपलब्ध सिस्टम के लिए एक नया बेंचमार्क स्थापित करता है।
वास्तुकला और डिज़ाइन
DBRX एक मिश्रण-ऑफ-एक्सपर्ट्स (MoE) वास्तुकला का उपयोग करता है, जो Transformer (architecture) मॉडल का एक प्रकार है जो प्रत्येक टोकन को विशेषज्ञ नेटवर्क के एक उपसमूह के माध्यम से रूट करता है। मॉडल में 16 विशेषज्ञ हैं, जिनमें से 4 प्रति टोकन सक्रिय होते हैं, जिससे 132 बिलियन कुल में से 36 बिलियन सक्रिय पैरामीटर प्राप्त होते हैं। यह स्पार्स डिज़ाइन समान आकार के घने मॉडल की तुलना में अनुमान और प्रशिक्षण कम्प्यूट को कम करता है।
मॉडल एक मानक डिकोडर-ओनली ट्रांसफॉर्मर संरचना का उपयोग करता है जिसमें Multi-Head Attention और Positional Encoding शामिल हैं, लेकिन विशेषज्ञता में सुधार के लिए फाइन-ग्रेन्ड एक्सपर्ट रूटिंग को शामिल करता है। प्रत्येक विशेषज्ञ एक फीडफॉरवर्ड नेटवर्क है, और एक सीखा हुआ गेटिंग तंत्र चुनता है कि कौन से विशेषज्ञ प्रत्येक टोकन को संसाधित करते हैं। यह दृष्टिकोण मॉडल को क्षमता को गतिशील रूप से आवंटित करने की अनुमति देता है, जो Mixtral जैसे अन्य MoE सिस्टम के समान है।
DBRX में Layer Normalization और Residual Network (ResNet) कनेक्शन जैसे वास्तुकला संबंधी परिष्कार भी शामिल हैं, जो बड़े पैमाने पर प्रशिक्षण को स्थिर करते हैं। इंस्ट्रक्शन-ट्यून्ड वैरिएंट को सुपरवाइज़्ड फाइन-ट्यूनिंग और Reinforcement Learning from AI Feedback (RLAIF) (एआई फीडबैक से सुदृढीकरण सीखना) का उपयोग करके और परिष्कृत किया गया था, जो संवाद और कार्य पूर्णता के लिए मानवीय प्राथमिकताओं के साथ आउटपुट को संरेखित करता है।
प्रशिक्षण और कम्प्यूट
DBRX का प्रशिक्षण लगभग 2.5 महीने लेता है, जिसमें 3,072 Nvidia H100 GPU का उपयोग किया गया, जो 3.2 टेराबाइट प्रति सेकंड बैंडविड्थ के साथ InfiniBand से जुड़े थे। कुल प्रशिक्षण लागत US$10 मिलियन बताई गई थी, एक आंकड़ा जो अत्याधुनिक LLM के लिए आवश्यक पर्याप्त कम्प्यूट को उजागर करता है। प्रशिक्षण डेटासेट में पाठ और कोड का एक विविध कॉर्पस शामिल था, हालांकि Databricks ने डेटा संरचना के पूर्ण विवरण का खुलासा नहीं किया।
प्रशिक्षण प्रक्रिया ने हजारों चरणों में स्थिरता सुनिश्चित करने के लिए Gradient Clipping और Learning Rate Scheduling तकनीकों का लाभ उठाया। Nvidia H100 का उपयोग करते हुए हार्डवेयर सेटअप, इस अवधि के दौरान बड़े पैमाने पर Deep learning में NVIDIA-श्रेणी के त्वरक की प्रमुख भूमिका को दर्शाता है, हालांकि AMD और AWS Trainium जैसे प्रतियोगी भी उभर रहे थे। InfiniBand इंटरकनेक्ट ने विशेषज्ञों के बीच कुशल संचार को सक्षम किया, जो MoE प्रशिक्षण के लिए एक महत्वपूर्ण कारक है।
रिलीज़ और लाइसेंसिंग
DBRX को Databricks Open Model License के तहत जारी किया गया था, एक अनुमत लाइसेंस जो उपयोग, संशोधन और वितरण की अनुमति देता है, हालांकि इसमें Databricks की वाणिज्यिक सेवाओं के साथ प्रतिस्पर्धा करने के लिए मॉडल का उपयोग करने पर प्रतिबंध शामिल हैं। रिलीज़ में मॉडल वेट, अनुमान कोड और मूल्यांकन स्क्रिप्ट शामिल थे, जिससे यह शोधकर्ताओं और उद्यमों के लिए सुलभ हो गया।
खुली रिलीज़ OpenAI और Anthropic जैसी कंपनियों के मालिकाना मॉडलों के विपरीत थी, जो API के माध्यम से सीमित पहुंच प्रदान करते हैं। Databricks ने DBRX को अपने AI इंफ्रास्ट्रक्चर पर नियंत्रण चाहने वाले उद्यमों के लिए एक उपकरण के रूप में स्थापित किया, जो Amazon Web Services, Microsoft Azure, और Google Cloud पर डेटा इंजीनियरिंग और Machine learning के लिए अपने व्यापक प्लेटफॉर्म के साथ संरेखित है।
प्रदर्शन बेंचमार्क
अपनी रिलीज़ के समय, DBRX ने भाषा समझ, प्रोग्रामिंग और गणित के बेंचमार्क में Meta के Llama 2, Mistral AI के Mixtral, और xAI के Grok-1 सहित कई प्रमुख खुले मॉडलों को पीछे छोड़ दिया। उदाहरण के लिए, DBRX ने मानक तर्क कार्यों और कोड जनरेशन परीक्षणों पर उच्च स्कोर प्राप्त किए, हालांकि सटीक संख्या बेंचमार्क के अनुसार भिन्न थी।
इंस्ट्रक्शन-ट्यून्ड वैरिएंट ने जटिल निर्देशों का पालन करने और सुसंगत मल्टी-टर्न प्रतिक्रियाएं उत्पन्न करने में विशेष ताकत दिखाई, जिसे इसके Reinforcement Learning from AI Feedback (RLAIF) प्रशिक्षण के लिए जिम्मेदार ठहराया गया। तीसरे पक्षों द्वारा स्वतंत्र मूल्यांकन ने आम तौर पर इन परिणामों की पुष्टि की, हालांकि कुछ ने नोट किया कि व्यापक विश्व ज्ञान या कम-संसाधन भाषा समर्थन की आवश्यकता वाले कार्यों पर DBRX का लाभ संकीर्ण था।
समकालीन मॉडलों के साथ तुलना
DBRX एक प्रतिस्पर्धी परिदृश्य में प्रवेश किया जो खुले और बंद दोनों मॉडलों द्वारा प्रभुत्व था। Mixtral की तुलना में, DBRX ने अधिक विशेषज्ञों (16 बनाम 8) और एक बड़ी कुल पैरामीटर संख्या का उपयोग किया, जिसने इसके उच्च बेंचमार्क स्कोर में योगदान दिया। Llama 2 के खिलाफ, DBRX के MoE डिज़ाइन ने प्रति सक्रिय पैरामीटर बेहतर दक्षता प्रदान की, हालांकि Llama 2 को अधिक स्थापित घने वास्तुकला के साथ प्रशिक्षित किया गया था।
OpenAI के GPT-4 या Google DeepMind के Gemini जैसे मालिकाना सिस्टम के सापेक्ष, DBRX को आम तौर पर जटिल तर्क और रचनात्मक कार्यों पर कम सक्षम माना जाता था, लेकिन इसने स्थानीय तैनाती और अनुकूलन का लाभ प्रदान किया। मॉडल के खुले लाइसेंस ने डोमेन-विशिष्ट उपयोग मामलों के लिए फाइन-ट्यूनिंग को सक्षम किया, जो विनियमित उद्योगों में उद्यमों के लिए एक प्रमुख विक्रय बिंदु था।
पारिस्थितिकी तंत्र और अपनाना
Databricks ने DBRX को अपने प्लेटफॉर्म में एकीकृत किया, जिससे ग्राहकों को अपनी प्रबंधित सेवाओं या अपने स्वयं के इंफ्रास्ट्रक्चर पर मॉडल तैनात करने की अनुमति मिली। मॉडल को Microsoft Azure और Google Cloud मार्केटप्लेस पर भी उपलब्ध कराया गया, जिससे इसकी पहुंच बढ़ी। कई स्टार्टअप और शोध समूहों ने कोड जनरेशन, दस्तावेज़ विश्लेषण और ग्राहक सहायता में अनुप्रयोगों के लिए DBRX को अपनाया।
रिलीज़ ने घने मॉडलों के लिए लागत-प्रभावी विकल्प के रूप में MoE वास्तुकला में रुचि बढ़ाई, जिसने अन्य प्रयोगशालाओं के बाद के काम को प्रभावित किया। हालांकि, DBRX का प्रभाव आंशिक रूप से क्षेत्र में तेजी से प्रगति से ढका हुआ था, जिसमें Llama 3 और Qwen 2 जैसे नए मॉडलों ने महीनों के भीतर तुलनीय या बेहतर प्रदर्शन हासिल किया।
सीमाएं और आलोचनाएं
अपनी ताकत के बावजूद, DBRX में उल्लेखनीय सीमाएं थीं। इसके 132 बिलियन कुल पैरामीटरों को अनुमान के लिए पर्याप्त मेमोरी की आवश्यकता थी, जिसके लिए अक्सर कई GPU या क्वांटाइज़ेशन की आवश्यकता होती थी। मॉडल ने LLM में आम पूर्वाग्रह और तथ्यात्मक त्रुटियां भी प्रदर्शित कीं, और इसके प्रशिक्षण डेटा की कटऑफ ने 2024 की शुरुआत के बाद की घटनाओं के ज्ञान को सीमित कर दिया।
आलोचकों ने प्रशिक्षण डेटा के बारे में पारदर्शिता की कमी और प्रशिक्षण की पर्यावरणीय लागत की ओर इशारा किया, जिसने अपेक्षाकृत कम प्रशिक्षण अवधि के बावजूद महत्वपूर्ण ऊर्जा की खपत की। Databricks Open Model License की भी इसके गैर-मानक शर्तों के लिए आलोचना की गई, जिसे कुछ लोगों ने पारंपरिक ओपन-सोर्स लाइसेंसों की तुलना में कम खुला तर्क दिया।
विरासत और भविष्य की दिशाएं
DBRX ने प्रदर्शित किया कि MoE मॉडल घने मॉडलों की प्रशिक्षण लागत के एक अंश पर प्रतिस्पर्धी प्रदर्शन प्राप्त कर सकते हैं, जिससे स्पार्स वास्तुकला में आगे के शोध को प्रोत्साहन मिला। Databricks ने बाद के मॉडलों का विकास जारी रखा, हालांकि DBRX 2024 में ओपन-वेट LLM के लिए एक संदर्भ बिंदु बना रहा।
मॉडल की रिलीज़ ने खुले बनाम बंद सिस्टम पर व्यापक Artificial intelligence प्रवचन में योगदान दिया, जिसमें समर्थकों ने DBRX को इस बात के प्रमाण के रूप में उद्धृत किया कि उच्च-गुणवत्ता वाले मॉडल सार्वजनिक रूप से उपलब्ध किए जा सकते हैं। 2024 के अंत तक, DBRX अभी भी विभिन्न शोध और उत्पादन सेटिंग्स में उपयोग किया जा रहा था, हालांकि नए मॉडलों ने बेंचमार्क रैंकिंग में इसे काफी हद तक पीछे छोड़ दिया था।
यह भी देखें
संदर्भ
- Databricks प्रेस विज्ञप्ति, 27 मार्च, 2024
- DBRX वास्तुकला और प्रशिक्षण पर तकनीकी रिपोर्ट
- शैक्षणिक और उद्योग स्रोतों से स्वतंत्र बेंचमार्क मूल्यांकन