DBRX एक बड़ा भाषा मॉडल है जिसे Mosaic द्वारा अपनी मूल कंपनी Databricks के अधीन विकसित किया गया था, और इसे 27 मार्च 2024 को Databricks Open Model License के तहत जारी किया गया। यह एक मिश्रण-विशेषज्ञ Transformer (architecture) मॉडल है जिसमें कुल 132 बिलियन पैरामीटर हैं, जिनमें से प्रत्येक टोकन के लिए 36 बिलियन सक्रिय होते हैं, जो 16 विशेषज्ञों में से 4 का उपयोग करता है। जारी किया गया मॉडल दो संस्करणों में आता है: एक आधार फाउंडेशन मॉडल और एक निर्देश-ट्यून किया गया वेरिएंट।
अपने जारी होने के समय, DBRX ने भाषा समझ, प्रोग्रामिंग क्षमता, और गणित को कवर करने वाले कई बेंचमार्कों पर Meta के Llama 2, Mistral AI के Mixtral, और xAI के Grok-1 जैसे प्रमुख मॉडलों से बेहतर प्रदर्शन किया। इसकी वास्तुकला और प्रशिक्षण दृष्टिकोण ने इसे तेजी से विकसित हो रहे Generative AI परिदृश्य में एक प्रतिस्पर्धी ओपन-वेट विकल्प के रूप में स्थापित किया।
वास्तुकला और डिजाइन
DBRX एक मिश्रण-विशेषज्ञ (MoE) वास्तुकला का उपयोग करता है, एक डिज़ाइन जो मॉडल के पैरामीटरों को कई विशेष "विशेषज्ञ" नेटवर्कों में विभाजित करता है। प्रत्येक इनपुट टोकन के लिए, एक गेटिंग तंत्र प्रक्रिया करने के लिए विशेषज्ञों का एक उपसमूह चुनता है, जिससे मॉडल कुल पैरामीटर संख्या बढ़ा सकता है जबकि प्रति टोकन कम्प्यूटेशनल लागत प्रबंधनीय रहती है। DBRX में, 16 विशेषज्ञ उपलब्ध हैं, लेकिन प्रति टोकन केवल 4 सक्रिय होते हैं, जिसके परिणामस्वरूप कुल 132 बिलियन में से 36 बिलियन सक्रिय पैरामीटर होते हैं। यह स्पार्स सक्रियण समान आकार के घने मॉडलों की तुलना में कुशल अनुमान और प्रशिक्षण सक्षम करता है।
मॉडल Transformer (architecture) वास्तुकला पर बनाया गया है, जो अनुक्रमिक डेटा को संसाधित करने के लिए Multi-Head Attention तंत्र का उपयोग करता है। DBRX आधुनिक LLM में सामान्य तकनीकों को शामिल करता है, जैसे Layer Normalization और Positional Encoding, ताकि प्रशिक्षण स्थिर हो और टोकन क्रम को पकड़ा जा सके। मिश्रण-विशेषज्ञ दृष्टिकोण Model Pruning का एक उल्टा रूप है - पैरामीटर हटाने के बजाय, यह चुनिंदा रूप से उनका एक अंश उपयोग करता है, जिससे कम्प्यूटेशनल ओवरहेड कम होता है।
प्रशिक्षण और विकास
DBRX को 2.5 महीने की अवधि में 3,072 Nvidia H100 GPU का उपयोग करके प्रशिक्षित किया गया था, जो InfiniBand के माध्यम से 3.2 टेराबाइट प्रति सेकंड बैंडविड्थ से जुड़े थे। रिपोर्ट की गई प्रशिक्षण लागत US$10 मिलियन थी, जो कुछ समकालीन मॉडलों की तुलना में अपेक्षाकृत मामूली आंकड़ा है, जो MoE डिज़ाइन की दक्षता और प्रशिक्षण पाइपलाइन के अनुकूलन को दर्शाता है। प्रशिक्षण डेटा में पाठ और कोड का एक विविध संग्रह शामिल था, हालांकि विशिष्ट विवरण पूरी तरह से प्रकट नहीं किए गए थे।
विकास का नेतृत्व Mosaic द्वारा किया गया था, एक कंपनी जिसे 2023 में Databricks द्वारा अधिग्रहित किया गया था, जो Machine learning मॉडलों के कुशल प्रशिक्षण में विशेषज्ञता रखती थी। वितरित प्रशिक्षण और अनुकूलन में Mosaic की विशेषज्ञता ने अपेक्षाकृत कम प्रशिक्षण समय और लागत में योगदान दिया। मॉडल को स्थिरता सुनिश्चित करने के लिए Gradient Clipping और Learning Rate Scheduling समायोजन जैसी तकनीकों का उपयोग करके प्रशिक्षित किया गया था।
प्रदर्शन और बेंचमार्क
जारी होने पर, DBRX ने कई बेंचमार्कों में मजबूत प्रदर्शन दिखाया। भाषा समझ कार्यों में, यह Llama 2 और Mixtral से आगे निकल गया, जिसमें बेहतर तर्क और समझ दिखाई दी। प्रोग्रामिंग बेंचमार्कों में, DBRX कोड निर्माण और डिबगिंग में उत्कृष्ट था, जो Grok-1 से बेहतर प्रदर्शन करता था। गणितीय तर्क एक और क्षेत्र था जहां DBRX ने प्रतिस्पर्धी परिणाम दिखाए, अक्सर बड़े सक्रिय पैरामीटर संख्या वाले मॉडलों से मेल खाता या उनसे अधिक था।
ये परिणाम मिश्रण-विशेषज्ञ दृष्टिकोण की प्रभावशीलता को उजागर करते हैं, जो DBRX को घने 132-बिलियन-पैरामीटर मॉडल की पूरी कम्प्यूटेशनल लागत के बिना उच्च सटीकता प्राप्त करने की अनुमति देता है। निर्देश-ट्यून किया गया वेरिएंट संवादात्मक और कार्य-उन्मुख अनुप्रयोगों के लिए अनुकूलित था, जिससे मानव-पसंद-संरेखित कार्यों पर प्रदर्शन में और सुधार हुआ।
रिलीज़ और लाइसेंसिंग
DBRX को Databricks Open Model License के तहत जारी किया गया था, जो कुछ प्रतिबंधों के साथ वाणिज्यिक अनुप्रयोगों सहित व्यापक उपयोग की अनुमति देता है। खुली रिलीज़ ने शोधकर्ताओं और डेवलपर्स को मॉडल वेट तक पहुंचने की अनुमति दी, जिससे आगे के प्रयोग और फाइन-ट्यूनिंग सुगम हुई। यह कदम Artificial intelligence समुदाय में ओपन-वेट मॉडलों की ओर एक प्रवृत्ति के साथ संरेखित था, जैसा कि OpenAI और Anthropic जैसे संगठनों के अन्य रिलीज़ों में देखा गया, हालांकि वे अक्सर मालिकाना रहते हैं।
आधार और निर्देश-ट्यून दोनों संस्करणों की उपलब्धता ने अनुसंधान से लेकर उत्पादन तैनाती तक विभिन्न उपयोग मामलों के लिए लचीलापन प्रदान किया। Databricks ने DBRX को उद्यमों के लिए एक उपकरण के रूप में स्थापित किया, इसे अपने डेटा प्लेटफ़ॉर्म और क्लाउड सेवाओं के साथ एकीकृत किया, जिसमें Amazon Web Services और Microsoft Azure शामिल हैं।
प्रभाव और विरासत
DBRX ने ओपन-सोर्स LLM के प्रतिस्पर्धी परिदृश्य में योगदान दिया, यह दर्शाते हुए कि कुशल MoE वास्तुकला बड़े मालिकाना मॉडलों को टक्कर दे सकती है। इसकी अपेक्षाकृत कम प्रशिक्षण लागत और उच्च प्रदर्शन ने इसे बाद के मॉडल विकास के लिए एक संदर्भ बिंदु बना दिया। DBRX की सफलता ने MoE डिज़ाइनों में और निवेश को प्रोत्साहित किया, जिन्हें तब से अन्य प्रमुख खिलाड़ियों द्वारा अपनाया गया है।
Deep learning के व्यापक संदर्भ में, DBRX ने कम्प्यूटेशनल बजट प्रबंधित करते हुए मॉडल क्षमता को बढ़ाने की प्रवृत्ति का उदाहरण दिया। इसकी रिलीज़ ने Nvidia के H100 GPU जैसे विशेष हार्डवेयर की भूमिका और बड़े मॉडलों के प्रशिक्षण में उच्च-बैंडविड्थ इंटरकनेक्ट के महत्व को भी रेखांकित किया। 2025 की शुरुआत तक, DBRX ओपन-वेट MoE मॉडलों का एक उल्लेखनीय उदाहरण बना हुआ है, हालांकि तब से बेहतर क्षमताओं वाले नए मॉडल उभरे हैं।