मिश्रण ऑफ एक्सपर्ट्स (MoE) एक मशीन लर्निंग तकनीक है जिसमें कई विशेषज्ञ नेटवर्क, या लर्नर, एक समस्या स्थान को सजातीय क्षेत्रों में विभाजित करते हैं, जो एन्सेम्बल लर्निंग का एक रूप प्रस्तुत करता है। ऐसी प्रणालियों में, एक रूटिंग तंत्र - जिसे अक्सर गेटिंग फ़ंक्शन या वेटिंग फ़ंक्शन कहा जाता है - यह निर्धारित करता है कि इनपुट को विशेषज्ञों को कैसे सौंपा जाता है और उनके आउटपुट को कैसे संयोजित किया जाता है। मिश्रण ऑफ एक्सपर्ट्स रूटिंग इस प्रकार उन विशिष्ट एल्गोरिदम और डिज़ाइन विकल्पों को संदर्भित करती है जो इस चयन और वेटिंग प्रक्रिया को नियंत्रित करते हैं, जो मॉडल क्षमता, कम्प्यूटेशनल लागत और आउटपुट गुणवत्ता को संतुलित करने के लिए महत्वपूर्ण हैं। यह अवधारणा 1990 के दशक के प्रारंभिक सांख्यिकीय मॉडल से विकसित होकर समकालीन बड़े भाषा मॉडल में उपयोग की जाने वाली स्पार्स रूटिंग योजनाओं तक पहुँची है, जहाँ यह अपेक्षाकृत कम प्रति-टोकन गणना के साथ विशाल पैरामीटर गणना को सक्षम बनाती है।
किसी भी मिश्रण ऑफ एक्सपर्ट्स प्रणाली की मुख्य वास्तुकला में विशेषज्ञ फ़ंक्शनों का एक सेट \(f_1, ..., f_n\) शामिल होता है, जिनमें से प्रत्येक समान इनपुट \(x\) लेता है और एक आउटपुट उत्पन्न करता है, और एक वेटिंग फ़ंक्शन \(w\) जो \(x\) को गैर-नकारात्मक वेट्स के एक वेक्टर \((w(x)_1, ..., w(x)_n)\) में मैप करता है। अंतिम आउटपुट आमतौर पर एक भारित योग के रूप में गणना की जाती है: \(f(x) = \sum_i w(x)_i f_i(x)\)। विशेषज्ञ और वेटिंग फ़ंक्शन दोनों को एक लॉस फ़ंक्शन को कम करके संयुक्त रूप से प्रशिक्षित किया जाता है, आमतौर पर ग्रेडिएंट डिसेंट के माध्यम से। रूटिंग तंत्र यह निर्धारित करता है कि ये वेट्स कैसे गणना किए जाते हैं, चाहे वे डेंस हों (सभी विशेषज्ञ योगदान करते हैं) या स्पार्स (केवल कुछ विशेषज्ञ सक्रिय होते हैं), और सिस्टम लोड संतुलन और प्रशिक्षण स्थिरता को कैसे संभालता है।
प्रारंभिक रूटिंग डिज़ाइन
सबसे प्रारंभिक रूटिंग सूत्रीकरणों में से एक मेटा-पाई नेटवर्क था, जिसे 1990 के दशक की शुरुआत में हैम्पशायर और वाइबेल द्वारा रिपोर्ट किया गया था। इस डिज़ाइन में, आउटपुट विशेषज्ञ आउटपुट का भारित योग होता है, और प्रशिक्षण माध्य-वर्ग त्रुटि लॉस पर ग्रेडिएंट डिसेंट द्वारा आगे बढ़ता है। विशेषज्ञ मनमाने फ़ंक्शन हो सकते थे, और गेटिंग नेटवर्क इनपुट के आधार पर वेट्स असाइन करना सीखता था। अपने मूल प्रकाशन में, शोधकर्ताओं ने इसे छह जापानी वक्ताओं (दो महिला, चार पुरुष) से भाषण संकेतों में फोनेम्स को वर्गीकृत करने के लिए लागू किया। उन्होंने छह विशेषज्ञों को प्रशिक्षित किया, प्रत्येक एक समय-विलंबित तंत्रिका नेटवर्क था जो मेल स्पेक्ट्रोग्राम पर काम करता था। उल्लेखनीय रूप से, सीखी गई रूटिंग ने पांच विशेषज्ञों को पांच व्यक्तिगत वक्ताओं के लिए समर्पित किया, जबकि छठे पुरुष वक्ता की आवाज़ को अन्य तीन पुरुष वक्ताओं के लिए विशेषज्ञों के एक रैखिक संयोजन द्वारा वर्गीकृत किया गया, जो दर्शाता है कि रूटिंग एक-से-एक मैपिंग के बजाय साझा उप-स्थानों की खोज कर सकती है।
एक और प्रारंभिक दृष्टिकोण स्थानीय विशेषज्ञों का अनुकूली मिश्रण था, जो गेटिंग फ़ंक्शन के लिए एक गाऊसी मिश्रण मॉडल का उपयोग करता था। यहाँ, प्रत्येक विशेषज्ञ ने आउटपुट पर एक गाऊसी वितरण की भविष्यवाणी की, अक्सर इनपुट को पूरी तरह से अनदेखा करते हुए और केवल एक माध्य वेक्टर सीखता था। वेटिंग फ़ंक्शन एक रैखिक-सॉफ्टमैक्स फ़ंक्शन था, जहाँ विशेषज्ञ \(i\) के लिए वेट की गणना \(w(x)_i = \exp(k_i^T x + b_i) / \sum_j \exp(k_j^T x + b_j)\) के रूप में की जाती थी। इस सॉफ्टमैक्स रूटिंग ने विशेषज्ञों पर एक सामान्यीकृत संभाव्यता वितरण उत्पन्न किया, और समग्र मॉडल आउटपुट गाऊसी भविष्यवाणियों का एक मिश्रण था। इस सूत्रीकरण ने संभाव्य व्याख्या की अनुमति दी और अधिकतम संभावना के माध्यम से प्रशिक्षित किया गया, जो बाद के संभाव्य रूटिंग विधियों के लिए एक आधार प्रदान करता है।
स्पार्स रूटिंग और ट्रांसफॉर्मर युग
आधुनिक मिश्रण ऑफ एक्सपर्ट्स रूटिंग ने Transformer (architecture) वास्तुकला के उदय के साथ Deep learning में प्रमुखता प्राप्त की। बड़े पैमाने के मॉडलों में, डेंस रूटिंग - जहाँ हर विशेषज्ञ हर इनपुट को संसाधित करता है - विशेषज्ञों की संख्या बढ़ने पर कम्प्यूटेशनल रूप से निषेधात्मक हो जाती है। स्पार्स रूटिंग, जिसे 2017 के पेपर "आउटरेजियसली लार्ज न्यूरल नेटवर्क्स: द स्पार्सली-गेटेड मिक्सचर-ऑफ-एक्सपर्ट्स लेयर" में नोम शज़ीर और Google DeepMind के सहयोगियों सहित शोधकर्ताओं द्वारा पेश किया गया था, ने प्रति इनपुट टोकन केवल विशेषज्ञों के एक छोटे उपसमुच्चय को सक्रिय करके इसे संबोधित किया। गेटिंग फ़ंक्शन विशेषज्ञ स्कोर पर एक सॉफ्टमैक्स की गणना करता है लेकिन फिर एक टॉप-के चयन लागू करता है, केवल उच्चतम स्कोर वाले विशेषज्ञों (आमतौर पर k = 1 या 2) को रखता है और बाकी को शून्य कर देता है। यह मॉडल को अरबों पैरामीटर रखने की अनुमति देता है जबकि प्रत्येक फॉरवर्ड पास के लिए उनमें से केवल एक अंश की गणना करता है।
स्पार्स गेटिंग फ़ंक्शन आमतौर पर एक प्रशिक्षण योग्य वेट मैट्रिक्स का उपयोग करता है जो इनपुट टोकन प्रतिनिधित्व को लॉजिट्स के एक वेक्टर में मैप करता है, प्रति विशेषज्ञ एक। इन लॉजिट्स को संभावनाएँ उत्पन्न करने के लिए सॉफ्टमैक्स के माध्यम से पारित किया जाता है, और टॉप-के विशेषज्ञों का चयन किया जाता है। चयनित विशेषज्ञों के आउटपुट को उनकी सामान्यीकृत संभावनाओं द्वारा भारित किया जाता है और जोड़ा जाता है। यह रूटिंग तंत्र गेटिंग पैरामीटर के संबंध में अवकलनीय है, जो बैकप्रोपेगेशन के माध्यम से एंड-टू-एंड प्रशिक्षण की अनुमति देता है। हालाँकि, स्पार्स रूटिंग लोड असंतुलन जैसी चुनौतियों का परिचय देती है, जहाँ कुछ विशेषज्ञ हावी होते हैं और अन्य को कम प्रशिक्षण संकेत मिलता है, जिससे सहायक लोड-संतुलन लॉस का विकास होता है।
लोड संतुलन और सहायक लॉस
मिश्रण ऑफ एक्सपर्ट्स रूटिंग में एक सतत मुद्दा विशेषज्ञ पतन है, जहाँ गेटिंग नेटवर्क अधिकांश इनपुट को विशेषज्ञों के एक छोटे सेट पर रूट करना सीखता है, दूसरों को कम उपयोग में छोड़ देता है। इसका मुकाबला करने के लिए, आधुनिक कार्यान्वयन सहायक लॉस जोड़ते हैं जो समान रूटिंग को प्रोत्साहित करते हैं। एक सामान्य दृष्टिकोण, जो स्विच ट्रांसफॉर्मर (Google DeepMind द्वारा 2021 में पेश किया गया) जैसे मॉडलों में उपयोग किया जाता है, एक लोड-संतुलन लॉस जोड़ता है जो गेटिंग फ़ंक्शन को दंडित करता है जब विशेषज्ञों को सौंपे गए टोकन का वितरण समान से विचलित होता है। यह लॉस आमतौर पर औसत रूटिंग संभावना और प्रत्येक विशेषज्ञ को रूट किए गए टोकन के अंश के बीच स्केल किए गए डॉट उत्पाद के रूप में गणना की जाती है, और इसे एक छोटे गुणांक के साथ मुख्य प्रशिक्षण लॉस में जोड़ा जाता है। एक और तकनीक विशेषज्ञ क्षमता सीमाओं का उपयोग है, जहाँ प्रत्येक विशेषज्ञ प्रति बैच केवल एक निश्चित संख्या में टोकन संसाधित कर सकता है; इस क्षमता से अधिक टोकन छोड़ दिए जाते हैं या एक अवशिष्ट कनेक्शन पर रूट किए जाते हैं, जिससे किसी भी एक विशेषज्ञ को बाधा बनने से रोका जा सके।
हाल के तरीके, जैसे कि डीपसीक MoE वास्तुकला, बारीक-दानेदार विशेषज्ञ विभाजन और साझा विशेषज्ञों का उपयोग करके लोड संतुलन को परिष्कृत करते हैं। इस डिज़ाइन में, विशेषज्ञों को छोटी इकाइयों में विभाजित किया जाता है, और साझा विशेषज्ञों की एक छोटी संख्या हमेशा सक्रिय होती है, जबकि शेष रूट किए गए विशेषज्ञों को एक गेटिंग फ़ंक्शन के माध्यम से चुना जाता है। यह विशेषज्ञ विशेषज्ञता में अतिरेक को कम करता है और पैरामीटर दक्षता में सुधार करता है। ऐसे मॉडलों में रूटिंग अक्सर सॉफ्टमैक्स के बजाय सिग्मॉइड-आधारित गेटिंग का उपयोग करती है, जिससे कई विशेषज्ञों को स्वतंत्र रूप से सक्रिय किया जा सकता है, और एक बायस टर्म का उपयोग करती है जिसे मुख्य लॉस ग्रेडिएंट में हस्तक्षेप किए बिना लोड को संतुलित करने के लिए प्रशिक्षण के दौरान समायोजित किया जाता है।
बड़े भाषा मॉडलों में रूटिंग
मिश्रण ऑफ एक्सपर्ट्स रूटिंग Large language model को स्केल करने का एक आधारशिला बन गई है। मिस्ट्रल एआई द्वारा विकसित मिक्सट्रल 8x7B जैसे मॉडल एक स्पार्स MoE परत का उपयोग करते हैं जहाँ प्रत्येक टोकन को आठ विशेषज्ञों में से दो पर रूट किया जाता है, प्रत्येक विशेषज्ञ एक फीड-फॉरवर्ड नेटवर्क होता है। यह मॉडल को कुल 47 बिलियन पैरामीटर रखने की अनुमति देता है लेकिन प्रति टोकन केवल लगभग 13 बिलियन का उपयोग करता है, जो एक बहुत छोटे डेंस मॉडल की अनुमान लागत से मेल खाता है। इसी तरह, स्विच ट्रांसफॉर्मर ने प्रदर्शित किया कि स्पार्स रूटिंग के साथ ट्रिलियन पैरामीटर तक स्केलिंग संभव है, प्राकृतिक भाषा कार्यों पर डेंस बेसलाइन पर गति सुधार प्राप्त करना। इन मॉडलों में, रूटिंग निर्णय प्रति अनुक्रम के बजाय प्रति टोकन किया जाता है, जिससे मॉडल इनपुट के विभिन्न भागों को विभिन्न विशेषज्ञों को आवंटित कर सकता है।
बड़े भाषा मॉडलों में रूटिंग तंत्र अक्सर Multi-Head Attention परतों द्वारा उत्पादित छिपी हुई अवस्थाओं पर संचालित होता है। गेटिंग फ़ंक्शन एक रैखिक प्रक्षेपण है जिसके बाद सॉफ्टमैक्स या सिग्मॉइड होता है, और इसे शेष नेटवर्क के साथ संयुक्त रूप से प्रशिक्षित किया जाता है। एक प्रमुख डिज़ाइन विकल्प यह है कि क्या शोरगुल वाले टॉप-के गेटिंग का उपयोग किया जाए, जहाँ चयन से पहले लॉजिट्स में प्रशिक्षण योग्य गाऊसी शोर जोड़ा जाता है, जो प्रशिक्षण के दौरान अन्वेषण को प्रोत्साहित करता है और गेटिंग को शुरुआती चरण में बहुत नियतात्मक बनने से रोकता है। एक और विकल्प विशेषज्ञ समानांतरता का उपयोग है, जहाँ विशेषज्ञों को कई उपकरणों में वितरित किया जाता है, और संचार ओवरहेड को कम करने के लिए रूटिंग को समन्वित किया जाना चाहिए। इसने Amazon Web Services SageMaker और Google Cloud TPU वातावरण जैसे फ्रेमवर्क में विशेष कार्यान्वयन को जन्म दिया है।
चुनौतियाँ और हालिया प्रगति
अपनी प्रभावशीलता के बावजूद, मिश्रण ऑफ एक्सपर्ट्स रूटिंग कई खुली चुनौतियों का सामना करती है। एक रूटिंग ग्रैन्युलैरिटी और कम्प्यूटेशनल दक्षता के बीच का व्यापार-बंद है: बहुत अधिक विशेषज्ञ मेमोरी ओवरहेड और संचार लागत का कारण बन सकते हैं, जबकि बहुत कम क्षमता को सीमित करते हैं। एक और प्रशिक्षण की अस्थिरता है, क्योंकि असतत टॉप-के चयन ग्रेडिएंट मुद्दों का कारण बन सकता है, हालाँकि स्ट्रेट-थ्रू एस्टीमेटर और सॉफ्टमैक्स विश्राम का पता लगाया गया है। हाल के काम ने सीखी गई रूटिंग नीतियों की भी जांच की है जो समय के साथ अनुकूलित होती हैं, जैसे कि रूटिंग निर्णयों को अनुकूलित करने के लिए सुदृढीकरण लर्निंग का उपयोग, हालाँकि ये उत्पादन प्रणालियों में कम आम हैं।
सक्रिय शोध का एक और क्षेत्र रूटिंग की व्याख्यात्मकता है। अध्ययनों से पता चला है कि बड़े मॉडलों में विशेषज्ञ अक्सर अर्थ या वाक्य-विन्यास श्रेणियों में विशेषज्ञ होते हैं, जैसे विराम चिह्न, गणितीय तर्क, या कोड, लेकिन मैपिंग हमेशा साफ नहीं होती है। रूटिंग विश्लेषण जैसी तकनीकें, जहाँ प्रति विशेषज्ञ टोकन का वितरण देखा जाता है, इन पैटर्न को समझने के लिए उपयोग की गई हैं। इसके अतिरिक्त, कुछ मॉडल एक पदानुक्रमित रूटिंग योजना का उपयोग करते हैं, जहाँ एक पहले-स्तर का राउटर विशेषज्ञों के एक समूह का चयन करता है और एक दूसरे-स्तर का राउटर समूह के भीतर चयन करता है, जिससे आवश्यक तुलनाओं की संख्या कम हो जाती है। यह विशेष रूप से उपयोगी है जब विशेषज्ञों की संख्या बहुत बड़ी होती है, जैसे कि हजारों विशेषज्ञों वाले मॉडलों के मामले में।
डेंस मॉडलों के साथ तुलना
मिश्रण ऑफ एक्सपर्ट्स रूटिंग डेंस मॉडलों के लिए एक मौलिक विकल्प प्रदान करती है, जहाँ हर पैरामीटर हर इनपुट के लिए उपयोग किया जाता है। डेंस मॉडल, जैसे मूल Transformer (architecture) वास्तुकला, प्रति टोकन एक निश्चित कम्प्यूटेशनल लागत रखते हैं, जबकि MoE मॉडल में रूटिंग निर्णयों के आधार पर एक परिवर्तनीय लागत होती है। यह MoE मॉडल को अनुमान लागत में आनुपातिक वृद्धि के बिना उच्च क्षमता प्राप्त करने की अनुमति देता है, जिससे वे संसाधन-बाधित वातावरण में तैनाती के लिए आकर्षक बनते हैं। हालाँकि, डेंस मॉडल प्रशिक्षण और फाइन-ट्यूनिंग के लिए अक्सर आसान होते हैं, क्योंकि उन्हें लोड-संतुलन लॉस या सावधानीपूर्वक क्षमता ट्यूनिंग की आवश्यकता नहीं होती है। डेंस और MoE वास्तुकला के बीच का चुनाव विशिष्ट अनुप्रयोग पर निर्भर करता है, MoE विशेष रूप से बड़े पैमाने पर प्रशिक्षण के लिए उपयुक्त है जहाँ लक्ष्य एक निश्चित कंप्यूट बजट को देखते हुए गुणवत्ता को अधिकतम करना है।
व्यवहार में, OpenAI, Anthropic, और Google DeepMind सहित कई संगठनों ने अपने उत्पादन मॉडलों में MoE परतों को अपनाया है, हालाँकि वे अक्सर सटीक रूटिंग विवरण का खुलासा नहीं करते हैं। यह तकनीक भाषा से परे भी लागू की गई है, जिसमें कंप्यूटर विज़न और भाषण पहचान शामिल है, जहाँ इसने समान लाभ दिखाए हैं। जैसे-जैसे हार्डवेयर विकसित होता है, AWS Trainium और Groq जैसे विशेष एक्सेलेरेटर स्पार्स कंप्यूटेशन के लिए अनुकूलित होते हैं, MoE रूटिंग की दक्षता में और सुधार होने की संभावना है, जिससे यह भविष्य की Artificial intelligence प्रणालियों का एक मानक घटक बन जाएगा।
भविष्य की दिशाएँ
मिश्रण ऑफ एक्सपर्ट्स रूटिंग का भविष्य इसे और अधिक अनुकूली और कुशल बनाने में निहित है। एक दिशा पूरी तरह से अवकलनीय रूटिंग का विकास है, जहाँ असतत टॉप-के चयन को एक सतत सन्निकटन द्वारा प्रतिस्थापित किया जाता है, जो चिकनी ग्रेडिएंट और संभावित रूप से बेहतर अनुकूलन की अनुमति देता है। एक और सीखी गई रूटिंग नीतियों का उपयोग है जो इनपुट जटिलता के आधार पर सक्रिय विशेषज्ञों की संख्या को गतिशील रूप से समायोजित कर सकती है, सरल इनपुट के लिए गणना कम करती है और जटिल लोगों के लिए इसे बढ़ाती है। इसके अतिरिक्त, विशेषज्ञ विलय और छंटाई पर शोध, जहाँ प्रशिक्षण के बाद अनावश्यक विशेषज्ञों को संयोजित या हटा दिया जाता है, गुणवत्ता का त्याग किए बिना मेमोरी फुटप्रिंट को कम कर सकता है। जैसे-जैसे मॉडल स्केल करना जारी रखते हैं, रूटिंग तंत्र उनके प्रदर्शन और व्यावहारिकता को निर्धारित करने में तेजी से केंद्रीय भूमिका निभाएगा, जिससे यह सैद्धांतिक और अनुप्रयुक्त दोनों शोध के लिए एक समृद्ध क्षेत्र बन जाएगा।