स्पार्स MoE रूटिंग Mixture of experts तंत्रिका नेटवर्क में एक तंत्र है जो यह निर्धारित करता है कि कौन से विशेषज्ञ उपनेटवर्क प्रत्येक इनपुट टोकन को संसाधित करते हैं। एक स्पार्स मिश्रण-ऑफ-एक्सपर्ट्स परत में, एक राउटर या गेटिंग फ़ंक्शन इनपुट का मूल्यांकन करता है और एक बड़े पूल से केवल कुछ विशेषज्ञों, आमतौर पर एक या दो, का चयन करता है। यह घने मिश्रण-ऑफ-एक्सपर्ट्स के विपरीत है, जहां सभी विशेषज्ञ हर आउटपुट में योगदान करते हैं। रूटिंग निर्णय प्रति टोकन किया जाता है, जिससे इनपुट अनुक्रम के विभिन्न हिस्सों को विभिन्न विशेषज्ञों द्वारा संसाधित किया जा सकता है। यह डिज़ाइन मॉडल की कुल पैरामीटर संख्या बढ़ाता है जबकि प्रति टोकन कम्प्यूटेशनल लागत लगभग स्थिर रखता है, क्योंकि केवल चयनित विशेषज्ञ ही आगे और पीछे के पास के दौरान सक्रिय होते हैं।
यह अवधारणा 1990 के दशक में मिश्रण-ऑफ-एक्सपर्ट्स पर पहले के काम से उभरी, लेकिन स्पार्स रूटिंग 2010 और 2020 के दशक में व्यावहारिक रूप से महत्वपूर्ण बन गई, क्योंकि यह बड़े भाषा मॉडल को घने Transformer (architecture) आर्किटेक्चर की सीमाओं से परे स्केल करने का एक तरीका था। टोकन को विशेषज्ञों तक रूट करके, मॉडल डेटा में विविध पैटर्न को पकड़ सकते हैं बिना सभी पैरामीटर को हर इनपुट के लिए सक्रिय होने की आवश्यकता के। स्पार्स MoE रूटिंग अब कई प्रमुख उत्पादन मॉडलों का एक मुख्य घटक है, जिसमें Google DeepMind, OpenAI, और अन्य शोध संगठनों द्वारा विकसित मॉडल शामिल हैं।
ऐतिहासिक उत्पत्ति
मिश्रण-ऑफ-एक्सपर्ट्स का मूल विचार 1990 के दशक की शुरुआत में है। रॉबर्ट ए. जैकब्स, माइकल आई. जॉर्डन, स्टीवन जे. नोवलन, और जेफ्री ई. हिंटन सहित शोधकर्ताओं ने 1991 में स्थानीय विशेषज्ञों के अनुकूली मिश्रण आर्किटेक्चर पेश किया, जहां एक गेटिंग नेटवर्क कई विशेषज्ञ नेटवर्क के आउटपुट को भारित करता था। उसी समय के आसपास, जॉन हैम्पशायर और एलेक्स वाइबल द्वारा मेटा-पीआई नेटवर्क ने भाषण फोनेम वर्गीकरण के लिए एक समान भारित योजना लागू की, जिसमें छह जापानी वक्ताओं के डेटा पर छह समय-विलंबित तंत्रिका नेटवर्क प्रशिक्षित किए गए। इन शुरुआती प्रणालियों ने घने भारित का उपयोग किया, जिसका अर्थ है कि सभी विशेषज्ञ हर आउटपुट में योगदान करते थे, लेकिन उन्होंने मुख्य घटक स्थापित किए: विशेषज्ञ फ़ंक्शन, एक गेटिंग फ़ंक्शन, और एक भारित संयोजन।
स्पार्स रूटिंग, जहां केवल विशेषज्ञों का एक उपसमूह सक्रिय होता है, 1990 के दशक के अंत और 2000 के दशक की शुरुआत में खोजा गया था, लेकिन यह गहन शिक्षण के उदय के साथ गति पकड़ गया। 2017 में, Google DeepMind के शोधकर्ताओं ने स्पार्सली-गेटेड मिश्रण-ऑफ-एक्सपर्ट्स परत प्रकाशित की, जिसने एक प्रशिक्षण योग्य गेटिंग नेटवर्क पेश किया जो प्रत्येक इनपुट के लिए शीर्ष-के विशेषज्ञों का चयन करता था। इस काम ने प्रदर्शित किया कि स्पार्स सक्रियण कम्प्यूटेशन में आनुपातिक वृद्धि के बिना मॉडल क्षमता को नाटकीय रूप से बढ़ा सकता है, जिससे बाद के बड़े पैमाने के अनुप्रयोगों का मार्ग प्रशस्त हुआ।
रूटिंग तंत्र
एक स्पार्स MoE परत में, रूटिंग तंत्र में एक गेटिंग फ़ंक्शन होता है, आमतौर पर एक रैखिक परत जिसके बाद विशेषज्ञ आयाम पर सॉफ्टमैक्स होता है। एक इनपुट टोकन प्रतिनिधित्व \(x\) के लिए, राउटर प्रत्येक \(n\) विशेषज्ञ के लिए एक स्कोर की गणना करता है, अक्सर \(w(x)_i = \text{softmax}(W_g x)_i\) के रूप में, जहां \(W_g\) एक सीखने योग्य वजन मैट्रिक्स है। राउटर फिर उच्चतम स्कोर वाले शीर्ष-के विशेषज्ञों का चयन करता है, जहां k एक हाइपरपैरामीटर है, आमतौरन 1 या 2 पर सेट होता है। परत काआ आउटपुट चयनित विशेषज्ञों के आउटपुट काआ एक भारित योग है, जिसमें भार चयनित विशेषज्ञों के बीच सामान्यीकृत होते हैं।
यह परति-टोकन चयन मॉडल को विशेषीकरण करने की अनुमत देता है: विभिन्न विशेषज्ञ विभिन्न परकार के इनपुट, जैसे विभिन्न भाषाएं, डोमेन, या वाक्यगत संरचनाएं, कों सींखने के लए सींख सकते हैं। रूटिंग निर्णय अनुमान के दौरान निर्धारक है, लेकिन प्रशिक्षण के दौरान, राउटर को विशेषज्ञों के साथ संयुक्त रूप से प्रशिक्षित किया जाना चाहिए। क्योंकि शीर्ष-के चयन गैर-विभेदनीय है, शोधकर्ता सीधे-थ्रू अनुमानक या शोर शीर्ष-के गेटिंग जैसी तकनीकों का उपयोग करते हैं, जो प्रशिक्षण के दौरान लॉगिट्स में सीखने योग्य शोर जोड़ता है ताकि अन्वेषण और लोड संतुलन को प्रोत्साहित किया जा सके।
लोड संतुलन और सहायक हानियाँ
स्पार्स MoE रूटिंग में एक प्रमुख चुनौती यह सुनिश्चित करना है कि विशेषज्ञों का उपयोग लगभग समान रूप से किया जाए। हस्तक्षेप के बिना, राउटर एक ऐसी स्थिति में परिवर्तित हो सकता है जहां कुछ विशेषज्ञ अधिकांश टोकन प्राप्त करते हैं, जबकि अन्य अप्रयुक्त रहते हैं, जिससे प्रभावी क्षमता कम हो जाती है। इसे संबोधित करने के लिए, मॉडल सहायक लोड-संतुलन हानियों को शामिल करते हैं जो विशेषज्ञों में असंतुलित टोकन वितरण को दंडित करते हैं। Google (AI) शोधकर्ताओं द्वारा 2021 में पेश किया गया एक सामान्य दृष्टिकोण, स्विच ट्रांसफॉर्मर, प्रत्येक विशेषज्ञ को रूट किए गए टोकन के अंश को उस विशेषज्ञ के लिए औसत राउटर संभावना से गुणा करने के आनुपातिक हानि शब्द जोड़ता है। यह राउटर को टोकन को अधिक समान रूप से वितरित करने के लिए प्रोत्साहित करता है।
एक और तकनीक विशेषज्ञ क्षमता है, जो किसी दिए गए बैच में प्रत्येक विशेषज्ञ द्वारा संसाधित किए जा सकने वाले टोकन की संख्या को सीमित करती है। यदि कोई विशेषज्ञ अपनी क्षमता तक पहुंचता है, तो अतिरिक्त टोकन या तो छोड़ दिए जाते हैं या अवशिष्ट कनेक्शन पर रूट किए जाते हैं। यह किसी भी एक विशेषज्ञ को बाधा बनने से रोकता है और पूर्वानुमानित कम्प्यूटेशन सुनिश्चित करता है। हाल के तरीके, जैसे कि DeepSeek-V3 (2024) में उपयोग की जाने वाली सहायक-हानि-मुक्त रूटिंग, स्पष्ट सहायक हानियों के बिना लोड को संतुलित करने के लिए गतिशील पूर्वाग्रह समायोजन का उपयोग करते हैं।
स्केलिंग और दक्षता
स्पार्स MoE रूटिंग मॉडल पैरामीटर को घने मॉडल की तुलना में कहीं अधिक स्केल करने में सक्षम बनाती है। उदाहरण के लिए, स्विच ट्रांसफॉर्मर ने 1.6 ट्रिलियन पैरामीटर तक के मॉडल पेश किए, फिर भी प्रत्येक टोकन ने उनमें से केवल एक छोटा सा अंश सक्रिय किया। इसी तरह, मिस्ट्रल एआई द्वारा 2023 में जारी Mixtral 8x7B, प्रति परत आठ विशेषज्ञों का उपयोग करता है जिसमें प्रति टोकन दो सक्रिय होते हैं, जो बड़े घने मॉडल के बराबर प्रदर्शन प्राप्त करता है जबकि प्रति टोकन कम कम्प्यूटेशन का उपयोग करता है। गूगल के GShard (2020) ने मशीन अनुवाद के लिए स्पार्स MoE लागू किया, और बाद के मॉडल जैसे GLaM (2021) और PaLM (2022) ने दक्षता के लिए MoE परतों को शामिल किया।
दक्षता लाभ इस तथ्य से आते हैं कि प्रति टोकन कम्प्यूटेशनल लागत सक्रिय विशेषज्ञों की संख्या के साथ स्केल होती है, कुल पैरामीटर संख्या के साथ नहीं। यह मॉडल को अधिक पैरामीटर रखने की अनुमति देता है, जो सटीकता में सुधार कर सकता है, जबकि अनुमान और प्रशिक्षण लागत को प्रबंधनीय रखता है। हालांकि, स्पार्स MoE मॉडल को सभी विशेषज्ञ पैरामीटर संग्रहीत करने के लिए अधिक मेमोरी की आवश्यकता होती है, और वे वितरित प्रशिक्षण में संचार ओवरहेड पेश करते हैं, क्योंकि टोकन को उन विशेषज्ञों तक रूट किया जाना चाहिए जो विभिन्न उपकरणों पर रह सकते हैं।
बड़े भाषा मॉडल में अनुप्रयोग
स्पार्स MoE रूटिंग बड़े भाषा मॉडल में एक मानक तकनीक बन गई है। कई खुले-वजन और मालिकाना मॉडल गुणवत्ता और लागत को संतुलित करने के लिए MoE परतों का उपयोग करते हैं। उदाहरण के लिए, मिस्ट्रल एआई से Mixtral 8x7B और Mixtral 8x22B, अलीबाबा से Qwen1.5-MoE, और DeepSeek से DeepSeek-V2 और V3 सभी स्पार्स रूटिंग का उपयोग करते हैं। मालिकाना क्षेत्र में, OpenAI के GPT-4 को व्यापक रूप से मिश्रण-ऑफ-एक्सपर्ट्स आर्किटेक्चर का उपयोग करने की सूचना है, हालांकि कंपनी ने विवरण की पुष्टि नहीं की है। Anthropic के क्लॉड मॉडल और गूगल के जेमिनी मॉडल में भी सार्वजनिक बयानों और पेटेंट के आधार पर MoE परतें शामिल होने की संभावना है।
ये मॉडल डोमेन, भाषाओं, या तर्क कार्यों में विशेषज्ञों को विशेषज्ञ बनाने के लिए रूटिंग का उपयोग करते हैं। उदाहरण के लिए, कुछ विशेषज्ञ गणितीय तर्क को संभाल सकते हैं, जबकि अन्य कोड निर्माण या बहुभाषी पाठ पर ध्यान केंद्रित करते हैं। राउटर इनपुट संदर्भ के आधार पर टोकन को उपयुक्त विशेषज्ञों तक निर्देशित करना सीखता है, बिना सभी विशेषज्ञों को हर टोकन संसाधित करने की आवश्यकता के समग्र प्रदर्शन में सुधार करता है।
प्रशिक्षण चुनौतियाँ
स्पार्स MoE मॉडल प्रशिक्षण लोड संतुलन से परे अद्वितीय चुनौतियाँ प्रस्तुत करता है। राउटर अस्थिरता से पीड़ित हो सकता है, जहां पैरामीटर में छोटे परिवर्तन रूटिंग निर्णयों में बड़े बदलाव लाते हैं, जिससे प्रशिक्षण विचलन होता है। शोर शीर्ष-के गेटिंग और राउटर पर ड्रॉपआउट जैसी तकनीकें प्रशिक्षण कों सथिर करने में मदद करती हैं। इसके अतिरिक्त, विशेषज्ञ बहुत जलदी विशेषीकृत हों सकते हैं, जिससे मोड पतन का एक रूप होंता है जहां मॉडल सामान्यीकरण करने में विफल रहता है। शोधकर्ताओं ने इसे कम करने के लिए विशेषज्ञ ड्रॉपआउट और रूटिंग नियमितीकरण जैसे तरीके प्रस्तावित किए हैं।
एक और चुनौती वितरित प्रशिक्षण में संचार ओवरहेड है। एक विशिष्ट सेटअप में, प्रत्येक विशेषज्ञ को एक अलग डिवाइस पर रखा जाता है, और टोकन को उनके मूल डिवाइस से चयनित विशेषज्ञ को होस्ट करने वाले डिवाइस पर भेजा जाना चाहिए। यह सभी-से-सभी संचार बाधा बन सकता है, विशेष रूप से बड़े बैच आकारों के लिए। मेगाट्रॉन और डीपस्पीड लाइब्रेरीज़ में कुशल कार्यान्वयन इस ओवरहेड को कम करने के लिए अनुकूलित संचार शेड्यूल का उपयोग करते हैं।
हाल के विकास
हाल के शोध ने रूटिंग गुणवत्ता में सुधार और MoE मॉडल की लागत को कम करने पर ध्यान केंद्रित किया है। मिश्रण-ऑफ-डेप्थ्स (2024) दृष्टिकोण स्पार्सिटी के विचार को गहराई आयाम तक विस्तारित करता है, टोकन को न केवल विभिन्न विशेषज्ञों तक रूट करता है बल्कि परतों को पूरी तरह से छोड़ भी देता है। एक और दिशा बारीक-दानेदार विशेषज्ञ विभाजन है, जहां विशेषज्ञ छोटे और अधिक संख्या में होते हैं, जिससे बारीक-दानेदार विशेषज्ञता की अनुमति मिलती है। DeepSeek-V3, उदाहरण के लिए, प्रति परत 256 विशेषज्ञों का उपयोग करता है जिसमें केवल 8 सक्रिय होते हैं, जो कम प्रशिक्षण लागत पर अत्याधुनिक प्रदर्शन प्राप्त करता है।
हार्डवेयर और सॉफ्टवेयर सह-डिज़ाइन भी उन्नत हुआ है। NVIDIA और AMD जैसी कंपनियों ने MoE अनुमान के लिए अपने त्वरक को अनुकूलित किया है, और vLLM और TensorRT-LLM जैसे फ्रेमवर्क कुशल MoE सेवा का समर्थन करते हैं। एज डिप्लॉयमेंट में बढ़त रुचि ने MoE मॉडल कों सींकड़ने पर शोध कों जनम दिया है, जैसे विशेषज्ञ छंटाई और क्वांटीकरण, सीमित मेमोरी वाले उपकरणों पर फिट होने के लिए।
भविष्य की दिशाएँ
स्पार्स MoE रूटिंग अनुसंधान का एक सक्रिय क्षेत्र बना हुआ है। खुले प्रश्नों में शामिल हैं कि विशेषज्ञों की इष्टतम संख्या और रूटिंग ग्रैन्युलैरिटी को स्वचालित रूप से कैसे निर्धारित किया जाए, रूटिंग को अधिक व्याख्यात्मक कैसे बनाया जाये, और MoE कों Model Pruning और क्वांटीकरण जैसी अन्य दक्षता तकनीकों के साथ कैसे जोड़ा जाए। जैसे-जैसे मॉडल स्केल करते रहते हैं, स्पार्स रूटिंग क्षमता और कम्प्यूटेशनल लागत को संतुलित करने में केंद्रीय भूमिका निभाएगी, जिससे निषेधात्मक संसाधन मांगों के बिना अधिक शक्तिशाली AI सिस्टम सक्षम होंगे।