मिश्रण ऑफ एक्सपर्ट्स (MoE) रूटिंग Machine learning में एक तकनीक है जहाँ एक तंत्रिका नेटवर्क में कई विशेषीकृत उप-नेटवर्क होते हैं, जिन्हें एक्सपर्ट कहा जाता है, और एक गेटिंग तंत्र होता है जो प्रत्येक इनपुट के लिए चुनता है कि कौन से एक्सपर्ट सक्रिय हों। आधुनिक Deep learning के संदर्भ में, रूटिंग अक्सर स्पार्स होती है: प्रत्येक टोकन या इनपुट के लिए, केवल एक छोटा सबसेट एक्सपर्ट का उपयोग किया जाता है, जो मॉडल को बहुत बड़ी कुल पैरामीटर संख्या रखने की अनुमति देता है जबकि प्रति अनुमान की कम्प्यूटेशनल लागत समान आकार के डेंस मॉडल से कम रहती है। यह दृष्टिकोण बड़े भाषा मॉडल और अन्य जनरेटिव AI प्रणालियों को स्केल करने का आधार बन गया है।
यह अवधारणा शास्त्रीय एन्सेम्बल लर्निंग से उत्पन्न हुई है, जहाँ कई शिक्षार्थी एक समस्या स्थान को सजातीय क्षेत्रों में विभाजित करते हैं। 1990 के दशक में प्रारंभिक कार्य, जैसे कि मेटा-पाई नेटवर्क और स्थानीय एक्सपर्ट्स के अनुकूली मिश्रण, ने सैद्धांतिक आधार रखा। आधुनिक कार्यान्वयनों में, MoE रूटिंग आमतौर पर Transformer (architecture) आर्किटेक्चर में एकीकृत होती है, जहाँ फीड-फॉरवर्ड परतों को एक्सपर्ट नेटवर्क के सेट और एक राउटर द्वारा प्रतिस्थापित किया जाता है जो टोकन को सबसे प्रासंगिक एक्सपर्ट्स को भेजता है। यह डिज़ाइन Google DeepMind और अन्य प्रयोगशालाओं द्वारा विकसित मॉडलों को कुशल प्रशिक्षण और अनुमान के साथ अत्याधुनिक प्रदर्शन प्राप्त करने में सक्षम बनाता है।
ऐतिहासिक उत्पत्ति
MoE रूटिंग की जड़ें 1990 के दशक की शुरुआत में जाती हैं, जब शोधकर्ताओं ने कमेटी मशीनों और एन्सेम्बल विधियों का पता लगाया। एक उल्लेखनीय प्रारंभिक प्रणाली मेटा-पाई नेटवर्क थी, जिसे हैम्पशायर और वाइबेल द्वारा रिपोर्ट किया गया था, जिसने वेटिंग फ़ंक्शन का उपयोग करके कई समय-विलंबित तंत्रिका नेटवर्कों के आउटपुट को संयोजित किया। छह जापानी वक्ताओं से फोनेम वर्गीकरण पर उनके प्रयोगों में, उन्होंने छह एक्सपर्ट्स को प्रशिक्षित किया और पाया कि गेटिंग फ़ंक्शन ने प्रति वक्ता एक एक्सपर्ट समर्पित करना सीखा, एक पुरुष वक्ता को छोड़कर जिसकी आवाज़ अन्य पुरुष एक्सपर्ट्स के रैखिक संयोजन द्वारा संभाली गई थी। इसने इनपुट स्थान के विभिन्न क्षेत्रों पर एक्सपर्ट्स को विशेषज्ञ बनाने की MoE की क्षमता प्रदर्शित की।
एक और आधारभूत कार्य स्थानीय एक्सपर्ट्स के अनुकूली मिश्रण था, जिसने गाऊसी मिश्रण मॉडल का उपयोग किया जहाँ प्रत्येक एक्सपर्ट ने एक सरल गाऊसी वितरण की भविष्यवाणी की। गेटिंग फ़ंक्शन एक रैखिक-सॉफ्टमैक्स फ़ंक्शन था जो इनपुट के आधार पर वेट असाइन करता था। इन प्रारंभिक मॉडलों ने MoE के मुख्य घटकों की स्थापना की: एक्सपर्ट्स का सेट, एक गेटिंग फ़ंक्शन, और ग्रेडिएंट डिसेंट पर आधारित प्रशिक्षण प्रक्रिया।
स्पार्स गेटिंग और आधुनिक रूटिंग
आधुनिक MoE रूटिंग, जैसा कि बड़े पैमाने के तंत्रिका नेटवर्क में उपयोग होता है, स्पार्स गेटिंग का उपयोग करती है। सभी एक्सपर्ट्स के भारित योग की गणना करने के बजाय, राउटर प्रत्येक टोकन के लिए केवल शीर्ष-के एक्सपर्ट्स (अक्सर के=1 या के=2) का चयन करता है। यह स्पार्सिटी दक्षता के लिए महत्वपूर्ण है: यदि सभी एक्सपर्ट्स सक्रिय होते, तो कम्प्यूटेशनल लागत एक्सपर्ट्स की संख्या के साथ रैखिक रूप से बढ़ती, जिससे उद्देश्य विफल हो जाता। स्पार्स रूटिंग मॉडल को सैकड़ों या हजारों एक्सपर्ट्स रखने की अनुमति देती है जबकि प्रति टोकन केवल कुछ सक्रिय होते हैं, जिससे प्रति टोकन फ्लोटिंग-पॉइंट ऑपरेशन प्रबंधनीय रहते हैं।
रूटिंग फ़ंक्शन आमतौर पर एक सीखी गई रैखिक परत होती है जिसके बाद एक्सपर्ट सेट पर सॉफ्टमैक्स होता है। प्रशिक्षण के दौरान, राउटर टोकन के प्रतिनिधित्व के आधार पर टोकन को एक्सपर्ट्स को असाइन करना सीखता है। हालाँकि, भोली स्पार्स रूटिंग लोड असंतुलन का कारण बन सकती है, जहाँ कुछ एक्सपर्ट्स को अधिकांश टोकन मिलते हैं जबकि अन्य कम उपयोग में रहते हैं। इसे संबोधित करने के लिए, आधुनिक कार्यान्वयन सहायक लॉस का उपयोग करते हैं जो संतुलित रूटिंग को प्रोत्साहित करते हैं, जैसे कि स्विच ट्रांसफॉर्मर में पेश किया गया लोड-बैलेंसिंग लॉस।
ट्रांसफॉर्मर्स के साथ एकीकरण
Transformer (architecture)-आधारित मॉडलों में, MoE रूटिंग सबसे आमतौर पर फीड-फॉरवर्ड नेटवर्क (FFN) उपपरत पर लागू होती है। एक मानक ट्रांसफॉर्मर में, प्रत्येक टोकन एक डेंस FFN से गुजरता है। एक MoE ट्रांसफॉर्मर में, FFN को एक्सपर्ट FFN के सेट द्वारा प्रतिस्थापित किया जाता है, और एक राउटर तय करता है कि कौन से एक्सपर्ट प्रत्येक टोकन को संसाधित करते हैं। यह डिज़ाइन स्विच ट्रांसफॉर्मर द्वारा लोकप्रिय बनाया गया था, जिसे Google DeepMind के शोधकर्ताओं ने 2021 में पेश किया, और इसने बड़े मॉडलों के प्रशिक्षण में महत्वपूर्ण गति प्राप्त की। एक और प्रभावशाली आर्किटेक्चर GShard फ्रेमवर्क में मिश्रण ऑफ एक्सपर्ट्स परत है, जिसने कुशल बहुभाषी मशीन अनुवाद को सक्षम किया।
ये MoE ट्रांसफॉर्मर कई बड़े भाषा मॉडलों में अपनाए गए हैं, जिनमें OpenAI, Anthropic, और अन्य संगठनों के मॉडल शामिल हैं। उदाहरण के लिए, GPT-4 और क्लॉड जैसे मॉडलों में MoE आर्किटेक्चर का उपयोग होने की रिपोर्ट है, हालाँकि सटीक विवरण अक्सर मालिकाना होते हैं। रूटिंग तंत्र इन मॉडलों को खरबों पैरामीटर तक स्केल करने की अनुमति देता है जबकि उचित अनुमान लागत बनाए रखता है।
रूटिंग एल्गोरिदम और लोड बैलेंसिंग
MoE की दक्षता और प्रभावशीलता में सुधार के लिए कई रूटिंग एल्गोरिदम विकसित किए गए हैं। सबसे आम शीर्ष-के रूटिंग है, जहाँ राउटर उच्चतम गेटिंग स्कोर वाले के एक्सपर्ट्स का चयन करता है। विविधताओं में शोरगुल वाली शीर्ष-के रूटिंग शामिल है, जो अन्वेषण को प्रोत्साहित करने के लिए प्रशिक्षण के दौरान गेटिंग स्कोर में शोर जोड़ती है, और एक्सपर्ट चॉइस रूटिंग, जहाँ प्रत्येक एक्सपर्ट टोकन चुनने के बजाय शीर्ष टोकन का चयन करता है। बाद वाला, जिसे 2022 में Google शोधकर्ताओं द्वारा प्रस्तावित किया गया, लोड संतुलन और प्रशिक्षण स्थिरता में सुधार कर सकता है।
लोड बैलेंसिंग एक महत्वपूर्ण चुनौती है। स्पष्ट तंत्र के बिना, राउटर हमेशा एक ही एक्सपर्ट का चयन करने के लिए ढह सकता है, जिससे खराब उपयोग होता है। स्विच ट्रांसफॉर्मर ने एक सहायक लॉस पेश किया जो टोकन असाइनमेंट में असंतुलन को दंडित करता है। अन्य विधियों में विभेदक हैशिंग और पदानुक्रमित रूटिंग शामिल हैं, जहाँ एक पहले-स्तरीय राउटर एक्सपर्ट्स का समूह चुनता है और एक दूसरे-स्तरीय राउटर समूह के भीतर चयन करता है।
बड़े भाषा मॉडलों में अनुप्रयोग
MoE रूटिंग बड़े भाषा मॉडलों को स्केल करने में एक मानक तकनीक बन गई है। यह मॉडलों को भारी संख्या में पैरामीटर (जैसे, 1 ट्रिलियन) रखने की अनुमति देता है जबकि प्रत्येक टोकन के लिए केवल एक अंश का उपयोग करता है, जो उत्पादन वातावरण में मॉडलों की सेवा के लिए आवश्यक है। OpenAI, Anthropic, और Google DeepMind जैसी कंपनियों ने MoE को अपने प्रमुख मॉडलों में एकीकृत किया है। उदाहरण के लिए, मिस्ट्रल AI का मिक्सट्रल मॉडल 8 एक्सपर्ट्स के साथ एक स्पार्स MoE आर्किटेक्चर का उपयोग करता है, प्रति टोकन 2 सक्रिय करता है, और बहुत बड़े डेंस मॉडलों के साथ प्रतिस्पर्धी प्रदर्शन प्राप्त करता है।
भाषा मॉडलों के अलावा, MoE रूटिंग का उपयोग कंप्यूटर विज़न और भाषण पहचान जैसे अन्य डोमेन में भी किया जाता है। उदाहरण के लिए, V-MoE मॉडल विज़न ट्रांसफॉर्मर्स पर MoE लागू करता है, और GShard आर्किटेक्चर का उपयोग तंत्रिका मशीन अनुवाद के लिए किया गया है। यह तकनीक Amazon Web Services और Google Cloud ऑफ़रिंग के लिए भी प्रासंगिक है, जो MoE मॉडलों के प्रशिक्षण और सेवा के लिए बुनियादी ढाँचा प्रदान करते हैं।
चुनौतियाँ और भविष्य की दिशाएँ
अपने लाभों के बावजूद, MoE रूटिंग कई चुनौतियाँ प्रस्तुत करती है। एक प्रमुख मुद्दा मेमोरी खपत है: सभी एक्सपर्ट पैरामीटर मेमोरी में संग्रहीत होने चाहिए, भले ही केवल कुछ सक्रिय हों। इसके लिए परिष्कृत मॉडल समानांतरता और मेमोरी प्रबंधन की आवश्यकता होती है, अक्सर एक्सपर्ट समानांतरता और ऑफलोडिंग जैसी तकनीकों का उपयोग करते हुए। एक और चुनौती प्रशिक्षण अस्थिरता है, क्योंकि राउटर और एक्सपर्ट्स फीडबैक लूप में प्रवेश कर सकते हैं जो दोलन का कारण बनते हैं। शोधकर्ताओं ने विभिन्न स्थिरीकरण तकनीकों का प्रस्ताव किया है, जैसे ग्रेडिएंट क्लिपिंग और सावधानीपूर्वक आरंभीकरण।
भविष्य की दिशाओं में अधिक कुशल रूटिंग एल्गोरिदम, बेहतर लोड बैलेंसिंग, और एक्सपर्ट्स के मेमोरी फुटप्रिंट को कम करने के तरीके शामिल हैं। MoE को अधिक व्याख्यात्मक बनाने पर भी चल रहे शोध हैं, क्योंकि रूटिंग निर्णय अंतर्दृष्टि प्रदान कर सकते हैं कि मॉडल कैसे विशेषज्ञ बनते हैं। 2025 तक, MoE रूटिंग अनुसंधान का एक सक्रिय क्षेत्र बना हुआ है, जिसमें नए आर्किटेक्चर और तकनीकें नियमित रूप से उभर रही हैं।
निष्कर्ष
मिश्रण ऑफ एक्सपर्ट्स रूटिंग प्रति इनपुट एक्सपर्ट्स के सबसेट को चुनिंदा रूप से सक्रिय करके तंत्रिका नेटवर्क को स्केल करने की एक शक्तिशाली तकनीक है। एन्सेम्बल लर्निंग में अपनी प्रारंभिक जड़ों से लेकर ट्रांसफॉर्मर्स में आधुनिक एकीकरण तक, MoE ने अत्यंत बड़े मॉडलों के विकास को सक्षम किया है जो कुशल और सक्षम दोनों हैं। जैसे-जैसे बड़े और अधिक सक्षम AI प्रणालियों की मांग बढ़ती है, MoE रूटिंग Artificial intelligence के विकास में केंद्रीय भूमिका निभाती रहेगी।