मिश्रण ऑफ़ एक्सपर्ट्स, जिसे आमतौर पर MoE के रूप में संक्षिप्त किया जाता है, एक तंत्रिका नेटवर्क वास्तुकला है जिसमें एक मॉडल में कई विशेष उपनेटवर्क होते हैं, जिन्हें एक्सपर्ट्स कहा जाता है, लेकिन किसी भी दिए गए इनपुट के लिए उनमें से केवल एक छोटा सा उपसमूह सक्रिय होता है। एक रूटिंग तंत्र, आमतौर पर अपना स्वयं का एक छोटा सीखा हुआ नेटवर्क, प्रत्येक इनपुट की जांच करता है, जैसे कि ट्रांसफॉर्मर परत में एक टोकन, और तय करता है कि कौन से एक्सपर्ट्स को इसे संसाधित करना चाहिए। यह स्पार्स सक्रियण पैटर्न मॉडल में कुल पैरामीटरों की संख्या को बहुत बड़ा बढ़ाने की अनुमति देता है, जबकि प्रत्येक टोकन को संसाधित करने के लिए आवश्यक गणना की मात्रा बहुत छोटी रहती है, क्योंकि किसी विशेष इनपुट के लिए मॉडल के अधिकांश पैरामीटर निष्क्रिय रहते हैं।
मूल विचार 1990 के दशक की शुरुआत में स्थानीय एक्सपर्ट्स के अनुकूली मिश्रणों पर प्रारंभिक कार्य से जुड़ा है, जो गहन शिक्षण युग से बहुत पहले का है, लेकिन इसे बड़े ट्रांसफॉर्मर-आधारित मॉडलों के उदय के साथ पुनर्जीवित किया गया और काफी हद तक बढ़ाया गया। गूगल के शोधकर्ताओं ने 2010 के दशक के अंत में बड़े भाषा मॉडलों में एकीकृत स्पार्सली-गेटेड मिश्रण-ऑफ़-एक्सपर्ट्स परतों का प्रदर्शन किया, और यह दृष्टिकोण 2020 के दशक की शुरुआत में बड़े भाषा मॉडल क्षमता को बढ़ाने के तरीके के रूप में व्यापक रूप से अपनाया गया। मिस्ट्रल एआई के मिक्स्ट्रल मॉडल, दिसंबर 2023 में जारी, सबसे बड़ी प्रयोगशालाओं के बाहर इस दृष्टिकोण के सबसे प्रमुख खुले प्रदर्शनों में से थे, और MoE वास्तुकलाएं व्यापक रूप से मानी जाती थीं, हालांकि हमेशा आधिकारिक रूप से पुष्टि नहीं की गई थी, कि प्रमुख प्रयोगशालाओं के कुछ सबसे बड़े फ्रंटियर मॉडलों के अंतर्निहित डिजाइन का हिस्सा थीं, जिनमें GPT-4 के डिजाइन के रिपोर्ट किए गए पहलू शामिल हैं।
यह कैसे काम करता है
एक विशिष्ट MoE ट्रांसफॉर्मर में, प्रत्येक ट्रांसफॉर्मर ब्लॉक में पाई जाने वाली मानक घनी फीड-फॉरवर्ड परत को समानांतर एक्सपर्ट उपनेटवर्कों के एक सेट से बदल दिया जाता है, अक्सर आठ से लेकर कई सौ तक की संख्या में, साथ ही एक गेटिंग या रूटर नेटवर्क। परत से गुजरने वाले प्रत्येक टोकन के लिए, रूटर हर एक्सपर्ट के लिए एक स्कोर की गणना करता है और केवल शीर्ष कुछ, आमतौर पर एक या दो, को उस टोकन को वास्तव में संसाधित करने के लिए चुनता है; चयनित एक्सपर्ट्स के आउटपुट फिर संयुक्त होते हैं, अक्सर रूटर के आत्मविश्वास द्वारा भारित, परत का आउटपुट उत्पन्न करने के लिए। क्योंकि प्रति टोकन केवल एक अंश एक्सपर्ट्स का उपयोग किया जाता है, किसी एकल फॉरवर्ड पास के लिए सक्रिय, या "सक्रिय", पैरामीटर गिनती मॉडल की कुल पैरामीटर गिनती से कहीं छोटी हो सकती है, जिससे सैकड़ों अरब कुल पैरामीटरों वाला मॉडल इन्फ्रेंस के लिए बहुत छोटे घने मॉडल की कम्प्यूटेशनल लागत पर लगभग चल सकता है।
लाभ और व्यापार-अप
MoE का मुख्य लाभ कुल मॉडल क्षमता को प्रति-टोकन कम्प्यूटेशनल लागत से अलग करना है, जिससे एक मॉडल अपने कई एक्सपर्ट्स में अधिक ज्ञान और विशेष क्षमता संग्रहीत कर सकता है, बिना इसके उपयोग की लागत में आनुपातिक वृद्धि के। इसने MoE को प्रशिक्षण दक्षता के लिए आकर्षक बना दिया है, क्योंकि एक निश्चित कम्प्यूटेशनल बजट के तहत बड़ी प्रभावी क्षमता तक पहुंचा जा सकता है, और सेवा के समय इन्फ्रेंस दक्षता के लिए भी। हालांकि, व्यापार-अप वास्तविक हैं: MoE मॉडलों को सभी एक्सपर्ट्स को रखने के लिए काफी अधिक कुल मेमोरी की आवश्यकता होती है, भले ही प्रति टोकन केवल कुछ का उपयोग किया जाता है, जो लागत का बोझ कच्ची गणना के बजाय मेमोरी और भंडारण की ओर स्थानांतरित करता है; रूटिंग प्रशिक्षण के दौरान अस्थिर या असंतुलित हो सकती है, कुछ एक्सपर्ट्स को बहुत अधिक ट्रैफिक मिलता है जब तक कि विशिष्ट लोड-संतुलन तकनीकों का उपयोग नहीं किया जाता; और MoE मॉडल ऐतिहासिक रूप से समकक्ष रूप से सक्षम घने मॉडलों की तुलना में कई एक्सेलेरेटरों में कुशलतापूर्वक प्रशिक्षित और सेवा करने के लिए अधिक जटिल रहे हैं।
अपनाना
2024 और 2025 तक, मिश्रण-ऑफ़-एक्सपर्ट्स खुले-वजन और बंद फ्रंटियर दोनों मॉडलों के बीच एक सामान्य वास्तुकला विकल्प बन गया था, जो सिस्टम में प्रकट हुआ, जिसमें DeepSeek-R1, कई Qwen वेरिएंट, और Grok शामिल हैं, आम तौर पर बहुत बड़े कुल पैरामीटर गिनती तक पहुंचने के तरीके के रूप में, अक्सर सैकड़ों अरबों में, जबकि प्रति टोकन सक्रिय गणना को बहुत अधिक मामूली और सेवा योग्य सीमा में रखा जाता है। तकनीक को अक्सर क्वांटाइजेशन और डिस्टिलेशन के साथ चर्चा की जाती है, जो प्रयोगशालाएं बहुत बड़े भाषा मॉडलों को पैमाने पर सेवा देने की लागत का प्रबंधन करने के लिए उपयोग करने वाले मुख्य लीवर में से एक हैं।