अंग्रेज़ी से अनुवादित

एक तंत्रिका नेटवर्क वास्तुकला जो प्रत्येक इनपुट को विशेषज्ञों कहे जाने वाले विशेष उपनेटवर्कों के एक छोटे उपसमूह तक पहुंचाती है, जो एक बहुत बड़े पूल से लिया जाता है, जिससे कुल पैरामीटर गणना बिना प्रति टोकन कंप्यूट में आनुपातिक वृद्धि के बढ़ सकती है।

मिश्रण ऑफ़ एक्सपर्ट्स, जिसे आमतौर पर MoE के रूप में संक्षिप्त किया जाता है, एक तंत्रिका नेटवर्क वास्तुकला है जिसमें एक मॉडल में कई विशेष उपनेटवर्क होते हैं, जिन्हें एक्सपर्ट्स कहा जाता है, लेकिन किसी भी दिए गए इनपुट के लिए उनमें से केवल एक छोटा सा उपसमूह सक्रिय होता है। एक रूटिंग तंत्र, आमतौर पर अपना स्वयं का एक छोटा सीखा हुआ नेटवर्क, प्रत्येक इनपुट की जांच करता है, जैसे कि ट्रांसफॉर्मर परत में एक टोकन, और तय करता है कि कौन से एक्सपर्ट्स को इसे संसाधित करना चाहिए। यह स्पार्स सक्रियण पैटर्न मॉडल में कुल पैरामीटरों की संख्या को बहुत बड़ा बढ़ाने की अनुमति देता है, जबकि प्रत्येक टोकन को संसाधित करने के लिए आवश्यक गणना की मात्रा बहुत छोटी रहती है, क्योंकि किसी विशेष इनपुट के लिए मॉडल के अधिकांश पैरामीटर निष्क्रिय रहते हैं।

मूल विचार 1990 के दशक की शुरुआत में स्थानीय एक्सपर्ट्स के अनुकूली मिश्रणों पर प्रारंभिक कार्य से जुड़ा है, जो गहन शिक्षण युग से बहुत पहले का है, लेकिन इसे बड़े ट्रांसफॉर्मर-आधारित मॉडलों के उदय के साथ पुनर्जीवित किया गया और काफी हद तक बढ़ाया गया। गूगल के शोधकर्ताओं ने 2010 के दशक के अंत में बड़े भाषा मॉडलों में एकीकृत स्पार्सली-गेटेड मिश्रण-ऑफ़-एक्सपर्ट्स परतों का प्रदर्शन किया, और यह दृष्टिकोण 2020 के दशक की शुरुआत में बड़े भाषा मॉडल क्षमता को बढ़ाने के तरीके के रूप में व्यापक रूप से अपनाया गया। मिस्ट्रल एआई के मिक्स्ट्रल मॉडल, दिसंबर 2023 में जारी, सबसे बड़ी प्रयोगशालाओं के बाहर इस दृष्टिकोण के सबसे प्रमुख खुले प्रदर्शनों में से थे, और MoE वास्तुकलाएं व्यापक रूप से मानी जाती थीं, हालांकि हमेशा आधिकारिक रूप से पुष्टि नहीं की गई थी, कि प्रमुख प्रयोगशालाओं के कुछ सबसे बड़े फ्रंटियर मॉडलों के अंतर्निहित डिजाइन का हिस्सा थीं, जिनमें GPT-4 के डिजाइन के रिपोर्ट किए गए पहलू शामिल हैं।

यह कैसे काम करता है

एक विशिष्ट MoE ट्रांसफॉर्मर में, प्रत्येक ट्रांसफॉर्मर ब्लॉक में पाई जाने वाली मानक घनी फीड-फॉरवर्ड परत को समानांतर एक्सपर्ट उपनेटवर्कों के एक सेट से बदल दिया जाता है, अक्सर आठ से लेकर कई सौ तक की संख्या में, साथ ही एक गेटिंग या रूटर नेटवर्क। परत से गुजरने वाले प्रत्येक टोकन के लिए, रूटर हर एक्सपर्ट के लिए एक स्कोर की गणना करता है और केवल शीर्ष कुछ, आमतौर पर एक या दो, को उस टोकन को वास्तव में संसाधित करने के लिए चुनता है; चयनित एक्सपर्ट्स के आउटपुट फिर संयुक्त होते हैं, अक्सर रूटर के आत्मविश्वास द्वारा भारित, परत का आउटपुट उत्पन्न करने के लिए। क्योंकि प्रति टोकन केवल एक अंश एक्सपर्ट्स का उपयोग किया जाता है, किसी एकल फॉरवर्ड पास के लिए सक्रिय, या "सक्रिय", पैरामीटर गिनती मॉडल की कुल पैरामीटर गिनती से कहीं छोटी हो सकती है, जिससे सैकड़ों अरब कुल पैरामीटरों वाला मॉडल इन्फ्रेंस के लिए बहुत छोटे घने मॉडल की कम्प्यूटेशनल लागत पर लगभग चल सकता है।

लाभ और व्यापार-अप

MoE का मुख्य लाभ कुल मॉडल क्षमता को प्रति-टोकन कम्प्यूटेशनल लागत से अलग करना है, जिससे एक मॉडल अपने कई एक्सपर्ट्स में अधिक ज्ञान और विशेष क्षमता संग्रहीत कर सकता है, बिना इसके उपयोग की लागत में आनुपातिक वृद्धि के। इसने MoE को प्रशिक्षण दक्षता के लिए आकर्षक बना दिया है, क्योंकि एक निश्चित कम्प्यूटेशनल बजट के तहत बड़ी प्रभावी क्षमता तक पहुंचा जा सकता है, और सेवा के समय इन्फ्रेंस दक्षता के लिए भी। हालांकि, व्यापार-अप वास्तविक हैं: MoE मॉडलों को सभी एक्सपर्ट्स को रखने के लिए काफी अधिक कुल मेमोरी की आवश्यकता होती है, भले ही प्रति टोकन केवल कुछ का उपयोग किया जाता है, जो लागत का बोझ कच्ची गणना के बजाय मेमोरी और भंडारण की ओर स्थानांतरित करता है; रूटिंग प्रशिक्षण के दौरान अस्थिर या असंतुलित हो सकती है, कुछ एक्सपर्ट्स को बहुत अधिक ट्रैफिक मिलता है जब तक कि विशिष्ट लोड-संतुलन तकनीकों का उपयोग नहीं किया जाता; और MoE मॉडल ऐतिहासिक रूप से समकक्ष रूप से सक्षम घने मॉडलों की तुलना में कई एक्सेलेरेटरों में कुशलतापूर्वक प्रशिक्षित और सेवा करने के लिए अधिक जटिल रहे हैं।

अपनाना

2024 और 2025 तक, मिश्रण-ऑफ़-एक्सपर्ट्स खुले-वजन और बंद फ्रंटियर दोनों मॉडलों के बीच एक सामान्य वास्तुकला विकल्प बन गया था, जो सिस्टम में प्रकट हुआ, जिसमें DeepSeek-R1, कई Qwen वेरिएंट, और Grok शामिल हैं, आम तौर पर बहुत बड़े कुल पैरामीटर गिनती तक पहुंचने के तरीके के रूप में, अक्सर सैकड़ों अरबों में, जबकि प्रति टोकन सक्रिय गणना को बहुत अधिक मामूली और सेवा योग्य सीमा में रखा जाता है। तकनीक को अक्सर क्वांटाइजेशन और डिस्टिलेशन के साथ चर्चा की जाती है, जो प्रयोगशालाएं बहुत बड़े भाषा मॉडलों को पैमाने पर सेवा देने की लागत का प्रबंधन करने के लिए उपयोग करने वाले मुख्य लीवर में से एक हैं।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:model-architecture·efficiency·deep-learning
इस पृष्ठ को अंतिम बार संपादित किया गया 2 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास