Qwen3.8 बड़े भाषा मॉडल का एक परिवार है जिसे अलीबाबा क्लाउड द्वारा विकसित किया गया है। यह श्रृंखला 2025 में Qwen2.5 पीढ़ी के उत्तराधिकारी के रूप में पेश की गई थी, जो घने मॉडल से लेकर मिश्रण-ऑफ-विशेषज्ञ (MoE) आर्किटेक्चर तक पैरामीटर आकारों की एक श्रृंखला प्रदान करती है। मॉडल ओपन-सोर्स वितरण और अलीबाबा क्लाउड के प्लेटफॉर्म के माध्यम से वाणिज्यिक तैनाती दोनों के लिए डिज़ाइन किए गए हैं।
Qwen3.8 परिवार में कई कॉन्फ़िगरेशन शामिल हैं, जिसमें 8 बिलियन और 32 बिलियन पैरामीटर पर प्रमुख घने मॉडल हैं, साथ ही Qwen3.8-A14B जैसे MoE वेरिएंट भी हैं, जो प्रति टोकन 2.2 बिलियन पैरामीटर सक्रिय करते हैं। ये मॉडल 131,072 टोकन की संदर्भ लंबाई का समर्थन करते हैं और 30 से अधिक भाषाओं को कवर करने वाले बहुभाषी डेटा पर प्रशिक्षित हैं, जिनमें अंग्रेजी और चीनी में विशेष ताकत है।
आर्किटेक्चर और प्रशिक्षण
Qwen3.8 मॉडल ट्रांसफॉर्मर डिकोडर-ओनली आर्किटेक्चर का उपयोग करते हैं, जिसमें मल्टी-हेड अटेंशन, SwiGLU सक्रियण, और रोटरी पोजीशन एम्बेडिंग जैसे संवर्द्धन शामिल हैं। प्रशिक्षण प्रक्रिया ने दो-चरणीय दृष्टिकोण का उपयोग किया: वेब टेक्स्ट, पुस्तकों और कोड के बड़े कॉर्पस पर प्रारंभिक प्रीट्रेनिंग, उसके बाद पर्यवेक्षित फाइन-ट्यूनिंग और एआई फीडबैक से सुदृढीकरण सीखना (RLAIF) मानवीय प्राथमिकताओं के साथ संरेखित करने के लिए।
Qwen3.8 की एक उल्लेखनीय विशेषता इसका हाइब्रिड सोच मोड है, जो मॉडल को तेज़ प्रतिक्रिया उत्पादन और विस्तारित तर्क के बीच स्विच करने की अनुमति देता है। यह एक सिस्टम प्रॉम्प्ट के माध्यम से नियंत्रित होता है, जिससे उपयोगकर्ता गति और विश्लेषण की गहराई को संतुलित कर सकते हैं। मॉडल अनुमान के दौरान ग्रीडी सैंपलिंग और टॉप-पी सैंपलिंग रणनीतियों को भी शामिल करते हैं।
प्रदर्शन और बेंचमार्क
सार्वजनिक बेंचमार्क पर, Qwen3.8 मॉडल ने प्रतिस्पर्धी प्रदर्शन प्रदर्शित किया है। Qwen3.8-32B मॉडल ने MMLU-Pro बेंचमार्क पर 75.1 का स्कोर हासिल किया, जो कई बड़े मॉडलों से बेहतर प्रदर्शन करता है। AIME24 गणित प्रतियोगिता में, 32B मॉडल ने 67.0 स्कोर किया, जबकि MoE वेरिएंट Qwen3.8-A14B ने 81.0 स्कोर किया। कोडिंग कार्यों में, मॉडलों ने LiveCodeBench और SWE-bench पर मजबूत परिणाम दर्ज किए, जिसमें 32B मॉडल ने बाद वाले पर 45.0 पास दर हासिल की।
मॉडल सार्वजनिक एलएलएम लीडरबोर्ड पर दिखाई दिए हैं, जिनमें LMArena और Open LLM Leaderboard शामिल हैं, जहां उन्होंने अपने आकार वर्ग के शीर्ष ओपन-वेट मॉडलों में स्थान प्राप्त किया है। स्वतंत्र मूल्यांकनों ने उनकी दक्षता पर ध्यान दिया है, विशेष रूप से MoE वेरिएंट जो कम कम्प्यूटेशनल लागत पर घने मॉडलों के बराबर प्रदर्शन प्रदान करते हैं।
रिलीज़ और उपलब्धता
Qwen3.8 को चरणों में जारी किया गया था, जिसमें छोटे 0.6B और 1.7B मॉडल पहले उपलब्ध कराए गए, उसके बाद 8B और 32B घने मॉडल, और अंत में MoE वेरिएंट। वेट Apache 2.0 लाइसेंस के तहत वितरित किए जाते हैं, जो अनुसंधान और वाणिज्यिक उपयोग दोनों की अनुमति देता है। मॉडल Hugging Face और ModelScope के माध्यम से डाउनलोड के लिए उपलब्ध हैं, और अलीबाबा क्लाउड की Model Studio सेवा के माध्यम से तैनात किए जा सकते हैं।
हार्डवेयर समर्थन में NVIDIA GPU शामिल हैं, जिसमें मॉडल AMD और Intel हार्डवेयर पर अनुमान के लिए अनुकूलित हैं। तैनाती विकल्प vLLM या SGLang का उपयोग करके स्थानीय अनुमान से लेकर क्लाउड-आधारित API तक हैं। रिलीज़ में GPTQ और AWQ तकनीकों का उपयोग करके कम मेमोरी फुटप्रिंट के लिए क्वांटाइज़्ड संस्करण भी शामिल थे।
स्वागत और प्रभाव
Qwen3.8 श्रृंखला को ओपन-सोर्स एआई समुदाय में अच्छी तरह से प्राप्त किया गया है, जिसमें डेवलपर्स इसके प्रदर्शन-से-आकार अनुपात और हाइब्रिड सोच मोड की लचीलापन की प्रशंसा करते हैं। मॉडलों को विभिन्न अनुप्रयोगों में एकीकृत किया गया है, कोडिंग सहायकों से लेकर बहुभाषी अनुवाद उपकरणों तक। रिलीज़ ने जनरेटिव एआई लोकतंत्रीकरण के व्यापक रुझान में योगदान दिया है, जो उच्च-गुणवत्ता वाले मॉडल प्रदान करता है जो उपभोक्ता-ग्रेड हार्डवेयर पर चल सकते हैं।
2025 के अंत तक, Qwen3.8 परिवार सक्रिय रूप से बनाए रखा जा रहा है, समय-समय पर अपडेट और अतिरिक्त फाइन-ट्यून्ड वेरिएंट जारी किए जा रहे हैं। मॉडलों ने मॉडल प्रूनिंग और डेटा ऑगमेंटेशन जैसे क्षेत्रों में आगे के शोध के लिए एक आधार के रूप में भी काम किया है।