Qwen3 A22B बड़े भाषा मॉडल का एक परिवार है, जिसे अलीबाबा क्लाउड द्वारा विकसित किया गया है, और इसे पहली बार अप्रैल 2025 में जारी किया गया था। इस परिवार में चार प्रकार शामिल हैं जो सार्वजनिक LLM और मीडिया लीडरबोर्ड पर दिखाई दिए हैं, जिनमें एआई बेंचमार्किंग प्लेटफ़ॉर्म आर्टिफिशियल एनालिसिस और LMArena लीडरबोर्ड शामिल हैं। मॉडल मिश्रण-ऑफ-एक्सपर्ट्स (MoE) आर्किटेक्चर पर आधारित हैं, जिनमें कुल 22 बिलियन पैरामीटर और प्रति टोकन लगभग 3 बिलियन सक्रिय पैरामीटर हैं। यह परिवार व्यापक Qwen3 श्रृंखला का हिस्सा है, जिसमें विभिन्न आकारों के डेंस मॉडल भी शामिल हैं।
Qwen3 A22B मॉडल तर्क और गैर-तर्क दोनों कार्यों के लिए डिज़ाइन किए गए हैं, जो 256,000 टोकन की संदर्भ लंबाई का समर्थन करते हैं। इन्हें ओपन-सोर्स लाइसेंस, विशेष रूप से Apache 2.0 लाइसेंस के तहत जारी किया गया है, जो व्यावसायिक उपयोग की अनुमति देता है। मॉडल बेस और इंस्ट्रक्शन-ट्यून्ड वेरिएंट में उपलब्ध हैं, जिनमें इंस्ट्रक्शन-ट्यून्ड संस्करण चैट और एजेंटिक अनुप्रयोगों के लिए अनुकूलित हैं।
आर्किटेक्चर और प्रशिक्षण
Qwen3 A22B एक ट्रांसफ़ॉर्मर-आधारित MoE आर्किटेक्चर का उपयोग करता है, जिसमें मल्टी-हेड अटेंशन, अवशिष्ट कनेक्शन, और लेयर नॉर्मलाइज़ेशन जैसी तकनीकें शामिल हैं। मॉडल 151,936 की शब्दावली आकार वाले टोकनाइज़र का उपयोग करता है और जनरेशन के दौरान टॉप-पी सैंपलिंग और तापमान स्केलिंग का उपयोग करता है। प्रशिक्षण में दो-चरणीय प्रक्रिया शामिल थी: बहुभाषी पाठ के बड़े कोरपस पर प्रारंभिक प्रीट्रेनिंग, उसके बाद पर्यवेक्षित फाइन-ट्यूनिंग और मानवीय प्राथमिकताओं के साथ संरेखित करने के लिए एआई फीडबैक से सुदृढीकरण सीखना (RLAIF)।
मॉडल को वेब, पुस्तकों और कोड के डेटा के मिश्रण पर प्रशिक्षित किया गया था, जिसमें अंग्रेजी और चीनी पर ध्यान केंद्रित किया गया था। प्रशिक्षण कंप्यूट का अनुमान कई हज़ार GPU-दिनों के रूप में लगाया गया है, हालाँकि सटीक आंकड़े सार्वजनिक रूप से उपलब्ध नहीं हैं। मॉडल स्थिरता के लिए एडम ऑप्टिमाइज़र के साथ कोसाइन लर्निंग रेट शेड्यूल और ग्रेडिएंट क्लिपिंग का उपयोग करता है।
बेंचमार्क प्रदर्शन
सार्वजनिक लीडरबोर्ड पर, Qwen3 A22B इंस्ट्रक्शन-ट्यून्ड वेरिएंट ने प्रतिस्पर्धी प्रदर्शन का प्रदर्शन किया है। मई 2025 में, यह LMArena लीडरबोर्ड पर शीर्ष ओपन-वेट मॉडलों में शुमार था, जिसकी एलो रेटिंग लगभग 1300 थी, जो इसे कई बड़े मालिकाना मॉडलों से ऊपर रखती है। आर्टिफिशियल एनालिसिस इंटेलिजेंस इंडेक्स पर, इसने 46 अंक प्राप्त किए, जो GPT-4o-mini और Claude 3.5 Haiku जैसे मॉडलों से बेहतर प्रदर्शन करता है। मानक बेंचमार्क पर, इसने MMLU-Pro पर 83.2%, GPQA-Diamond पर 86.1%, और AIME 2025 पर 91.1% हासिल किया, जो मजबूत तर्क और गणितीय क्षमताओं का संकेत देता है।
बेस वेरिएंट ने कोडिंग बेंचमार्क पर भी अच्छा प्रदर्शन किया, LiveCodeBench पर 72.6% और SWE-bench Verified पर 65.4% स्कोर किया। इन परिणामों को मीडिया रिपोर्टों और शैक्षणिक मूल्यांकनों में उद्धृत किया गया है, हालाँकि स्वतंत्र प्रतिकृति अभी भी जारी है।
वेरिएंट और उपलब्धता
Qwen3 A22B परिवार में चार वेरिएंट शामिल हैं: Qwen3-22B (बेस), Qwen3-22B-Instruct, Qwen3-22B-Instruct-2507, और Qwen3-22B-Instruct-2507-AWQ। जुलाई 2025 में जारी 2507 संस्करणों में इंस्ट्रक्शन-ट्यूनिंग और टूल कॉलिंग के समर्थन में अपडेट शामिल हैं। AWQ वेरिएंट कुशल इन्फ़रेंस के लिए क्वांटाइज़्ड है, जिसमें 4-बिट वेट का उपयोग किया गया है। सभी वेरिएंट हगिंग फेस और ModelScope के माध्यम से डाउनलोड के लिए उपलब्ध हैं, और अमेज़न सेजमेकर, Azure AI, और गूगल क्लाउड ऑफ़रिंग में एकीकृत हैं।
स्वागत और प्रभाव
Qwen3 A22B की रिलीज़ अपने ओपन-वेट दृष्टिकोण के लिए उल्लेखनीय थी, जिससे शोधकर्ताओं और डेवलपर्स को Groq या SambaNova एक्सेलेरेटर के साथ उपभोक्ता हार्डवेयर पर मॉडल चलाने की अनुमति मिली। इसका उपयोग विभिन्न अनुप्रयोगों में किया गया है, जिनमें जनरेटिव एआई चैटबॉट और कोडिंग सहायक शामिल हैं। मॉडल के प्रदर्शन की तुलना OpenAI के GPT-4.1 और Anthropic के Claude 3.5 Sonnet से अनुकूल रूप से की गई है, विशेष रूप से तर्क कार्यों में। हालाँकि, कुछ मूल्यांकनों में कहा गया है कि चीनी के अलावा अन्य गैर-अंग्रेज़ी भाषाओं के लिए मॉडल की बहुभाषी क्षमताएँ कम मजबूत हैं।
2025 के अंत तक, Qwen3 A22B परिवार ऑन-प्रिमाइसेस तैनाती के लिए एक लोकप्रिय विकल्प बना हुआ है, जिसका एक मजबूत सामुदायिक अनुसरण है। इसकी रिलीज़ ने ओपन-वेट मॉडलों के मालिकाना सिस्टम के साथ अंतर को कम करने की प्रवृत्ति में योगदान दिया है।