अंग्रेज़ी से अनुवादित

Qwen3 2507 अलीबाबा क्लाउड द्वारा जुलाई 2025 में जारी बड़े भाषा मॉडलों का एक परिवार है, जो चार संस्करणों के साथ सार्वजनिक लीडरबोर्ड पर दिखाई देता है। इसमें घने और मिश्रण-ऑफ-एक्सपर्ट्स आर्किटेक्चर शामिल हैं, जिनमें 235 अरब पैरामीटर तक होते हैं।

Qwen3 2507 बड़े भाषा मॉडल का एक परिवार है जिसे अलीबाबा क्लाउड द्वारा विकसित किया गया है, और इसे पहली बार जुलाई 2025 में जारी किया गया था। यह परिवार चार प्रकारों से मिलकर बना है जो सार्वजनिक LLM और मीडिया लीडरबोर्ड पर दिखाई दिए हैं, जिनमें Qwen3 2507-A3B, Qwen3 2507-7B, Qwen3 2507-32B, और Qwen3 2507-235B शामिल हैं। ये मॉडल एज डिप्लॉयमेंट से लेकर उच्च-प्रदर्शन क्लाउड इंफेरेंस तक के अनुप्रयोगों के लिए डिज़ाइन किए गए हैं, और ये 128,000 टोकन की संदर्भ विंडो का समर्थन करते हैं। यह रिलीज़ पहले की Qwen3 श्रृंखला के बाद आई और इसमें दक्षता और तर्क क्षमताओं में सुधार के उद्देश्य से वास्तुशिल्प परिशोधन पेश किए गए।

Qwen3 2507 परिवार ट्रांसफॉर्मर वास्तुकला पर आधारित है, जो आधुनिक गहन शिक्षण में एक मौलिक डिज़ाइन है। सबसे छोटा प्रकार, Qwen3 2507-A3B, एक मिश्रण-ऑफ-एक्सपर्ट्स (MoE) मॉडल है जिसमें कुल 3 बिलियन पैरामीटर और प्रति टोकन 1 बिलियन सक्रिय पैरामीटर हैं, जो उपभोक्ता हार्डवेयर पर कम-विलंबता इंफेरेंस के लिए अनुकूलित है। Qwen3 2507-7B एक घना मॉडल है जिसमें 7 बिलियन पैरामीटर हैं, जो प्रदर्शन और कम्प्यूटेशनल लागत के बीच संतुलन बनाता है। Qwen3 2507-32B एक घना मॉडल है जिसमें 32 बिलियन पैरामीटर हैं, जो मध्यम संसाधन आवश्यकताओं के साथ उच्च-गुणवत्ता वाली पीढ़ी को लक्षित करता है। सबसे बड़ा प्रकार, Qwen3 2507-235B, एक MoE मॉडल है जिसमें कुल 235 बिलियन पैरामीटर और 22 बिलियन सक्रिय पैरामीटर हैं, जो जटिल कार्यों पर अत्याधुनिक प्रदर्शन के लिए डिज़ाइन किया गया है।

आर्किटेक्चर और प्रशिक्षण

Qwen3 2507 परिवार के सभी प्रकार मानक डिकोडर-ओनली ट्रांसफॉर्मर आर्किटेक्चर का उपयोग करते हैं, जिसमें मल्टी-हेड अटेंशन और रोटरी पोजीशनल एन्कोडिंग शामिल हैं। MoE प्रकार एक स्पार्स रूटिंग तंत्र का उपयोग करते हैं जो प्रति टोकन केवल विशेषज्ञों के एक उपसमूह को सक्रिय करता है, जिससे उच्च क्षमता बनाए रखते हुए इंफेरेंस लागत कम होती है। मॉडलों को बहुभाषी पाठ के विविध कोरपस पर प्रशिक्षित किया गया था, जिसमें अंग्रेजी और चीनी पर ध्यान केंद्रित किया गया था, और इसमें नेक्स्ट-टोकन भविष्यवाणी और मानव प्रतिक्रिया से सुदृढीकरण शिक्षण (RLHF) का संयोजन उपयोग किया गया था। प्रशिक्षण में AdamW का उपयोग कोसाइन लर्निंग रेट शेड्यूल और ग्रेडिएंट क्लिपिंग के साथ किया गया ताकि अनुकूलन स्थिर रहे। मॉडलों में नियमितीकरण के लिए प्री-नॉर्मलाइज़ेशन और ड्रॉपआउट भी शामिल हैं।

प्रदर्शन और बेंचमार्क

सार्वजनिक लीडरबोर्ड पर, Qwen3 2507 प्रकारों ने तर्क, कोडिंग और बहुभाषी कार्यों में प्रतिस्पर्धात्मक प्रदर्शन दिखाया है। उदाहरण के लिए, Qwen3 2507-235B ने MMLU बेंचमार्क पर 89.2 का स्कोर, कोड जनरेशन के लिए HumanEval पर 91.5, और MATH डेटासेट पर 78.4 हासिल किया, जो इसे अगस्त 2025 तक शीर्ष ओपन-वेट मॉडलों में रखता है। 32B प्रकार ने MMLU पर 85.1 और HumanEval पर 87.3 स्कोर किया, जबकि 7B प्रकार ने MMLU पर 78.9 और HumanEval पर 80.2 स्कोर किया। A3B मॉडल, अपनी छोटी सक्रिय पैरामीटर संख्या के बावजूद, MMLU पर 72.4 और HumanEval पर 74.1 हासिल किया, जो इसे ऑन-डिवाइस अनुप्रयोगों के लिए उपयुक्त बनाता है। इन परिणामों को ओपन LLM लीडरबोर्ड जैसे प्लेटफार्मों पर स्वतंत्र मूल्यांकनकर्ताओं द्वारा सत्यापित किया गया है।

डिप्लॉयमेंट और पारिस्थितिकी तंत्र

Qwen3 2507 मॉडल अलीबाबा क्लाउड के मॉडल स्टूडियो के माध्यम से डिप्लॉयमेंट के लिए उपलब्ध हैं और API के माध्यम से, साथ ही Hugging Face पर ओपन-सोर्स रिपॉजिटरी के माध्यम से एक्सेस किए जा सकते हैं। मॉडल AWS, Azure, और Google Cloud इंस्टेंस पर इंफेरेंस के लिए अनुकूलित हैं, जिसमें Groq और SambaNova हार्डवेयर एक्सेलेरेटर के लिए समर्थन शामिल है। छोटे प्रकार, विशेष रूप से A3B और 7B, उपभोक्ता GPU और एज डिवाइस पर चलाने के लिए डिज़ाइन किए गए हैं, जिससे गोपनीयता-संवेदनशील अनुप्रयोगों के लिए स्थानीय डिप्लॉयमेंट संभव होता है। रिलीज़ में क्वांटाइज़ेशन स्क्रिप्ट और फाइन-ट्यूनिंग उदाहरण शामिल हैं, जो विशिष्ट डोमेन के लिए अनुकूलन की सुविधा प्रदान करते हैं।

स्वागत और प्रभाव

Qwen3 2507 परिवार को जनरेटिव AI समुदाय में इसके मजबूत प्रदर्शन-से-लागत अनुपात के लिए अच्छी तरह से प्राप्त किया गया है, विशेष रूप से A3B मॉडल, जो काफी कम इंफेरेंस विलंबता के साथ लगभग 7B प्रदर्शन प्रदान करता है। मीडिया कवरेज ने बहुभाषी तर्क और लंबी-संदर्भ प्रसंस्करण में मॉडलों की क्षमताओं पर प्रकाश डाला है। रिलीज़ ने ओपन-वेट मॉडलों के प्रतिस्पर्धात्मक परिदृश्य में भी योगदान दिया है, जो कुछ बेंचमार्क में OpenAI और Anthropic की पेशकशों को चुनौती देता है। 2025 के अंत तक, मॉडलों को Hugging Face से 10 मिलियन से अधिक बार डाउनलोड किया गया है, जो अनुसंधान और उद्योग दोनों में व्यापक अपनाने का संकेत देता है।

भविष्य की दिशाएँ

अलीबाबा क्लाउड ने संकेत दिया है कि Qwen3 2507 श्रृंखला मॉडल दक्षता और तर्क में सुधार के लिए चल रहे अनुसंधान कार्यक्रम का हिस्सा है। भविष्य के अपडेट में बड़ी संदर्भ विंडो, मल्टीमॉडल क्षमताएं, और विशेष हार्डवेयर के लिए आगे अनुकूलन शामिल हो सकते हैं। टीम ने प्रशिक्षण पद्धति का विवरण देने वाली तकनीकी रिपोर्ट भी जारी की है, जिन्हें मशीन लर्निंग और कृत्रिम बुद्धिमत्ता पर अकादमिक अनुसंधान में उद्धृत किया गया है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:large-language-models·alibaba·generative-ai·open-source
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास