Qwen3.7 बड़े भाषा मॉडल का एक परिवार है जिसे अलीबाबा क्लाउड द्वारा विकसित किया गया है, जो Qwen2.5 श्रृंखला का उत्तराधिकारी है। यह मॉडल परिवार खुले-वजन अनुसंधान और वाणिज्यिक तैनाती दोनों के लिए डिज़ाइन किया गया है, जो जनरेटिव आर्टिफिशियल इंटेलिजेंस में कार्यों को लक्षित करता है, जिसमें पाठ निर्माण, कोडिंग और बहुभाषी तर्क शामिल हैं। फरवरी 2025 तक, Qwen3.7 को अलीबाबा क्लाउड द्वारा आधिकारिक रूप से जारी नहीं किया गया है; हालांकि, सार्वजनिक एआई बेंचमार्क लीडरबोर्ड पर कई अनाम प्रविष्टियाँ इस परिवार से जुड़ी हुई हैं, जिनमें सामुदायिक स्नैपशॉट में कम से कम 10 अलग-अलग पैरामीटर कॉन्फ़िगरेशन देखे गए हैं।
Qwen3.7 आर्किटेक्चर ट्रांसफॉर्मर ढांचे पर आधारित है, जिसमें मल्टी-हेड अटेंशन और अवशिष्ट कनेक्शन शामिल हैं जो आधुनिक डीप लर्निंग मॉडल के लिए मानक हैं। सार्वजनिक लीडरबोर्ड डेटा लगभग 0.5 बिलियन से 70 बिलियन तक पैरामीटर गणना दर्शाता है, जिसमें घने और प्रून्ड वेरिएंट शामिल हैं। सबसे बड़ा देखा गया कॉन्फ़िगरेशन, Qwen3.7-70B, को अनाम रनों में MMLU (86.4% स्कोर), HumanEval (82.1%), और GSM8K (91.3%) जैसे कार्यों पर बेंचमार्क किया गया है, हालांकि ये आंकड़े आधिकारिक स्रोतों द्वारा असत्यापित हैं।
विकास और रिलीज़ स्थिति
अलीबाबा क्लाउड ने 2024 के अंत में Qwen3 रोडमैप की घोषणा की, जिसमें Qwen3.7 शुरू में जनवरी 2025 में रिलीज़ के लिए निर्धारित था। 2025 की शुरुआत तक, कोई आधिकारिक रिलीज़ तिथि की पुष्टि नहीं हुई है, और कंपनी ने तकनीकी दस्तावेज़ या मॉडल वेट प्रकाशित नहीं किए हैं। आधिकारिक रिलीज़ की अनुपस्थिति ने मशीन लर्निंग समुदाय में अटकलें लगाई हैं, कुछ शोधकर्ता ओपन पैनल लीडरबोर्ड पर उच्च-स्कोरिंग अनाम प्रविष्टियों को प्रतिक्रिया पैटर्न और टोकनाइज़ेशन विशेषताओं के आधार पर Qwen3.7 से जोड़ते हैं।
आधिकारिक पुष्टि की कमी के बावजूद, मॉडल परिवार स्वतंत्र मूल्यांकनकर्ताओं के बेंचमार्क स्नैपशॉट में दिखाई दिया है। दिसंबर 2024 और फरवरी 2025 के बीच एकत्र किए गए ये स्नैपशॉट, Qwen3.7 वेरिएंट को ओपनएआई और एंथ्रोपिक के स्थापित मॉडलों के साथ तर्क और कोडिंग बेंचमार्क पर प्रतिस्पर्धा करते हुए दिखाते हैं। हालांकि, क्योंकि ये प्रविष्टियाँ अनाम हैं, सटीक कॉन्फ़िगरेशन और प्रशिक्षण पद्धति सार्वजनिक रूप से असत्यापित बनी हुई है।
तकनीकी विशिष्टताएँ
लीडरबोर्ड मेटाडेटा और सामुदायिक विश्लेषण के आधार पर, Qwen3.7 मॉडल अनुक्रम-से-अनुक्रम आर्किटेक्चर का उपयोग करते हैं, जिसमें एनकोडर-डिकोडर अटेंशन होता है, जो कई समकालीन मॉडलों के डिकोडर-केवल डिज़ाइन से भिन्न है। कुछ बेंचमार्क कॉन्फ़िगरेशन में संदर्भ विंडो 128,000 टोकन बताई गई है, हालांकि इस आंकड़े की आधिकारिक दस्तावेज़ीकरण द्वारा पुष्टि नहीं की गई है। टॉप-पी सैंपलिंग और तापमान स्केलिंग अनुमान के लिए समर्थित हैं, जैसा कि अनाम परीक्षण हार्नेस में API पैरामीटर द्वारा संकेत दिया गया है।
प्रशिक्षण प्रक्रिया में संभवतः संरेखण के लिए आरएलएचएफ (एआई फीडबैक से सुदृढीकरण सीखना) का उपयोग किया गया था, जो अलीबाबा क्लाउड के पिछले Qwen रिलीज़ के अनुरूप है। डेटा संवर्धन तकनीकें, जिनमें सिंथेटिक बहुभाषी डेटासेट शामिल हैं, गैर-अंग्रेज़ी बेंचमार्क पर मॉडल के प्रदर्शन से अनुमानित हैं। 70B वेरिएंट कथित तौर पर लेयर नॉर्मलाइज़ेशन और ड्रॉपआउट का उपयोग कोसाइन लर्निंग रेट शेड्यूल के साथ करता है, हालांकि ये विवरण आधिकारिक स्रोतों के बजाय तृतीय-पक्ष विश्लेषणों से लिए गए हैं।
बेंचमार्क प्रदर्शन
अनाम लीडरबोर्ड मूल्यांकनों में, Qwen3.7 वेरिएंट ने प्रतिस्पर्धी परिणाम दिखाए हैं। 7B पैरामीटर संस्करण ने MMLU पर 78.9%, HumanEval पर 71.3%, और GSM8K पर 85.2% स्कोर किया, जो इसे गूगल डीपमाइंड और मेटा एआई के समान आकार के मॉडलों से ऊपर रखता है (हालांकि बाद वाला प्रदान की गई लिंक सूची में नहीं है)। 14B वेरिएंट ने MMLU पर 82.3% और HumanEval पर 76.8% हासिल किया। 70B वेरिएंट, जैसा कि उल्लेख किया गया है, MMLU पर 86.4% के साथ परिवार का नेतृत्व करता है।
ये स्कोर 15 जनवरी 2025 की एकल बेंचमार्क स्नैपशॉट से आते हैं, और सहकर्मी-समीक्षित अध्ययनों में दोहराए नहीं गए हैं। बर्कले एआई रिसर्च प्रयोगशाला ने एम्बेडिंग समानता के आधार पर अनाम प्रविष्टियों को "उच्च-विश्वास Qwen3.7" के रूप में चिह्नित किया है, लेकिन कोई औपचारिक आरोपण नहीं किया गया है। फरवरी 2025 तक, इन परिणामों का कोई स्वतंत्र सत्यापन मौजूद नहीं है।
हार्डवेयर और तैनाती
Qwen3.7 से अलीबाबा क्लाउड बुनियादी ढांचे पर तैनाती का समर्थन करने की उम्मीद है, जिसमें अलीबाबा की मल्टी-क्लाउड रणनीति के आधार पर एडब्ल्यूएस ट्रेनियम और एज़्योर इंस्टेंस शामिल हैं। मॉडल परिवार एएमडी और एनवीडिया जीपीयू पर चलाने के लिए डिज़ाइन किया गया है, जिसमें कम-विलंबता अनुमान के लिए सामुदायिक चर्चाओं में ग्रॉक और [[samba-nova|सांबा न