qwen3.8-flash-next एक बड़ा भाषा मॉडल है जिसे अलीबाबा डामियाओ अकादमी द्वारा विकसित किया गया है, जो अलीबाबा समूह का एक शोध प्रभाग है। 2026 में जारी, यह मॉडल कुशल, कम-विलंबता अनुमान के लिए डिज़ाइन किया गया है, जो उत्पादन वातावरण में तैनाती को लक्षित करता है जहां गति और लागत महत्वपूर्ण हैं। यह क्वेन मॉडल परिवार का हिस्सा है, जो 2023 से सार्वजनिक रूप से उपलब्ध हैं और अपनी बहुभाषी क्षमताओं और तर्क कार्यों पर मजबूत प्रदर्शन के लिए जाने जाते हैं।
मॉडल एक तंत्रिका नेटवर्क पर आधारित ट्रांसफॉर्मर है जिसमें सघन वास्तुकला है, जिसमें लगभग 8 बिलियन पैरामीटर शामिल हैं। यह 128,000 टोकन की संदर्भ विंडो का उपयोग करता है, जिससे यह लंबे दस्तावेज़ों और बहु-मोड़ वाली बातचीत को एक ही पास में संसाधित कर सकता है। प्रशिक्षण प्रक्रिया में सार्वजनिक रूप से उपलब्ध पाठ और स्वामित्व डेटा का मिश्रण उपयोग किया गया, जिसमें कोड, गणित और वैज्ञानिक तर्क पर ध्यान केंद्रित किया गया। मॉडल को एडम ऑप्टिमाइज़र के एक प्रकार के साथ कोसाइन लर्निंग रेट शेड्यूल और ग्रेडिएंट क्लिपिंग का उपयोग करके प्रशिक्षित किया गया था ताकि प्रशिक्षण को स्थिर किया जा सके।
बेंचमार्क प्रदर्शन
qwen3.8-flash-next का मूल्यांकन कई सार्वजनिक बेंचमार्क पर किया गया है। LMArena लीडरबोर्ड पर, जो मानव प्राथमिकता निर्णयों के आधार पर मॉडलों को रैंक करता है, इसने सितंबर 2026 तक 1,248 का स्कोर प्राप्त किया, जो सभी प्रस्तुत मॉडलों में शीर्ष 10 में रखता है। LiveBench पर, एक वस्तुनिष्ठ बेंचमार्क जो तर्क, कोडिंग और गणितीय क्षमता का परीक्षण करता है, मॉडल ने सामान्य श्रेणी में 72.4%, कोडिंग कार्यों में 68.9%, और गणित में 75.1% स्कोर किया। ये स्कोर ओपनएआई के GPT-4-श्रेणी प्रणालियों जैसे बड़े मॉडलों के तुलनीय हैं, लेकिन काफी छोटे पैरामीटर गणना के साथ।
मॉडल का नवीनतम स्नैपशॉट, दिनांक 2026-09-13, निर्देश पालन में सुधार और भ्रम दर में कमी शामिल करता है। आंतरिक मूल्यांकन के अनुसार, स्नैपशॉट ने पिछले संस्करण की तुलना में तथ्यात्मक त्रुटियों को 18% कम किया, जबकि समान अनुमान गति बनाए रखी।
वास्तुकला और तकनीकी विवरण
qwen3.8-flash-next एक मानक ट्रांसफॉर्मर डिकोडर-केवल वास्तुकला का उपयोग करता है जिसमें 32 परतें, 32 ध्यान शीर्ष और 4,096 की छिपी हुई आयाम हैं। यह मल्टी-हेड अटेंशन के साथ रोटरी पोजीशनल एन्कोडिंग और प्री-नॉर्मलाइज़ेशन का उपयोग स्थिरता के लिए करता है। मॉडल जनरेशन के दौरान टॉप-पी सैंपलिंग (p=0.9 के साथ) और तापमान स्केलिंग (डिफ़ॉल्ट तापमान 0.7) का उपयोग करता है, और निर्धारित आउटपुट की आवश्यकता वाले कार्यों के लिए बीम सर्च का समर्थन करता है।
कम विलंबता प्राप्त करने के लिए, मॉडल संरचित प्रूनिंग और क्वांटाइज़ेशन तकनीकों का उपयोग करता है, जिसमें उपभोक्ता GPU पर तैनाती के लिए 4-बिट वजन सटीकता उपलब्ध है। अनुमान इंजन एएमडी और एनवीडिया हार्डवेयर के लिए अनुकूलित है, और अमेज़न वेब सर्विसेज और गूगल क्लाउड का समर्थन कंटेनरीकृत तैनाती के माध्यम से करता है।
प्रशिक्षण और विकास
मॉडल को 2,048 टीएसएमसी-निर्मित GPU के क्लस्टर पर 90 दिनों की अवधि में प्रशिक्षित किया गया था, जिसमें लगभग 3.5 ट्रिलियन टोकन का उपयोग किया गया। प्रशिक्षण डेटा में वेब पाठ, पुस्तकें, कोड भंडार और वैज्ञानिक पत्रों का मिश्रण शामिल था, जिसमें उच्च-गुणवत्ता वाले स्रोतों पर ध्यान केंद्रित किया गया। विकास टीम, जिसका नेतृत्व अलीबाबा डामियाओ अकादमी के शोधकर्ताओं ने किया, ने मानव प्राथमिकताओं के साथ मॉडल को संरेखित करने के लिए पाठ्यक्रम सीखने और आरएलएचएफ (मानव प्रतिक्रिया से सुदृढीकरण सीखना) के संयोजन का उपयोग किया।
संरेखण चरण के दौरान, टीम ने मानव प्राथमिकता डेटा पर प्रशिक्षित एक पुरस्कार मॉडल का उपयोग किया, जिसके बाद आरएलएचएफ फाइन-ट्यूनिंग की गई। अंतिम मॉडल का मूल्यांकन एक अलग रखे गए परीक्षण सेट पर किया गया ताकि डेटा संदूषण सुनिश्चित न हो, और परिणाम सार्वजनिक लीडरबोर्ड स्कोर के अनुरूप थे।
तैनाती और उपयोग के मामले
qwen3.8-flash-next अलीबाबा क्लाउड के मॉडल स्टूडियो के माध्यम से, साथ ही अनुमेय लाइसेंस के तहत ओपन-सोर्स भंडारों के माध्यम से उपलब्ध है। यह चैटबॉट, कोड सहायक और दस्तावेज़ सारांश जैसे वास्तविक समय अनुप्रयोगों के लिए डिज़ाइन किया गया है। मॉडल की कम विलंबता इसे एज तैनाती के लिए उपयुक्त बनाती है, और इसे एप्पल सिलिकॉन और क्वालकॉम मोबाइल प्रोसेसर पर परीक्षण किया गया है।
क्लाउड तैनाती के अलावा, मॉडल को 16 GB VRAM वाले एकल GPU पर स्थानीय रूप से चलाया जा सकता है, जिससे यह व्यक्तिगत डेवलपर्स और छोटे व्यवसायों के लिए सुलभ हो जाता है। ओपन पैनल समुदाय ने चिकित्सा और कानूनी ग्रंथों सहित डोमेन-विशिष्ट डेटासेट पर सफल फाइन-ट्यूनिंग की सूचना दी है, जिसमें न्यूनतम प्रदर्शन गिरावट है।
स्वागत और प्रभाव
qwen3.8-flash-next को कृत्रिम बुद्धिमत्ता समुदाय द्वारा प्रदर्शन और दक्षता के संतुलन के लिए अच्छी तरह से प्राप्त किया गया है। स्टैनफोर्ड एआई लैब और बर्कले एआई रिसर्च से स्वतंत्र मूल्यांकन ने इसके बेंचमार्क स्कोर की पुष्टि की है, और इसे कुशल मॉडल डिजाइन पर कई शैक्षणिक पत्रों में उद्धृत किया गया है। मॉडल की तुलना अक्सर गूगल डीपमाइंड के जेमिनी नैनो और एंथ्रोपिक के क्लॉड हाइकू से की जाती है, लेकिन यह एक बड़ी संदर्भ विंडो और कम अनुमान लागत प्रदान करता है।
2026 के अंत तक, मॉडल सक्रिय रूप से बनाए रखा जा रहा है, समय-समय पर स्नैपशॉट अपडेट के साथ। विकास टीम ने मोबाइल उपकरणों के लिए 3 बिलियन पैरामीटर वाले एक छोटे संस्करण और उच्च-सटीकता कार्यों के लिए 20 बिलियन पैरामीटर वाले एक बड़े संस्करण को जारी करने की योजना की घोषणा की है, दोनों 2027 में अपेक्षित हैं।