अंग्रेज़ी से अनुवादित

qwen3.8-flash-next是阿里巴巴大模型学院于2026年发布的大型语言模型。它针对低延迟推理进行了优化,并在LMArena和LiveBench等公开基准排行榜上排名靠前,其最新快照日期为2026-09-13。

qwen3.8-flash-next एक बड़ा भाषा मॉडल है जिसे अलीबाबा डामियाओ अकादमी द्वारा विकसित किया गया है, जो अलीबाबा समूह का एक शोध प्रभाग है। 2026 में जारी, यह मॉडल कुशल, कम-विलंबता अनुमान के लिए डिज़ाइन किया गया है, जो उत्पादन वातावरण में तैनाती को लक्षित करता है जहां गति और लागत महत्वपूर्ण हैं। यह क्वेन मॉडल परिवार का हिस्सा है, जो 2023 से सार्वजनिक रूप से उपलब्ध हैं और अपनी बहुभाषी क्षमताओं और तर्क कार्यों पर मजबूत प्रदर्शन के लिए जाने जाते हैं।

मॉडल एक तंत्रिका नेटवर्क पर आधारित ट्रांसफॉर्मर है जिसमें सघन वास्तुकला है, जिसमें लगभग 8 बिलियन पैरामीटर शामिल हैं। यह 128,000 टोकन की संदर्भ विंडो का उपयोग करता है, जिससे यह लंबे दस्तावेज़ों और बहु-मोड़ वाली बातचीत को एक ही पास में संसाधित कर सकता है। प्रशिक्षण प्रक्रिया में सार्वजनिक रूप से उपलब्ध पाठ और स्वामित्व डेटा का मिश्रण उपयोग किया गया, जिसमें कोड, गणित और वैज्ञानिक तर्क पर ध्यान केंद्रित किया गया। मॉडल को एडम ऑप्टिमाइज़र के एक प्रकार के साथ कोसाइन लर्निंग रेट शेड्यूल और ग्रेडिएंट क्लिपिंग का उपयोग करके प्रशिक्षित किया गया था ताकि प्रशिक्षण को स्थिर किया जा सके।

बेंचमार्क प्रदर्शन

qwen3.8-flash-next का मूल्यांकन कई सार्वजनिक बेंचमार्क पर किया गया है। LMArena लीडरबोर्ड पर, जो मानव प्राथमिकता निर्णयों के आधार पर मॉडलों को रैंक करता है, इसने सितंबर 2026 तक 1,248 का स्कोर प्राप्त किया, जो सभी प्रस्तुत मॉडलों में शीर्ष 10 में रखता है। LiveBench पर, एक वस्तुनिष्ठ बेंचमार्क जो तर्क, कोडिंग और गणितीय क्षमता का परीक्षण करता है, मॉडल ने सामान्य श्रेणी में 72.4%, कोडिंग कार्यों में 68.9%, और गणित में 75.1% स्कोर किया। ये स्कोर ओपनएआई के GPT-4-श्रेणी प्रणालियों जैसे बड़े मॉडलों के तुलनीय हैं, लेकिन काफी छोटे पैरामीटर गणना के साथ।

मॉडल का नवीनतम स्नैपशॉट, दिनांक 2026-09-13, निर्देश पालन में सुधार और भ्रम दर में कमी शामिल करता है। आंतरिक मूल्यांकन के अनुसार, स्नैपशॉट ने पिछले संस्करण की तुलना में तथ्यात्मक त्रुटियों को 18% कम किया, जबकि समान अनुमान गति बनाए रखी।

वास्तुकला और तकनीकी विवरण

qwen3.8-flash-next एक मानक ट्रांसफॉर्मर डिकोडर-केवल वास्तुकला का उपयोग करता है जिसमें 32 परतें, 32 ध्यान शीर्ष और 4,096 की छिपी हुई आयाम हैं। यह मल्टी-हेड अटेंशन के साथ रोटरी पोजीशनल एन्कोडिंग और प्री-नॉर्मलाइज़ेशन का उपयोग स्थिरता के लिए करता है। मॉडल जनरेशन के दौरान टॉप-पी सैंपलिंग (p=0.9 के साथ) और तापमान स्केलिंग (डिफ़ॉल्ट तापमान 0.7) का उपयोग करता है, और निर्धारित आउटपुट की आवश्यकता वाले कार्यों के लिए बीम सर्च का समर्थन करता है।

कम विलंबता प्राप्त करने के लिए, मॉडल संरचित प्रूनिंग और क्वांटाइज़ेशन तकनीकों का उपयोग करता है, जिसमें उपभोक्ता GPU पर तैनाती के लिए 4-बिट वजन सटीकता उपलब्ध है। अनुमान इंजन एएमडी और एनवीडिया हार्डवेयर के लिए अनुकूलित है, और अमेज़न वेब सर्विसेज और गूगल क्लाउड का समर्थन कंटेनरीकृत तैनाती के माध्यम से करता है।

प्रशिक्षण और विकास

मॉडल को 2,048 टीएसएमसी-निर्मित GPU के क्लस्टर पर 90 दिनों की अवधि में प्रशिक्षित किया गया था, जिसमें लगभग 3.5 ट्रिलियन टोकन का उपयोग किया गया। प्रशिक्षण डेटा में वेब पाठ, पुस्तकें, कोड भंडार और वैज्ञानिक पत्रों का मिश्रण शामिल था, जिसमें उच्च-गुणवत्ता वाले स्रोतों पर ध्यान केंद्रित किया गया। विकास टीम, जिसका नेतृत्व अलीबाबा डामियाओ अकादमी के शोधकर्ताओं ने किया, ने मानव प्राथमिकताओं के साथ मॉडल को संरेखित करने के लिए पाठ्यक्रम सीखने और आरएलएचएफ (मानव प्रतिक्रिया से सुदृढीकरण सीखना) के संयोजन का उपयोग किया।

संरेखण चरण के दौरान, टीम ने मानव प्राथमिकता डेटा पर प्रशिक्षित एक पुरस्कार मॉडल का उपयोग किया, जिसके बाद आरएलएचएफ फाइन-ट्यूनिंग की गई। अंतिम मॉडल का मूल्यांकन एक अलग रखे गए परीक्षण सेट पर किया गया ताकि डेटा संदूषण सुनिश्चित न हो, और परिणाम सार्वजनिक लीडरबोर्ड स्कोर के अनुरूप थे।

तैनाती और उपयोग के मामले

qwen3.8-flash-next अलीबाबा क्लाउड के मॉडल स्टूडियो के माध्यम से, साथ ही अनुमेय लाइसेंस के तहत ओपन-सोर्स भंडारों के माध्यम से उपलब्ध है। यह चैटबॉट, कोड सहायक और दस्तावेज़ सारांश जैसे वास्तविक समय अनुप्रयोगों के लिए डिज़ाइन किया गया है। मॉडल की कम विलंबता इसे एज तैनाती के लिए उपयुक्त बनाती है, और इसे एप्पल सिलिकॉन और क्वालकॉम मोबाइल प्रोसेसर पर परीक्षण किया गया है।

क्लाउड तैनाती के अलावा, मॉडल को 16 GB VRAM वाले एकल GPU पर स्थानीय रूप से चलाया जा सकता है, जिससे यह व्यक्तिगत डेवलपर्स और छोटे व्यवसायों के लिए सुलभ हो जाता है। ओपन पैनल समुदाय ने चिकित्सा और कानूनी ग्रंथों सहित डोमेन-विशिष्ट डेटासेट पर सफल फाइन-ट्यूनिंग की सूचना दी है, जिसमें न्यूनतम प्रदर्शन गिरावट है।

स्वागत और प्रभाव

qwen3.8-flash-next को कृत्रिम बुद्धिमत्ता समुदाय द्वारा प्रदर्शन और दक्षता के संतुलन के लिए अच्छी तरह से प्राप्त किया गया है। स्टैनफोर्ड एआई लैब और बर्कले एआई रिसर्च से स्वतंत्र मूल्यांकन ने इसके बेंचमार्क स्कोर की पुष्टि की है, और इसे कुशल मॉडल डिजाइन पर कई शैक्षणिक पत्रों में उद्धृत किया गया है। मॉडल की तुलना अक्सर गूगल डीपमाइंड के जेमिनी नैनो और एंथ्रोपिक के क्लॉड हाइकू से की जाती है, लेकिन यह एक बड़ी संदर्भ विंडो और कम अनुमान लागत प्रदान करता है।

2026 के अंत तक, मॉडल सक्रिय रूप से बनाए रखा जा रहा है, समय-समय पर स्नैपशॉट अपडेट के साथ। विकास टीम ने मोबाइल उपकरणों के लिए 3 बिलियन पैरामीटर वाले एक छोटे संस्करण और उच्च-सटीकता कार्यों के लिए 20 बिलियन पैरामीटर वाले एक बड़े संस्करण को जारी करने की योजना की घोषणा की है, दोनों 2027 में अपेक्षित हैं।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:large-language-model·transformer·alibaba·efficient-inference
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास