अंग्रेज़ी से अनुवादित

क्वेन2.5 अलीबाबा क्लाउड द्वारा विकसित बड़े भाषा मॉडलों का एक परिवार है, जिसे 2024 में जारी किया गया था। इसमें विभिन्न पैरामीटर आकार और कोडिंग तथा गणित के लिए विशेषीकृत वेरिएंट शामिल हैं।

Qwen2.5 खुले-वजन वाले बड़े भाषा मॉडलों का एक परिवार है, जिसे Alibaba Cloud द्वारा विकसित किया गया और सितंबर 2024 में जारी किया गया। यह Qwen2 श्रृंखला का उत्तराधिकारी है और चल रहे Generative AI विकास में एक महत्वपूर्ण पुनरावृत्ति का प्रतिनिधित्व करता है, जिसमें मॉडल 0.5 बिलियन से 72 बिलियन पैरामीटर तक हैं। परिवार में बेस मॉडल, निर्देश-ट्यून किए गए वेरिएंट, और कोडिंग तथा गणितीय तर्क के लिए अनुकूलित डोमेन-विशिष्ट संस्करण शामिल हैं।

Qwen2.5 रिलीज़ ने अपने पूर्ववर्ती की वास्तुकला और प्रशिक्षण पद्धति का विस्तार किया, जिसमें डेटा गुणवत्ता और प्रशिक्षण पैमाने में सुधार शामिल किए गए। मॉडलों को अनुमेय खुले लाइसेंसों के तहत उपलब्ध कराया गया, जिससे शैक्षणिक और वाणिज्यिक दोनों उपयोगों की अनुमति मिली, जो आकस्मिक Machine learning प्रयोग से लेकर AWS, Azure, और अन्य क्लाउड प्लेटफार्मों पर उत्पादन LLM तैनाती तक के अनुप्रयोगों में फैले हुए हैं।

परिवार ने सार्वजनिक AI बेंचमार्क लीडरबोर्ड पर उल्लेखनीय प्रदर्शन हासिल किया, जो अक्सर तुलनीय पैरामीटर गणनाओं पर OpenAI, Anthropic, और Google DeepMind के मॉडलों के साथ प्रतिस्पर्धात्मक रूप से मुकाबला करता था। इसकी पहुंच और प्रतिस्पर्धी प्रदर्शन ने ओपन-सोर्स AI समुदाय के भीतर व्यापक अपनाने में योगदान दिया।

Architecture and Training

सभी Qwen2.5 वेरिएंट Transformer (architecture) वास्तुकला पर आधारित हैं, जो आधुनिक कारणात्मक भाषा मॉडलों की विशिष्ट डिकोडर-केवल संरचना का उपयोग करते हैं। वास्तुकला में Multi-Head Attention तंत्र शामिल हैं, जिसमें Positional Encoding फ़ंक्शन, साथ ही Layer Normalization और residual connections शामिल हैं, जो बड़े पैमाने पर स्थिर प्रशिक्षण की सुविधा प्रदान करते हैं।

मॉडल एक बड़े शब्दावली टोकनाइज़र का उपयोग करते हैं और बहुभाषी डेटा के मिश्रण पर प्रशिक्षित होते हैं, जिसमें अंग्रेजी और चीनी में विशेष ताकत होती है। प्रशिक्षण में उन्नत अनुकूलन तकनीकों का उपयोग किया गया, जिसमें Adam (Optimizer) शामिल है, जिसमें learning rate schedules, Gradient Clipping, और नियमितीकरण के लिए Dropout शामिल हैं।

मॉडल आकार 0.5B, 1.5B, 3B, 7B, 14B, 32B, और 72B पैरामीटर तक फैले हैं। प्रत्येक आकार में निरंतर फाइन-ट्यूनिंग के लिए एक बेस मॉडल और RLHF - शैली विधियों के माध्यम से संरेखित एक निर्देश-ट्यून संस्करण है। यह ग्रेडेशन उपयोगकर्ताओं को संसाधन-बाधित एज डिवाइस से लेकर उच्च-अंत क्लस्टर तक उपयुक्त कंप्यूट और प्रदर्शन व्यापार-ऑफ का चयन करने की अनुमति देता है।

विशेष कोडिंग वेरिएंट, Qwen2.5-Coder, प्रोग्रामिंग कॉर्पोरा पर अतिरिक्त प्रशिक्षण और लंबे कोड अनुक्रमों को संभालने की क्षमता के साथ जारी किए गए थे। एक गणित-केंद्रित वेरिएंट, Qwen2.5-Math, प्रतिस्पर्धी गणित समस्या समाधान और तर्क कार्यों को लक्षित करता था।

Performance and Benchmarks

Qwen2.5-72B-Instruct ने MMLU, HumanEval, और GSM8K जैसे व्यापक रूप से उद्धृत बेंचमार्क पर मजबूत परिणाम प्रदर्शित किए। कई मूल्यांकनों में, यह अन्य डेवलपर्स के समान आकार के मॉडलों से बेहतर प्रदर्शन करता था, जिन्हें निर्दिष्ट नहीं किया गया था, लेकिन सार्वजनिक लीडरबोर्ड के आधार पर, यह अक्सर 2024 में जारी खुले-वजन मॉडलों के शीर्ष स्तर में रैंक करता था।

कोडिंग-विशिष्ट मॉडल कोड पूर्णता, बग फिक्सिंग, और रिपॉजिटरी-स्तर समझ जैसे कार्यों पर उत्कृष्ट प्रदर्शन करते थे। गणित-विशिष्ट वेरिएंट ने प्रतियोगिता-स्तर की समस्या सेटों पर उच्च पास दर हासिल की, जो कुछ मूल्यांकनों में बड़े मालिकाना सिस्टम के साथ प्रतिस्पर्धा करता था।

LMArena और Open LLM लीडरबोर्ड पर स्वतंत्र मूल्यांकन ने इसके प्रदर्शन को कैप्चर किया, और कई समुदाय बेंचमार्क में 7B और 72B वेरिएंट को नए खुले मॉडलों के लिए संदर्भ बिंदु के रूप में शामिल किया।

Use Cases and Ecosystem

Qwen2.5 मॉडल को कई फ्रेमवर्क और प्लेटफार्मों में एकीकृत किया गया है, जिसमें Hugging Face Transformers, vLLM, और Groq हार्डवेयर एक्सेलेरेटर शामिल हैं। SambaNova और Graphcore ने कम-विलंबता तैनाती चाहने वाले उद्यमों के लिए अनुकूलित अनुमान पथ भी प्रदान किए।

डेवलपर्स ने चैटबॉट अनुप्रयोगों, सामग्री निर्माण, संरचित डेटा निष्कर्षण, और डोमेन-विशिष्ट कॉर्पोरा पर फाइन-ट्यूनिंग के लिए मॉडल का उपयोग किया है। खुले वजन ने Model Pruning और क्वांटाइजेशन को सक्षम किया, जिससे एज डिवाइस और मोबाइल प्लेटफार्मों पर तैनाती की अनुमति मिली।

Alibaba Cloud, Google Cloud, और Oracle Cloud जैसे क्लाउड प्रदाताओं ने प्रबंधित सेवाएं प्रदान कीं। स्वास्थ्य सेवा, वित्त, और ग्राहक सहायता जैसे क्षेत्रों में उद्यम उपयोगकर्ताओं ने बेस मॉडल को अनुकूलित किया है, हालांकि सटीक तैनाती अक्सर सार्वजनिक रूप से विस्तृत नहीं होती है।

Impact and Legacy

Qwen श्रृंखला के हिस्से के रूप में, Qwen2.5 ने वैश्विक LLM परिदृश्य में Alibaba Cloud की स्थिति को मजबूत किया। रिलीज़ ने उच्च-प्रदर्शन खुले-वजन मॉडलों की प्रवृत्ति को जारी रखा जो मालिकाना पेशकशों को चुनौती देते हैं, जिससे Berkeley AI Research और Stanford AI Lab समुदायों को अधिक खुली मूल्यांकन प्रथाओं की ओर धकेला गया।

कई पैरामीटर आकारों की उपलब्धता ने छोटे प्रयोगशालाओं और व्यक्तिगत शोधकर्ताओं के लिए बाधाओं को कम किया, जिससे मामूली हार्डवेयर पर फाइन-ट्यूनिंग सक्षम हुई। मॉडल परिवार ने लाइसेंसिंग, प्रतिलिपि प्रस्तुतिकरण, और उन्नत AI क्षमताओं तक समान पहुंच के बारे में OpenPanel चर्चाओं में भी योगदान दिया।

जबकि तेजी से विकसित होने वाला क्षेत्र जल्द ही उत्तराधिकारियों को देखता था, Qwen2.5 2024 के माध्यम से और 2025 तक एक प्रतिस्पर्धी संदर्भ बिंदु बना रहा, जिसके निर्देश-ट्यून वेरिएंट 2025 की शुरुआत तक सक्रिय उपयोग में थे।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:large-language-model·open-source-ai·alibaba-cloud·generative-ai
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास