DeepSeek V3.1 बड़े भाषा मॉडलों का एक परिवार है, जिसे चीनी AI कंपनी DeepSeek द्वारा विकसित किया गया है। 2025 में जारी, यह DeepSeek V3 का उत्तराधिकारी है, जिसे 2024 के अंत में पेश किया गया था। V3.1 परिवार में चार प्रकार शामिल हैं जो सार्वजनिक LLM और मीडिया लीडरबोर्ड पर दिखाई दिए हैं, हालांकि कंपनी ने उन सभी के लिए विस्तृत तकनीकी विशिष्टताएँ प्रकाशित नहीं की हैं। मॉडल सामान्य-उद्देश्य पाठ निर्माण, तर्क, और कोडिंग कार्यों के लिए डिज़ाइन किए गए हैं, और ओपन-सोर्स लाइसेंस के तहत उपलब्ध हैं।
DeepSeek V3.1 का विकास Transformer (architecture) वास्तुकला पर आधारित है, विशेष रूप से एक Mixture-of-Experts (MoE) डिज़ाइन का उपयोग करते हुए जो प्रति टोकन केवल पैरामीटरों का एक उपसमुच्चय सक्रिय करता है, जिससे कम्प्यूटेशनल दक्षता में सुधार होता है। मॉडल परिवार जनरेटिव AI में तेजी से बड़े और सक्षम सिस्टम की ओर व्यापक प्रवृत्ति का हिस्सा है, जो OpenAI, Anthropic, और Google DeepMind की पेशकशों के साथ प्रतिस्पर्धा करता है। DeepSeek ने V3.1 को एक लागत-प्रभावी विकल्प के रूप में स्थापित किया है, जिसमें प्रशिक्षण और अनुमान लागत कई पश्चिमी समकक्षों की तुलना में काफी कम है।
आर्किटेक्चर और प्रशिक्षण
DeepSeek V3.1 एक तंत्रिका नेटवर्क का उपयोग करता है जिसमें Mixture-of-Experts आर्किटेक्चर है, जहाँ प्रत्येक टोकन को कुछ विशेषज्ञ मॉड्यूल द्वारा संसाधित किया जाता है। यह डिज़ाइन उच्च मॉडल क्षमता बनाए रखते हुए प्रति टोकन कम्प्यूटेशनल लागत को कम करता है। आधार मॉडल, DeepSeek V3, में कुल 671 बिलियन पैरामीटर थे, जिनमें से 37 बिलियन प्रति टोकन सक्रिय होते थे; V3.1 संभवतः समान संरचना का पालन करता है, हालांकि नए प्रकारों के लिए सटीक पैरामीटर संख्या आधिकारिक रूप से खुलासा नहीं की गई है। मॉडलों को गहन शिक्षण तकनीकों का उपयोग करके प्रशिक्षित किया जाता है, जिसमें पर्यवेक्षित फाइन-ट्यूनिंग और मानव प्रतिक्रिया से सुदृढीकरण सीखना (RLHF) शामिल है, ताकि आउटपुट को मानव प्राथमिकताओं के साथ संरेखित किया जा सके।
V3.1 के लिए प्रशिक्षण डेटा में बहुभाषी पाठ का एक बड़ा कोर्पस शामिल है, जिसमें अंग्रेजी और चीनी पर ध्यान केंद्रित किया गया है। कंपनी ने डेटासेट के आकार या संरचना के बारे में विशिष्ट विवरण जारी नहीं किए हैं, लेकिन यह ज्ञात है कि DeepSeek सार्वजनिक रूप से उपलब्ध वेब डेटा और स्वामित्व स्रोतों के संयोजन का उपयोग करता है। प्रशिक्षण प्रक्रिया GPU क्लस्टरों का लाभ उठाती है, और DeepSeek ने प्रशिक्षण दक्षता को अनुकूलित करने पर शोध प्रकाशित किया है, जिसमें FP8 मिश्रित-परिशुद्धता प्रशिक्षण का उपयोग शामिल है।
प्रकार और बेंचमार्क
DeepSeek V3.1 के चार प्रकार सार्वजनिक बेंचमार्क स्नैपशॉट में पहचाने गए हैं, जो संभवतः पैरामीटर संख्या या फाइन-ट्यूनिंग में भिन्न हैं। इन प्रकारों का मानक LLM बेंचमार्क जैसे MMLU (ज्ञान), HumanEval (कोड निर्माण), और MATH (गणितीय तर्क) पर मूल्यांकन किया गया है। उदाहरण के लिए, एक प्रकार कथित तौर पर MMLU पर 88.5% का स्कोर प्राप्त करता है, जो उसी परीक्षण पर मूल V3 के 86.2% से बेहतर है। HumanEval पर, एक प्रकार 82.3% स्कोर करता है, जबकि V3 का 78.1% है। ये स्कोर V3.1 को शीर्ष-प्रदर्शन करने वाले ओपन-वेट मॉडलों में रखते हैं, हालांकि विशिष्ट संख्याएँ प्रकार और मूल्यांकन सेटअप के अनुसार भिन्न होती हैं।
मीडिया लीडरबोर्ड पर, जैसे LMArena (Chatbot Arena) Elo रेटिंग, DeepSeek V3.1 प्रकारों ने 1300-1400 की सीमा में Elo स्कोर प्राप्त किए हैं, जो GPT-4o और Claude 3.5 Sonnet जैसे स्वामित्व मॉडलों के बराबर है। हालांकि, सटीक Elo रेटिंग परिवर्तन के अधीन हैं क्योंकि अधिक उपयोगकर्ता वोट एकत्र किए जाते हैं। मॉडल कोडिंग कार्यों में भी मजबूत प्रदर्शन दिखाते हैं, जिसमें एक प्रकार SWE-bench बेंचमार्क पर 75.4% का pass@1 स्कोर प्राप्त करता है, जो वास्तविक दुनिया की सॉफ्टवेयर इंजीनियरिंग समस्याओं का परीक्षण करता है।
रिलीज़ और उपलब्धता
DeepSeek V3.1 को 2025 की शुरुआत में जारी किया गया था, जिसमें पहले प्रकार कंपनी के API और ओपन-सोर्स डाउनलोड के रूप में दिखाई दिए। मॉडल MIT लाइसेंस के तहत वितरित किए जाते हैं, जो वाणिज्यिक और शोध उपयोग की अनुमति देता है। DeepSeek ने मॉडल वेट Hugging Face पर उपलब्ध कराए हैं, और अनुमान के लिए कोड GitHub पर प्रदान किया गया है। कंपनी एक API भी प्रदान करती है जिसकी कीमत OpenAI या Anthropic के तुलनीय मॉडलों की तुलना में काफी कम है - उदाहरण के लिए, इनपुट टोकन की कीमत $0.27 प्रति मिलियन और आउटपुट टोकन की $1.10 प्रति मिलियन है, रिलीज़ तिथि के अनुसार।
रिलीज़ के साथ एक तकनीकी रिपोर्ट भी थी जो प्रशिक्षण पद्धति और मूल्यांकन परिणामों का विवरण देती है, हालांकि कुछ विशिष्टताएँ, जैसे प्रशिक्षण टोकन की सटीक संख्या, छोड़ दी गई हैं। DeepSeek ने मॉडल आर्किटेक्चर में मल्टी-हेड अटेंशन और पोजीशनल एन्कोडिंग के उपयोग पर एक पेपर भी प्रकाशित किया है, जो मशीन लर्निंग पर व्यापक शैक्षणिक साहित्य में योगदान देता है।
स्वागत और प्रभाव
DeepSeek V3.1 की रिलीज़ ने AI समुदाय में महत्वपूर्ण ध्यान आकर्षित किया, क्योंकि इसका प्रतिस्पर्धी प्रदर्शन स्वामित्व मॉडलों की लागत के एक अंश पर था। सोशल मीडिया और तकनीकी प्रेस में इस पर व्यापक रूप से चर्चा हुई, कुछ टिप्पणीकारों ने नोट किया कि यह चीनी AI कंपनियों की तीव्र प्रगति को प्रदर्शित करता है। मॉडल की ओपन-सोर्स प्रकृति ने शोध और उद्योग में इसके अपनाने को सुविधाजनक बनाया है, और इसे विभिन्न तृतीय-पक्ष उपकरणों और प्लेटफार्मों में एकीकृत किया गया है।
हालांकि, कुछ विशेषज्ञों ने प्रशिक्षण डेटा और संभावित पूर्वाग्रहों के बारे में पारदर्शिता की कमी के बारे में चिंताएँ उठाई हैं। DeepSeek ने एक विस्तृत मॉडल कार्ड जारी नहीं किया है, और स्वतंत्र ऑडिट नहीं किए गए हैं। 2025 तक, मॉडल अभी भी सक्रिय विकास में है, और भविष्य के अपडेट की उम्मीद है।
पूर्ववर्तियों के साथ तुलना
DeepSeek V3.1 कई प्रमुख क्षेत्रों में V3 में सुधार करता है, जिसमें तर्क, कोडिंग, और बहुभाषी समझ शामिल हैं। कंपनी रिपोर्ट करती है कि V3.1 V3 की तुलना में 12 मानक बेंचमार्कों में औसतन 2.3% सुधार प्राप्त करता है। उदाहरण के लिए, MMLU बेंचमार्क पर, V3.1 88.5% स्कोर करता है जबकि V3 का 86.2% है, और HumanEval बेंचमार्क पर, यह 82.3% बनाम 78.1% स्कोर करता है। सुधार बेहतर प्रशिक्षण डेटा, अधिक परिष्कृत फाइन-ट्यूनिंग, और आर्किटेक्चरल बदलावों के लिए जिम्मेदार हैं।
V3 के विपरीत, जिसमें एक एकल मॉडल था, V3.1 प्रकारों का एक परिवार है, जो उपयोगकर्ताओं को प्रदर्शन और संसाधन उपयोग को संतुलित करने वाला मॉडल चुनने की अनुमति देता है। यह दृष्टिकोण अन्य प्रदाताओं, जैसे OpenAI के GPT-4o और GPT-4o mini के समान है, हालांकि DeepSeek के सभी प्रकार ओपन-वेट हैं। V3.1 की रिलीज़ में अद्यतन टोकनाइज़र और संदर्भ लंबाई भी शामिल है, जिसमें 128K टोकन तक का समर्थन है, जो अग्रणी मॉडलों की क्षमताओं से मेल खाता है।
भविष्य की दिशाएँ
DeepSeek अपने मॉडल परिवार पर पुनरावृत्ति जारी रखता है, और V3.1 के बाद आगे के अपडेट की उम्मीद है। कंपनी ने मल्टीमॉडल क्षमताओं पर काम करने का संकेत दिया है, जो मॉडल को पाठ के अलावा छवियों और ऑडियो को संसाधित करने की अनुमति देगा। 2025 तक, V4 के लिए कोई आधिकारिक रिलीज़ तिथि घोषित नहीं की गई है, लेकिन विकास की तीव्र गति बताती है कि नए संस्करण वर्ष के भीतर दिखाई देंगे। कृत्रिम बुद्धिमत्ता में वैश्विक प्रतिस्पर्धा के संदर्भ में DeepSeek के मॉडलों का व्यापक AI परिदृश्य पर प्रभाव रुचि का विषय बना हुआ है।