अंग्रेज़ी से अनुवादित

DeepSeek V3 डीपसीक द्वारा विकसित एक बड़ा भाषा मॉडल है, जिसे दिसंबर 2024 में जारी किया गया था। यह 671B कुल पैरामीटर वाला एक मिश्रण-ऑफ-एक्सपर्ट्स ट्रांसफॉर्मर है, जो सार्वजनिक बेंचमार्क पर मजबूत प्रदर्शन और लागत-कुशल प्रशिक्षण के लिए जाना जाता है।

DeepSeek V3 एक बड़ा भाषा मॉडल है जिसे चीनी AI कंपनी DeepSeek द्वारा विकसित किया गया है, और इसे पहली बार 26 दिसंबर 2024 को जारी किया गया था। यह ट्रांसफॉर्मर-आधारित वास्तुकला है जो मिश्रण-ऑफ-एक्सपर्ट्स (MoE) डिज़ाइन का उपयोग करती है, जिसमें कुल 671 बिलियन पैरामीटर हैं, जिनमें से 37 बिलियन प्रति टोकन सक्रिय होते हैं। मॉडल को 14.8 ट्रिलियन टोकन पर प्रशिक्षित किया गया था और यह अपनी लागत-कुशल प्रशिक्षण प्रक्रिया के लिए उल्लेखनीय है, जिसमें कथित तौर पर केवल 2.788 मिलियन H800 GPU घंटे का उपयोग किया गया था।

DeepSeek V3 अपनी रिलीज़ के तुरंत बाद सार्वजनिक LLM और मीडिया लीडरबोर्ड पर दिखाई दिया, जिसमें बेंचमार्क स्नैपशॉट कई वेरिएंट्स में लगातार प्रदर्शन दिखाते हैं। मॉडल परिवार में इन स्नैपशॉट्स में कम से कम पाँच वेरिएंट शामिल हैं, जो विभिन्न कॉन्फ़िगरेशन या फाइन-ट्यूनिंग स्थितियों को दर्शाते हैं, हालाँकि प्रत्येक वेरिएंट के विशिष्ट विवरण सार्वजनिक रूप से प्रलेखित नहीं हैं। बेस मॉडल और इसके निर्देश-ट्यून किए गए संस्करण का मानक शैक्षणिक बेंचमार्क पर मूल्यांकन किया गया है।

आर्किटेक्चर और प्रशिक्षण

DeepSeek V3 एक गहन शिक्षण वास्तुकला का उपयोग करता है जिसमें ट्रांसफॉर्मर ब्लॉक की 61 परतें हैं। यह कुशल अनुमान के लिए मल्टी-हेड लेटेंट अटेंशन (MLA) को शामिल करता है और फीड-फॉरवर्ड परतों के लिए DeepSeekMoE संरचना का उपयोग करता है, जहाँ प्रत्येक टोकन केवल विशेषज्ञों के एक उपसमूह को सक्रिय करता है। मॉडल 128,000 टोकन की शब्दावली का उपयोग करता है और 128K टोकन की संदर्भ लंबाई का समर्थन करता है।

प्रशिक्षण सीखने की दर अनुसूची का उपयोग करके 2.4e-3 की चरम सीखने की दर के साथ आयोजित किया गया था, जिसे बड़े पैमाने पर प्रशिक्षण के लिए अनुकूलित ग्रेडिएंट क्लिपिंग और बैच सामान्यीकरण तकनीकों के साथ जोड़ा गया था। डेटासेट में 14.8 ट्रिलियन टोकन शामिल थे, मुख्य रूप से अंग्रेजी और चीनी में, जो वेब टेक्स्ट, पुस्तकों और अन्य क्यूरेटेड कॉर्पोरा से प्राप्त किए गए थे। प्रशिक्षण प्रक्रिया में TSMC-निर्मित H800 GPU का उपयोग किया गया था, जिसकी अंतिम प्रशिक्षण रन के लिए लगभग $5.6 मिलियन की रिपोर्ट की गई लागत थी।

प्रदर्शन और बेंचमार्क

सार्वजनिक बेंचमार्क पर, DeepSeek V3 ने उल्लेखनीय स्कोर हासिल किए। MMLU (मैसिव मल्टीटास्क लैंग्वेज अंडरस्टैंडिंग) बेंचमार्क पर, इसने 5-शॉट सेटिंग में 88.5% स्कोर किया। MATH-500 बेंचमार्क पर, इसने ज़ीरो-शॉट सेटिंग में 90.2% हासिल किया। मॉडल ने कोडिंग कार्यों पर भी अच्छा प्रदर्शन किया, HumanEval पर 82.6% और अधिक चुनौतीपूर्ण LiveCodeBench पर 67.3% स्कोर किया।

समकालीन मॉडलों की तुलना में, DeepSeek V3 का प्रदर्शन ओपनएआई और एंथ्रोपिक के प्रमुख मालिकाना सिस्टम के साथ प्रतिस्पर्धी था, जबकि प्रशिक्षित करना काफी सस्ता था। GPQA (ग्रेजुएट-लेवल गूगल-प्रूफ क्यू एंड ए) बेंचमार्क पर, इसने ज़ीरो-शॉट सेटिंग में 59.1% स्कोर किया, और DROP बेंचमार्क पर, इसने 3-शॉट सेटिंग में 91.6% हासिल किया।

रिलीज़ और वेरिएंट

26 दिसंबर 2024 को प्रारंभिक रिलीज़ में बेस मॉडल और चैट-अनुकूलित संस्करण, DeepSeek-V3-Chat शामिल थे। दोनों MIT लाइसेंस के तहत उपलब्ध कराए गए थे, जिससे व्यावसायिक उपयोग और संशोधन की अनुमति मिलती है। मॉडल वेट्स को Hugging Face और अन्य प्लेटफार्मों के माध्यम से वितरित किया गया था, जिससे जनरेटिव एआई समुदाय में व्यापक अपनाने में सक्षम बनाया गया।

शुरुआती 2025 के सार्वजनिक बेंचमार्क स्नैपशॉट DeepSeek V3 के कम से कम पाँच अलग-अलग वेरिएंट दिखाते हैं, जो संभवतः विभिन्न फाइन-ट्यूनिंग रन या क्वांटाइज़ेशन स्तरों का प्रतिनिधित्व करते हैं। ये वेरिएंट LMSYS Chatbot Arena और Open LLM Leaderboard जैसे लीडरबोर्ड पर दिखाई दिए हैं, हालाँकि प्रत्येक वेरिएंट का सटीक कॉन्फ़िगरेशन आधिकारिक रूप से प्रलेखित नहीं है। शुरुआती 2025 तक, बेस और चैट संस्करणों के अलावा कोई अतिरिक्त आधिकारिक वेरिएंट घोषित नहीं किया गया था।

प्रभाव और स्वागत

DeepSeek V3 की रिलीज़ ने कृत्रिम बुद्धिमत्ता समुदाय में उच्च प्रदर्शन और कम प्रशिक्षण लागत के संयोजन के कारण महत्वपूर्ण ध्यान आकर्षित किया। इसने प्रदर्शित किया कि कुशल प्रशिक्षण तकनीकें काफी बड़े बजट के साथ विकसित मॉडलों की क्षमताओं का मुकाबला कर सकती हैं। MIT लाइसेंस के तहत मॉडल की ओपन-सोर्स प्रकृति ने विभिन्न अनुप्रयोगों और अनुसंधान परियोजनाओं में इसके तेजी से एकीकरण में योगदान दिया।

आलोचकों और विश्लेषकों ने नोट किया कि DeepSeek V3 की प्रशिक्षण दक्षता आंशिक रूप से इसकी MoE वास्तुकला के कारण थी, जो अनुमान के दौरान कम्प्यूटेशनल लागत को कम करती है। हालाँकि, मॉडल की बड़ी कुल पैरामीटर गिनती पर निर्भरता अभी भी तैनाती के लिए पर्याप्त मेमोरी की आवश्यकता होती है। मॉडल ने मशीन लर्निंग के प्रतिस्पर्धी परिदृश्य के बारे में भी चर्चाएँ शुरू कीं, विशेष रूप से ओपन-सोर्स मॉडल को आगे बढ़ाने में चीनी AI कंपनियों की भूमिका के बारे में।

तकनीकी विवरण और सीमाएँ

DeepSeek V3 एक कस्टम स्थितीय एन्कोडिंग योजना का उपयोग करता है और मल्टी-हेड अटेंशन तंत्र का उपयोग करता है। यह अपनी अटेंशन परतों में पारंपरिक ड्रॉपआउट का उपयोग नहीं करता है, जो एक डिज़ाइन विकल्प है जो प्रशिक्षण दक्षता में सुधार करता है। मॉडल का अनुमान नियंत्रित पीढ़ी के लिए टॉप-पी सैंपलिंग और तापमान स्केलिंग का समर्थन करता है।

अपनी ताकत के बावजूद, DeepSeek V3 की सीमाएँ हैं। यह अपने प्रशिक्षण डेटा में मौजूद पूर्वाग्रहों को प्रदर्शित कर सकता है, और चीनी के अलावा गैर-अंग्रेजी भाषाओं पर इसका प्रदर्शन कम गहनता से मूल्यांकित किया गया है। मॉडल की बड़ी मेमोरी फुटप्रिंट उपभोक्ता हार्डवेयर पर तैनाती को सीमित करती है, जिसके लिए कुछ सेटिंग्स में व्यावहारिक उपयोग के लिए मॉडल प्रूनिंग या क्वांटाइज़ेशन की आवश्यकता होती है। शुरुआती 2025 तक, मॉडल को किसी उत्तराधिकारी के साथ अपडेट नहीं किया गया है, हालाँकि DeepSeek में चल रहे शोध जारी हैं।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:large-language-model·artificial-intelligence·open-source-software·chinese-ai
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास