अंग्रेज़ी से अनुवादित

DeepSeek-V3,一个拥有6710亿参数的混合专家大型语言模型,于2024年12月由中国人工智能公司DeepSeek发布,与OpenAI和Google的闭源模型相抗衡。

DeepSeek-V3 एक बड़ा भाषा मॉडल है जिसे DeepSeek द्वारा विकसित किया गया है, जो चीन के झेजियांग प्रांत के हांगझोउ में स्थित एक चीनी कृत्रिम बुद्धिमत्ता कंपनी है। दिसंबर 2024 में जारी, यह मॉडल मिश्रित-विशेषज्ञ (MoE) वास्तुकला का उपयोग करता है जिसमें कुल 671 बिलियन पैरामीटर हैं, जिनमें से 37 बिलियन प्रति टोकन सक्रिय होते हैं। इसे OpenAI, Anthropic, और Google DeepMind के स्वामित्व वाले मॉडलों के साथ प्रतिस्पर्धा करने के लिए डिज़ाइन किया गया था, जबकि इसे एक खुले-वजन मॉडल के रूप में जारी किया गया, जिसका अर्थ है कि इसके पैरामीटर सार्वजनिक रूप से साझा किए जाते हैं, हालांकि प्रशिक्षण डेटा खुले तौर पर लाइसेंस प्राप्त नहीं है।

DeepSeek-V3 का लॉन्च Generative AI परिदृश्य में एक महत्वपूर्ण मील का पत्थर साबित हुआ, यह प्रदर्शित करते हुए कि उच्च-प्रदर्शन वाले मॉडल पुराने हार्डवेयर पर कुशलतापूर्वक प्रशिक्षित किए जा सकते हैं, आंशिक रूप से चीन को उन्नत चिप निर्यात पर अमेरिकी प्रतिबंधों के कारण। मॉडल की रिलीज़ के साथ तकनीकी रिपोर्ट और खुले वजन भी शामिल थे, जिससे शोधकर्ताओं और डेवलपर्स को इसे उपयोग और फाइन-ट्यून करने की अनुमति मिली, जिससे विभिन्न अनुप्रयोगों में इसका तेजी से अपनाना संभव हुआ।

पृष्ठभूमि

DeepSeek की स्थापना जुलाई 2023 में लियांग वेनफेंग द्वारा की गई थी, जिन्होंने High-Flyer की सह-स्थापना भी की, जो एक चीनी हेज फंड है जो शुरू में एआई-संचालित ट्रेडिंग पर केंद्रित था। कंपनी की उत्पत्ति High-Flyer के GPU-आधारित कंप्यूटिंग क्लस्टरों में निवेश से जुड़ी है, जो 2019 में Fire-Flyer से शुरू हुई, जिसमें 200 Gbit/s पर जुड़े 1,100 GPU शामिल थे। 2021 तक, High-Flyer ने अमेरिकी निर्यात प्रतिबंधों के प्रभावी होने से पहले 10,000 Nvidia A100 GPU प्राप्त कर लिए थे, जिससे Fire-Flyer 2 का निर्माण संभव हुआ, जो 625 नोड्स में 5,000 PCIe A100 GPU वाला एक बड़ा क्लस्टर था।

DeepSeek का मिशन कृत्रिम सामान्य बुद्धिमत्ता अनुसंधान को आगे बढ़ाना है, जिसमें खुले-वजन मॉडलों पर ध्यान केंद्रित किया गया है। कंपनी शीर्ष चीनी विश्वविद्यालयों से शोधकर्ताओं की भर्ती करती है और मॉडल क्षमताओं को व्यापक बनाने के लिए कविता और उन्नत गणित जैसे गैर-पारंपरिक क्षेत्रों से भी नियुक्तियाँ करती है। यह दृष्टिकोण, अनुसंधान-प्रथम रणनीति के साथ मिलकर, DeepSeek को मॉडल वास्तुकला और प्रशिक्षण दक्षता में नवाचार करने की अनुमति देता है।

मॉडल वास्तुकला

DeepSeek-V3 मिश्रित-विशेषज्ञ वास्तुकला का उपयोग करता है, एक डिज़ाइन जो मॉडल को कई विशेष उप-नेटवर्कों, या विशेषज्ञों में विभाजित करता है, और प्रत्येक इनपुट के लिए केवल एक उपसमुच्चय सक्रिय करता है। यह दृष्टिकोण उच्च क्षमता बनाए रखते हुए कम्प्यूटेशनल लागत को कम करता है। मॉडल में 671 बिलियन पैरामीटर हैं, लेकिन प्रति टोकन केवल 37 बिलियन सक्रिय होते हैं, जिससे कुशल अनुमान और प्रशिक्षण संभव होता है।

वास्तुकला में मल्टी-हेड लेटेंट अटेंशन और सहायक-हानि-मुक्त लोड संतुलन जैसे नवाचार शामिल हैं, जो प्रशिक्षण स्थिरता और प्रदर्शन में सुधार करते हैं। ये तकनीकें Transformer (architecture) मॉडल और Multi-Head Attention में पहले के काम पर आधारित हैं, जिससे DeepSeek-V3 लंबे संदर्भों और जटिल तर्क कार्यों को प्रभावी ढंग से संभाल सकता है।

प्रशिक्षण और बुनियादी ढांचा

DeepSeek-V3 को Fire-Flyer 2 पर प्रशिक्षित किया गया था, जो कस्टम सॉफ्टवेयर और हार्डवेयर के साथ सह-डिज़ाइन किया गया एक कंप्यूटिंग क्लस्टर है। क्लस्टर 200 Gbps इंटरकनेक्ट और उच्च बाइसेक्शन बैंडविड्थ के लिए फैट-ट्री नेटवर्क टोपोलॉजी के साथ Nvidia GPU का उपयोग करता है। सॉफ्टवेयर स्टैक में 3FS शामिल है, जो एसिंक्रोनस रैंडम रीड के लिए अनुकूलित एक वितरित समानांतर फ़ाइल सिस्टम है, और hfreduce, एसिंक्रोनस संचार के लिए एक लाइब्रेरी है।

इस पैमाने के मॉडल को प्रशिक्षित करने के लिए महत्वपूर्ण कम्प्यूटेशनल संसाधनों की आवश्यकता थी। DeepSeek ने बताया कि Fire-Flyer 2 का उपयोग 2022 में 96% से अधिक क्षमता पर किया गया था, जो कुल 56.74 मिलियन GPU घंटे था। क्लस्टर का डिज़ाइन दक्षता पर जोर देता है, शुरू में PCIe A100 GPU का उपयोग करते हुए क्योंकि मॉडल 40 GB VRAM के भीतर फिट होते थे, बाद में मॉडल समानांतरता की आवश्यकता वाले बड़े मॉडलों के लिए NVLinks और NCCL को शामिल किया गया।

प्रशिक्षण प्रक्रिया में स्थिरता सुनिश्चित करने के लिए Adam (Optimizer) वेरिएंट, Learning Rate Scheduling, और Gradient Clipping जैसी तकनीकों का उपयोग किया गया होगा। एल्गोरिथमिक दक्षता पर DeepSeek का ध्यान इसे हार्डवेयर बाधाओं के बावजूद प्रतिस्पर्धी मॉडल प्रशिक्षित करने की अनुमति देता है, एक रणनीति जिसे अमेरिकी चिप प्रतिबंधों की प्रतिक्रिया के रूप में नोट किया गया है।

प्रदर्शन और बेंचमार्क

DeepSeek-V3 ने विभिन्न बेंचमार्कों पर प्रतिस्पर्धी प्रदर्शन प्रदर्शित किया, जो OpenAI और Google DeepMind के बंद-स्रोत मॉडलों को टक्कर देता है। आंतरिक मूल्यांकन में, इसने प्राकृतिक भाषा समझ, कोड निर्माण और गणितीय तर्क में मजबूत परिणाम प्राप्त किए। उदाहरण के लिए, यह कुछ कोडिंग कार्यों में GPT-4o जैसे मॉडलों से बेहतर प्रदर्शन करने की सूचना दी गई, हालांकि लॉन्च के समय स्वतंत्र सत्यापन सीमित था।

मॉडल की खुली-वजन प्रकृति ने अनुसंधान समुदाय को इसकी क्षमताओं का परीक्षण और सत्यापन करने की अनुमति दी, जिससे शैक्षणिक और वाणिज्यिक दोनों सेटिंग्स में व्यापक रूप से अपनाया गया। इसकी दक्षता और प्रदर्शन ने इसे सीमित कम्प्यूटेशनल संसाधनों वाले संगठनों के लिए विशेष रूप से आकर्षक बना दिया।

रिलीज़ और स्वागत

दिसंबर 2024 में DeepSeek-V3 की रिलीज़ को एआई समुदाय में महत्वपूर्ण ध्यान मिला। इसे एक प्रमाण बिंदु के रूप में देखा गया कि खुले-वजन मॉडल स्वामित्व प्रणालियों को चुनौती दे सकते हैं, जिससे एआई विकास के भविष्य के बारे में बहस छिड़ गई। मॉडल को Microsoft Azure और Perplexity AI जैसे क्लाउड प्रदाताओं द्वारा होस्ट किया गया था, जिससे यह व्यापक दर्शकों के लिए सुलभ हो गया।

आलोचकों ने नोट किया कि DeepSeek का खुला-वजन दृष्टिकोण, पैरामीटरों के बारे में पारदर्शी होते हुए भी, प्रशिक्षण डेटा का खुलासा नहीं करता, जिससे डेटा उत्पत्ति और संभावित पूर्वाग्रहों के बारे में प्रश्न उठते हैं। इसके अतिरिक्त, कंपनी के High-Flyer से संबंध और इसके शोधकर्ताओं के चीनी रक्षा संस्थानों के साथ जुड़ाव ने जांच को आकर्षित किया, हालांकि DeepSeek ने कहा कि इसका ध्यान अनुसंधान पर है।

प्रभाव और विरासत

DeepSeek-V3 ने एआई क्षेत्र में बाद के विकास को प्रभावित किया, जिसमें जनवरी 2025 में DeepSeek-R1 की रिलीज़ शामिल है, जिसमें तर्क क्षमताएं शामिल थीं। मॉडल ने कुशल एआई के व्यापक रुझान में भी योगदान दिया, अन्य कंपनियों को कम संसाधन खपत के लिए अनुकूलन करने के लिए प्रोत्साहित किया।

लॉन्च के भू-राजनीतिक निहितार्थ थे, जो निर्यात नियंत्रणों के बावजूद चीनी कंपनियों की नवाचार करने की क्षमता को उजागर करते हैं। इसने एआई के लोकतंत्रीकरण के बारे में चर्चाओं को भी बढ़ावा दिया, क्योंकि खुले-वजन मॉडल उन्नत तकनीक तक व्यापक पहुंच सक्षम करते हैं।

भविष्य की दिशाएँ

DeepSeek-V3 के बाद, DeepSeek ने ओपन-सोर्स लाइसेंस के तहत मॉडल जारी करना जारी रखा, अपने पोर्टफोलियो का विस्तार किया। अनुसंधान और दक्षता पर ध्यान केंद्रित करने की कंपनी की रणनीति इसे वैश्विक एआई परिदृश्य में एक प्रमुख खिलाड़ी के रूप में स्थापित करती है। 2025 तक, Fire-Flyer 2 परिचालन में बना रहा, जो चल रहे अनुसंधान और विकास का समर्थन करता है।

अफ्रीका में DeepSeek का विस्तार, किफायती और ऊर्जा-कुशल एआई समाधान पेश करते हुए, कम सेवा वाले बाजारों तक पहुंचने की इसकी महत्वाकांक्षा को दर्शाता है। कंपनी के भविष्य के रिलीज़ DeepSeek-V3 के साथ पेश किए गए नवाचारों पर निर्माण करने की संभावना है, जो संभावित रूप से Large language model की अगली पीढ़ी को प्रभावित करेंगे।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:deepseek-v3·large-language-model·ai-launch·open-weights
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास