अंग्रेज़ी से अनुवादित

मई 2024 में जारी DeepSeek-V2, चीनी AI कंपनी DeepSeek द्वारा विकसित एक Mixture-of-Experts बड़ा भाषा मॉडल है, जो अपनी कम प्रशिक्षण लागत और समान मॉडलों की तुलना में उच्च प्रदर्शन के लिए उल्लेखनीय है।

DeepSeek-V2 एक बड़ा भाषा मॉडल है जिसे चीनी कृत्रिम बुद्धिमत्ता कंपनी DeepSeek ने मई 2024 में जारी किया था। यह मिश्रित-विशेषज्ञ (MoE) वास्तुकला का उपयोग करता है, जो प्रत्येक इनपुट के लिए केवल अपने मापदंडों का एक उपसमूह सक्रिय करता है, जिससे कुशल गणना और कम प्रशिक्षण लागत सक्षम होती है। मॉडल को पश्चिमी डेवलपर्स के समकालीन मॉडलों के उच्च-प्रदर्शन विकल्प के रूप में स्थापित किया गया था, जिसकी रिपोर्ट की गई प्रशिक्षण लागत तुलनीय प्रणालियों की तुलना में काफी कम थी।

DeepSeek-V2 का विमोचन बड़े भाषा मॉडल में तेजी से प्रगति की अवधि के दौरान हुआ, जब OpenAI, Anthropic, और Google DeepMind जैसे डेवलपर्स भी नई प्रणालियाँ प्रकाशित कर रहे थे। DeepSeek का दृष्टिकोण खुले वजन और लागत दक्षता पर जोर देने में भिन्न था, जो हार्डवेयर बाधाओं के तहत एल्गोरिदमिक दक्षता को अधिकतम करने की कंपनी की व्यापक रणनीति के अनुरूप था।

वास्तुकला और डिज़ाइन

DeepSeek-V2 एक ट्रांसफॉर्मर वास्तुकला पर बनाया गया है, जो आधुनिक जनरेटिव AI प्रणालियों के लिए प्रमुख ढांचा है। इसकी परिभाषित विशेषता मिश्रित-विशेषज्ञ डिज़ाइन है, जो मॉडल के मापदंडों को कई विशेषज्ञ मॉड्यूल में विभाजित करता है। अनुमान के दौरान, एक गेटिंग तंत्र प्रत्येक टोकन के लिए केवल कुछ विशेषज्ञों का चयन करता है, जिससे कुल बड़ी पैरामीटर संख्या बनाए रखते हुए कम्प्यूटेशनल भार कम होता है।

मॉडल में दक्षता में सुधार के लिए मल्टी-हेड अटेंशन और पोजीशनल एन्कोडिंग में नवाचार शामिल हैं। विशेष रूप से, DeepSeek-V2 ने एक नया अटेंशन तंत्र पेश किया जो कुंजी-मूल्य कैश की मेमोरी फुटप्रिंट को कम करता है, जो लंबे-संदर्भ कार्यों में एक सामान्य बाधा है। यह डिज़ाइन विकल्प मॉडल को हार्डवेयर आवश्यकताओं को आनुपातिक रूप से बढ़ाए बिना लंबे अनुक्रमों को संभालने की अनुमति देता है।

समान पैरामीटर आकार के घने मॉडलों की तुलना में, DeepSeek-V2 को प्रशिक्षण और अनुमान दोनों के दौरान प्रति टोकन कम फ्लोटिंग-पॉइंट ऑपरेशन की आवश्यकता होती है। कंपनी ने बताया कि मॉडल ने काफी कम कंप्यूट का उपयोग करते हुए अग्रणी प्रणालियों के साथ प्रतिस्पर्धी प्रदर्शन हासिल किया, जिसका श्रेय MoE वास्तुकला और प्रशिक्षण पाइपलाइन की सावधानीपूर्वक इंजीनियरिंग को दिया गया।

प्रशिक्षण और लागत

DeepSeek-V2 को Fire-Flyer 2 कंप्यूटिंग क्लस्टर पर प्रशिक्षित किया गया था, जो DeepSeek की मूल कंपनी High-Flyer द्वारा संचालित एक कस्टम-निर्मित प्रणाली है। क्लस्टर में उच्च बैंडविड्थ पर जुड़े हजारों Nvidia GPU शामिल हैं, जिसमें 3FS वितरित फ़ाइल सिस्टम और कस्टम संचार लाइब्रेरी सहित एक सह-डिज़ाइन किया गया सॉफ्टवेयर स्टैक है। यह बुनियादी ढांचा उपलब्ध हार्डवेयर पर दक्षता को अधिकतम करने के लिए विकसित किया गया था, विशेष रूप से चीन को उन्नत चिप्स पर संयुक्त राज्य अमेरिका के निर्यात प्रतिबंधों के मद्देनजर।

DeepSeek-V2 के लिए प्रशिक्षण रन में सार्वजनिक वेब स्रोतों, पुस्तकों और अन्य पाठ कोर्पोरा से लिए गए ट्रिलियन टोकन के डेटासेट का उपयोग किया गया। कंपनी ने सटीक डेटासेट संरचना का खुलासा नहीं किया, जो मॉडल वजन जारी करते समय भी प्रशिक्षण डेटा को मालिकाना रखने की अपनी प्रथा के अनुरूप है। रिपोर्ट की गई प्रशिक्षण लागत लगभग $5.6 मिलियन थी, एक आंकड़ा जिसने ध्यान आकर्षित किया क्योंकि यह पश्चिमी प्रयोगशालाओं के तुलनीय मॉडलों के अनुमानों से परिमाण के क्रम में कम था।

यह लागत दक्षता एल्गोरिदमिक सुधारों, हार्डवेयर अनुकूलन और MoE वास्तुकला की कम कम्प्यूटेशनल आवश्यकताओं के संयोजन के माध्यम से हासिल की गई थी। DeepSeek के इंजीनियरों ने प्रशिक्षण को स्थिर करने और अभिसरण में सुधार करने के लिए ग्रेडिएंट क्लिपिंग और लर्निंग रेट शेड्यूलिंग जैसी तकनीकों का भी उपयोग किया।

प्रदर्शन और बेंचमार्क

DeepSeek-V2 का मूल्यांकन प्राकृतिक भाषा प्रसंस्करण कार्यों के लिए मानक बेंचमार्क की एक श्रृंखला पर किया गया था, जिसमें भाषा समझ, तर्क और कोड निर्माण शामिल हैं। कई व्यापक रूप से उपयोग किए जाने वाले परीक्षणों पर, जैसे MMLU (मैसिव मल्टीटास्क लैंग्वेज अंडरस्टैंडिंग) और HumanEval, मॉडल ने अन्य डेवलपर्स के समकालीन खुले-वजन मॉडलों के बराबर या उससे अधिक स्कोर हासिल किए।

मॉडल का प्रदर्शन विशेष रूप से गणितीय तर्क और चीनी-भाषा कार्यों में उल्लेखनीय था, जो इसके प्रशिक्षण डेटा की संरचना और घरेलू और अंतर्राष्ट्रीय दोनों उपयोगकर्ताओं की सेवा पर कंपनी के ध्यान को दर्शाता है। साथ-साथ तुलनाओं में, DeepSeek-V2 ने कई बड़े घने मॉडलों को पीछे छोड़ दिया, यह प्रदर्शित करते हुए कि MoE दृष्टिकोण कम सक्रिय मापदंडों के साथ मजबूत परिणाम दे सकता है।

तीसरे पक्ष के शोधकर्ताओं द्वारा स्वतंत्र मूल्यांकनों ने आम तौर पर कंपनी के दावों की पुष्टि की, हालांकि कुछ ने नोट किया कि कुछ बेंचमार्क पर मॉडल का प्रदर्शन सटीक मूल्यांकन सेटअप के आधार पर भिन्न होता है। रिलीज़ में मॉडल के छोटे वेरिएंट भी शामिल थे, जो कम शक्तिशाली हार्डवेयर पर तैनाती की अनुमति देते हुए पूर्ण मॉडल की अधिकांश क्षमता को बनाए रखते थे।

रिलीज़ और स्वागत

मई 2024 में DeepSeek-V2 की सार्वजनिक रिलीज़ में मॉडल वजन और इसकी वास्तुकला और प्रशिक्षण पद्धति का वर्णन करने वाले तकनीकी दस्तावेज़ दोनों शामिल थे। इस खुले-वजन दृष्टिकोण ने इसे केवल API-एक्सेस के माध्यम से पेश किए जाने वाले मालिकाना मॉडलों से अलग किया, जिससे शोधकर्ताओं और डेवलपर्स को मॉडल को अपने स्वयं के बुनियादी ढांचे पर डाउनलोड करने, फाइन-ट्यून करने और तैनात करने में सक्षम बनाया गया।

मशीन लर्निंग समुदाय में स्वागत व्यापक रूप से सकारात्मक था, कई लोगों ने तकनीकी नवाचारों और रिलीज़ की पारदर्शिता की प्रशंसा की। कम प्रशिक्षण लागत चर्चा का केंद्र बिंदु बन गई, जिससे सवाल उठे कि क्या अन्य डेवलपर्स द्वारा समान दक्षता लाभ प्राप्त किए जा सकते हैं। कुछ टिप्पणीकारों ने रिलीज़ को इस बात के प्रमाण के रूप में व्याख्या किया कि उन्नत AI विकास अब केवल अच्छी तरह से वित्त पोषित पश्चिमी कंपनियों का विशेष क्षेत्र नहीं था।

हालांकि, रिलीज़ ने दुरुपयोग की संभावना के बारे में भी चिंताएं उठाईं, खुले वजन और कुछ वाणिज्यिक पेशकशों की तुलना में अंतर्निहित सुरक्षा फिल्टर की अनुपस्थिति को देखते हुए। चीन के साथ DeepSeek के संबंध और कुछ शोधकर्ताओं के पिछले सैन्य संबद्धताओं को कवरेज में नोट किया गया था, हालांकि कंपनी ने स्वयं सैन्य अनुप्रयोगों के बजाय अनुसंधान पर अपना ध्यान केंद्रित किया।

समकालीन मॉडलों के साथ तुलना

अपनी रिलीज़ के समय, DeepSeek-V2 की तुलना अक्सर Meta के Llama 3 और Mistral के Mixtral जैसे मॉडलों से की जाती थी, जो खुले-वजन या ओपन-सोर्स दृष्टिकोण भी उपयोग करते थे। कच्चे बेंचमार्क स्कोर के संदर्भ में, DeepSeek-V2 इन प्रणालियों के साथ प्रतिस्पर्धी था, जबकि इसकी प्रशिक्षण लागत तुलनीय मॉडलों के लिए सार्वजनिक रूप से रिपोर्ट किए गए आंकड़ों से काफी कम थी।

मॉडल ने OpenAI और Anthropic से मालिकाना प्रणालियों के साथ भी तुलना आकर्षित की, हालांकि मूल्यांकन पद्धति में अंतर और उन प्रणालियों की बंद प्रकृति के कारण प्रत्यक्ष तुलना जटिल थी। DeepSeek का विस्तृत तकनीकी रिपोर्ट प्रकाशित करने का निर्णय केवल API मॉडलों की तुलना में अधिक गहन विश्लेषण की अनुमति देता था।

एक उल्लेखनीय अंतर चीनी-भाषा कार्यों पर DeepSeek-V2 का प्रदर्शन था, जहां यह अक्सर मुख्य रूप से अंग्रेजी डेटा पर प्रशिक्षित मॉडलों से बेहतर प्रदर्शन करता था। इसने इसे चीनी-भाषी बाजारों में अनुप्रयोगों के लिए विशेष रूप से आकर्षक बना दिया, जिसमें वित्त, शिक्षा और सरकार में उद्यम उपयोग के मामले शामिल हैं।

प्रभाव और विरासत

DeepSeek-V2 ने कंपनी को वैश्विक AI परिदृश्य में एक महत्वपूर्ण खिलाड़ी के रूप में स्थापित किया, यह प्रदर्शित करते हुए कि कुशल प्रशिक्षण तकनीकें अत्याधुनिक परिणाम दे सकती हैं। मॉडल की सफलता ने क्षेत्र में बाद के विकास को प्रभावित किया, जिसमें मिश्रित-विशेषज्ञ वास्तुकला और लागत-जागरूक प्रशिक्षण विधियों में बढ़ती रुचि शामिल है।

रिलीज़ के भू-राजनीतिक निहितार्थ भी थे, जो उच्च-अंत हार्डवेयर पर निर्यात नियंत्रण के बावजूद चीनी कंपनियों की उन्नत AI प्रणाली विकसित करने की क्षमता को उजागर करते थे। एल्गोरिदमिक दक्षता पर DeepSeek का ध्यान, आंशिक रूप से आवश्यकता से पैदा हुआ, समान बाधाओं का सामना करने वाले अन्य डेवलपर्स के लिए एक मॉडल बन गया।

रिलीज़ के बाद के महीनों में, DeepSeek ने अपनी तकनीक पर पुनरावृत्ति जारी रखी, अंततः आगे सुधारों के साथ उत्तराधिकारी मॉडल जारी किए। DeepSeek-V2 के साथ स्थापित सिद्धांत - खुले वजन, लागत दक्षता और वास्तुकला नवाचार - बाद की रिलीज़ में कंपनी के दृष्टिकोण के केंद्र में बने रहे।

तकनीकी विशिष्टताएँ

DeepSeek-V2 की कुल पैरामीटर संख्या 236 बिलियन बताई गई थी, जिसमें MoE वास्तुकला के कारण प्रति टोकन केवल 21 बिलियन सक्रिय पैरामीटर थे। मॉडल ने 128,000 टोकन की संदर्भ विंडो का उपयोग किया, जो मेमोरी उपयोग को कम करने वाले कुशल अटेंशन तंत्र द्वारा सक्षम था। प्रशिक्षण मिश्रित परिशुद्धता का उपयोग करके आयोजित किया गया था, जिसमें सटीकता और गति को संतुलित करने के लिए BF16 और FP32 प्रारूपों को जोड़ा गया था।

मॉडल का टोकनाइज़र एक बहुभाषी कोर्पस पर प्रशिक्षित किया गया था, जिसमें चीनी और अंग्रेजी पाठ पर विशेष ध्यान दिया गया था। रिलीज़ में कई प्रारूपों में वजन शामिल थे, जो vLLM और TensorRT जैसे लोकप्रिय अनुमान ढांचे के साथ संगत थे। कम कुल मापदंडों वाले मॉडल के छोटे संस्करण भी कम शक्तिशाली हार्डवेयर पर तैनाती के लिए उपलब्ध कराए गए थे।

DeepSeek-V2 की वास्तुकला कंपनी की लाइनअप में बाद के मॉडलों के लिए आधार के रूप में कार्य करती थी, बाद की रिलीज़ इसके नवाचारों पर निर्माण करते हुए मानव प्रतिक्रिया से सुदृढीकरण सीखने जैसी अतिरिक्त तकनीकों को शामिल करती थी। मॉडल डाउनलोड के लिए उपलब्ध है, और इसके तकनीकी दस्तावेज़ कुशल भाषा मॉडल प्रशिक्षण पर अकादमिक अनुसंधान में उद्धृत किए जाते रहते हैं।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:artificial-intelligence·large-language-models·deepseek·machine-learning
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास