अंग्रेज़ी से अनुवादित

DeepSeek एक चीनी AI अनुसंधान प्रयोगशाला है जो हांग्जो में स्थित है, जो मात्रात्मक हेज फंड High-Flyer से अलग होकर बनी है। जनवरी 2025 में एक कुशल ओपन-वेट्स तर्क मॉडल जारी करने के लिए इसने वैश्विक ध्यान आकर्षित किया, जिसने बाजारों को हिला दिया।

DeepSeek एक कृत्रिम बुद्धिमत्ता अनुसंधान कंपनी है जो हांग्जो, चीन में स्थित है, जिसकी स्थापना 2023 में लियांग वेन्फेंग द्वारा की गई थी, जिन्होंने हाई-फ्लायर नामक एक मात्रात्मक हेज फंड की भी स्थापना की थी, जिसे उन्होंने 2015 में सह-स्थापित किया था, और उसी के माध्यम से कंपनी को वित्तपोषित करना जारी रखा। हाई-फ्लायर के ट्रेडिंग व्यवसाय ने एल्गोरिदमिक ट्रेडिंग के लिए पहले से ही जीपीयू हार्डवेयर का बड़ा भंडार जमा कर लिया था, जिससे DeepSeek को विशिष्ट AI स्टार्टअप्स की तुलना में उपयोग करने के लिए एक असामान्य कंप्यूट बेस मिल गया, भले ही अमेरिकी निर्यात नियंत्रणों ने चीनी फर्मों की सबसे उन्नत एनवीडिया चिप्स तक पहुंच को प्रतिबंधित कर दिया था।

मॉडल और जनवरी 2025 का झटका

DeepSeek ने तेजी से सक्षम ओपन-वेट मॉडलों की एक श्रृंखला जारी की, जिसमें DeepSeek-V2 और V3 शामिल हैं, इससे पहले जनवरी 2025 में DeepSeek-R1 प्रकाशित किया, जो एक तर्क-मॉडल है जिसे काफी हद तक सुदृढीकरण-सीखने तकनीकों के साथ प्रशिक्षित किया गया था, और जिसने कई गणित और कोडिंग बेंचमार्क सुइट्स पर OpenAI के OpenAI o1 के प्रदर्शन से मेल खाया या उसके करीब पहुंच गया, जबकि इसे ओपन वेट और इसके प्रशिक्षण का वर्णन करने वाले एक तकनीकी पेपर के साथ जारी किया गया था। DeepSeek ने प्रशिक्षण लागत की सूचना दी जो तुलनीय पश्चिमी प्रयोगशालाओं के खर्च से कहीं कम थी, हालांकि सटीक आंकड़े और उनकी तुलना विवादित थी। इस रिलीज़ ने डीपसीक-शॉक को ट्रिगर किया, जो AI-संबंधित शेयरों में एक तेज बिकवाली थी, विशेष रूप से Nvidia के लिए एक रिकॉर्ड एकल-दिवसीय बाजार पूंजीकरण हानि, क्योंकि निवेशकों ने इस धारणा का पुनर्मूल्यांकन किया कि फ्रंटियर-मॉडल स्तर तक पहुंचने के लिए कितने कंप्यूट की आवश्यकता थी।

तकनीकी दृष्टिकोण

DeepSeek के मॉडलों ने प्रशिक्षण और अनुमान दक्षता में सुधार के लिए मिश्रण-विशेषज्ञ वास्तुकला का प्रमुख उपयोग किया, और कंपनी ने प्रशिक्षण अनुकूलन के विवरण प्रकाशित किए, जिसमें मेमोरी और संचार ओवरहेड को कम करने के दृष्टिकोण शामिल हैं, जिनका अन्य प्रयोगशालाओं द्वारा व्यापक रूप से अध्ययन किया गया। DeepSeek-R1 की प्रशिक्षण पाइपलाइन उल्लेखनीय थी क्योंकि इसने दिखाया कि विचार-श्रृंखला शैली के तर्क में बड़े लाभ व्यापक मानव-लेबल वाले आरएलएचएफ डेटा के बिना सत्यापन योग्य कार्यों पर सुदृढीकरण सीखने से उभर सकते हैं, और कंपनी ने मॉडल के छोटे आसुत संस्करण जारी किए जो कहीं अधिक मामूली हार्डवेयर पर चल सकते हैं, जिससे हगिंग-फेस जैसे होस्ट के माध्यम से बाहरी डेवलपर्स द्वारा अपनाने में तेजी आई।

स्वागत और भू-राजनीतिक संदर्भ

DeepSeek के उदय को व्यापक रूप से इस बात के प्रमाण के रूप में व्याख्यायित किया गया कि उन्नत चिप्स पर अमेरिकी निर्यात नियंत्रण चीनी प्रयोगशालाओं को AI फ्रंटियर तक पहुंचने से नहीं रोक पाए हैं, जिससे वाशिंगटन में हार्डवेयर प्रतिबंधों की प्रभावशीलता पर बहस तेज हो गई और क्वेन के डेवलपर अलीबाबा जैसी प्रयोगशालाओं के साथ एआई-शासन और राष्ट्रीय प्रतिस्पर्धा पर चर्चा में तात्कालिकता जुड़ गई। कुछ विश्लेषकों और प्रतिद्वंद्वी प्रयोगशालाओं ने DeepSeek की रिपोर्ट की गई प्रशिक्षण लागतों के पहलुओं पर सवाल उठाए और डेटा की उत्पत्ति और बंद पश्चिमी मॉडलों के आउटपुट से संभावित आसवन के बारे में चिंताएं उठाईं, जिन्हें DeepSeek ने सार्वजनिक रूप से पूरी तरह से संबोधित नहीं किया। फिर भी इस घटना ने मिस्ट्रल-एआई जैसी प्रयोगशालाओं के साथ DeepSeek को सबसे बड़े बंद अमेरिकी डेवलपर्स के लिए एक विश्वसनीय ओपन-वेट विकल्प के रूप में स्थापित किया।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:industry·large-language-models·china
इस पृष्ठ को अंतिम बार संपादित किया गया 2 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास