DeepSeek एक कृत्रिम बुद्धिमत्ता अनुसंधान कंपनी है जो हांग्जो, चीन में स्थित है, जिसकी स्थापना 2023 में लियांग वेन्फेंग द्वारा की गई थी, जिन्होंने हाई-फ्लायर नामक एक मात्रात्मक हेज फंड की भी स्थापना की थी, जिसे उन्होंने 2015 में सह-स्थापित किया था, और उसी के माध्यम से कंपनी को वित्तपोषित करना जारी रखा। हाई-फ्लायर के ट्रेडिंग व्यवसाय ने एल्गोरिदमिक ट्रेडिंग के लिए पहले से ही जीपीयू हार्डवेयर का बड़ा भंडार जमा कर लिया था, जिससे DeepSeek को विशिष्ट AI स्टार्टअप्स की तुलना में उपयोग करने के लिए एक असामान्य कंप्यूट बेस मिल गया, भले ही अमेरिकी निर्यात नियंत्रणों ने चीनी फर्मों की सबसे उन्नत एनवीडिया चिप्स तक पहुंच को प्रतिबंधित कर दिया था।
मॉडल और जनवरी 2025 का झटका
DeepSeek ने तेजी से सक्षम ओपन-वेट मॉडलों की एक श्रृंखला जारी की, जिसमें DeepSeek-V2 और V3 शामिल हैं, इससे पहले जनवरी 2025 में DeepSeek-R1 प्रकाशित किया, जो एक तर्क-मॉडल है जिसे काफी हद तक सुदृढीकरण-सीखने तकनीकों के साथ प्रशिक्षित किया गया था, और जिसने कई गणित और कोडिंग बेंचमार्क सुइट्स पर OpenAI के OpenAI o1 के प्रदर्शन से मेल खाया या उसके करीब पहुंच गया, जबकि इसे ओपन वेट और इसके प्रशिक्षण का वर्णन करने वाले एक तकनीकी पेपर के साथ जारी किया गया था। DeepSeek ने प्रशिक्षण लागत की सूचना दी जो तुलनीय पश्चिमी प्रयोगशालाओं के खर्च से कहीं कम थी, हालांकि सटीक आंकड़े और उनकी तुलना विवादित थी। इस रिलीज़ ने डीपसीक-शॉक को ट्रिगर किया, जो AI-संबंधित शेयरों में एक तेज बिकवाली थी, विशेष रूप से Nvidia के लिए एक रिकॉर्ड एकल-दिवसीय बाजार पूंजीकरण हानि, क्योंकि निवेशकों ने इस धारणा का पुनर्मूल्यांकन किया कि फ्रंटियर-मॉडल स्तर तक पहुंचने के लिए कितने कंप्यूट की आवश्यकता थी।
तकनीकी दृष्टिकोण
DeepSeek के मॉडलों ने प्रशिक्षण और अनुमान दक्षता में सुधार के लिए मिश्रण-विशेषज्ञ वास्तुकला का प्रमुख उपयोग किया, और कंपनी ने प्रशिक्षण अनुकूलन के विवरण प्रकाशित किए, जिसमें मेमोरी और संचार ओवरहेड को कम करने के दृष्टिकोण शामिल हैं, जिनका अन्य प्रयोगशालाओं द्वारा व्यापक रूप से अध्ययन किया गया। DeepSeek-R1 की प्रशिक्षण पाइपलाइन उल्लेखनीय थी क्योंकि इसने दिखाया कि विचार-श्रृंखला शैली के तर्क में बड़े लाभ व्यापक मानव-लेबल वाले आरएलएचएफ डेटा के बिना सत्यापन योग्य कार्यों पर सुदृढीकरण सीखने से उभर सकते हैं, और कंपनी ने मॉडल के छोटे आसुत संस्करण जारी किए जो कहीं अधिक मामूली हार्डवेयर पर चल सकते हैं, जिससे हगिंग-फेस जैसे होस्ट के माध्यम से बाहरी डेवलपर्स द्वारा अपनाने में तेजी आई।
स्वागत और भू-राजनीतिक संदर्भ
DeepSeek के उदय को व्यापक रूप से इस बात के प्रमाण के रूप में व्याख्यायित किया गया कि उन्नत चिप्स पर अमेरिकी निर्यात नियंत्रण चीनी प्रयोगशालाओं को AI फ्रंटियर तक पहुंचने से नहीं रोक पाए हैं, जिससे वाशिंगटन में हार्डवेयर प्रतिबंधों की प्रभावशीलता पर बहस तेज हो गई और क्वेन के डेवलपर अलीबाबा जैसी प्रयोगशालाओं के साथ एआई-शासन और राष्ट्रीय प्रतिस्पर्धा पर चर्चा में तात्कालिकता जुड़ गई। कुछ विश्लेषकों और प्रतिद्वंद्वी प्रयोगशालाओं ने DeepSeek की रिपोर्ट की गई प्रशिक्षण लागतों के पहलुओं पर सवाल उठाए और डेटा की उत्पत्ति और बंद पश्चिमी मॉडलों के आउटपुट से संभावित आसवन के बारे में चिंताएं उठाईं, जिन्हें DeepSeek ने सार्वजनिक रूप से पूरी तरह से संबोधित नहीं किया। फिर भी इस घटना ने मिस्ट्रल-एआई जैसी प्रयोगशालाओं के साथ DeepSeek को सबसे बड़े बंद अमेरिकी डेवलपर्स के लिए एक विश्वसनीय ओपन-वेट विकल्प के रूप में स्थापित किया।