अंग्रेज़ी से अनुवादित

DeepSeek एक चीनी कृत्रिम बुद्धिमत्ता कंपनी है, जिसकी स्थापना जुलाई 2023 में लियांग वेनफेंग द्वारा की गई थी, और यह ओपन-वेट बड़े भाषा मॉडल विकसित करती है। इसका स्वामित्व High-Flyer के पास है, और इसने 2024 में DeepSeek-V2 और R1 जैसे उल्लेखनीय मॉडल जारी किए।

DeepSeek एक चीनी कृत्रिम बुद्धिमत्ता कंपनी है जो ओपन-वेट लार्ज लैंग्वेज मॉडल (LLMs) विकसित करती है। यह झेजियांग के हांगझोउ में स्थित है, और इसका स्वामित्व और वित्तपोषण हाई-फ्लायर, एक चीनी हेज फंड, द्वारा किया जाता है। कंपनी की स्थापना जुलाई 2023 में लियांग वेनफेंग द्वारा की गई थी, और यह अनुसंधान-केंद्रित AI विकास पर ध्यान केंद्रित करती है, जिसके मॉडल ओपन-वेट लाइसेंस के तहत सार्वजनिक रूप से उपलब्ध कराए जाते हैं।

DeepSeek का दृष्टिकोण कम्प्यूटेशनल दक्षता और पारंपरिक कंप्यूटर विज्ञान क्षेत्रों से परे व्यापक भर्ती पर जोर देता है। इसके मॉडल प्रमुख क्लाउड प्रदाताओं द्वारा होस्ट किए गए हैं और उनके प्रदर्शन और पहुंच के लिए अंतरराष्ट्रीय ध्यान आकर्षित किया है, विशेष रूप से उन क्षेत्रों में जो पश्चिमी AI प्लेटफार्मों के विकल्प तलाश रहे हैं।

स्थापना और प्रारंभिक इतिहास

DeepSeek की उत्पत्ति हाई-फ्लायर से जुड़ी है, जिसे जून 2015 में लियांग वेनफेंग द्वारा सह-स्थापित किया गया था। हाई-फ्लायर ने 21 अक्टूबर 2016 को स्टॉक ट्रेडिंग के लिए GPU-निर्भर डीप लर्निंग मॉडल का उपयोग शुरू किया, जो पहले के CPU-आधारित रैखिक मॉडल से स्थानांतरित हुआ। 2017 के अंत तक, इसके अधिकांश ट्रेडिंग संचालन AI द्वारा संचालित थे।

2019 में, हाई-फ्लायर ने अपना पहला कंप्यूटिंग क्लस्टर, फायर-फ्लायर, 200 मिलियन युआन की लागत से बनाया। क्लस्टर में 1,100 GPU शामिल थे जो 200 Gbit/s पर आपस में जुड़े थे और सेवानिवृत्त होने से पहले 1.5 वर्षों तक संचालित रहे। 2021 तक, लियांग ने बड़ी मात्रा में Nvidia GPU खरीदना शुरू कर दिया था, और अमेरिकी प्रतिबंधों के चीन को चिप बिक्री पर प्रभावी होने से पहले 10,000 Nvidia A100 GPU प्राप्त करने की सूचना मिली थी।

फायर-फ्लायर 2 का निर्माण 2021 में 1 बिलियन युआन के बजट के साथ शुरू हुआ। 2022 में, क्लस्टर की क्षमता का उपयोग 96% से अधिक किया गया, जो कुल 56.74 मिलियन GPU घंटे था, जिसमें 27% क्षमता कंपनी के बाहर वैज्ञानिक कंप्यूटिंग का समर्थन करती थी। फायर-फ्लायर 2 ने शुरू में 625 नोड्स में 5,000 PCIe A100 GPU का उपयोग किया, जिनमें से प्रत्येक में 8 GPU थे, बाद में बड़े मॉडलों के लिए NVLinks और Nvidia कलेक्टिव कम्युनिकेशंस लाइब्रेरी को शामिल किया।

14 अप्रैल 2023 को, हाई-फ्लायर ने एक आर्टिफिशियल जनरल इंटेलिजेंस (AGI) अनुसंधान प्रयोगशाला के शुभारंभ की घोषणा की। दो महीने बाद, 17 जुलाई 2023 को, उस प्रयोगशाला को DeepSeek नामक एक स्वतंत्र कंपनी में विभाजित कर दिया गया, जिसमें हाई-फ्लायर प्रमुख निवेशक था। शुरुआत में, उद्यम पूंजी निवेशक त्वरित निकास की चिंताओं के कारण वित्तपोषण प्रदान करने में अनिच्छुक थे।

2024 मॉडल रिलीज़

2024 में, DeepSeek ने अपने ओपन-वेट ढांचे के तहत कई महत्वपूर्ण मॉडल जारी किए। 2024 की शुरुआत में पेश किया गया DeepSeek-V2, मॉडल वास्तुकला और प्रशिक्षण दक्षता में प्रगति प्रदर्शित करता है। कंपनी ने कम्प्यूटेशनल दक्षता को अधिकतम करने के लिए अपने एल्गोरिदम को परिष्कृत करना जारी रखा, पुराने हार्डवेयर का लाभ उठाते हुए और अमेरिकी चिप प्रतिबंधों के कारण ऊर्जा खपत को कम किया।

जनवरी 2025 में एक समान नाम वाले चैटबॉट के साथ लॉन्च किया गया DeepSeek-R1, एक प्रमुख मील का पत्थर था। मॉडल ने अपनी तर्क क्षमताओं और लागत प्रभावी प्रशिक्षण दृष्टिकोण के लिए अंतरराष्ट्रीय पहचान प्राप्त की। जनवरी 2025 से, DeepSeek ने अपने मॉडल मुफ्त और ओपन-सोर्स सॉफ्टवेयर लाइसेंस के तहत जारी किए हैं।

कंपनी संचालन

DeepSeek का मुख्यालय झेजियांग के हांगझोउ में है, जिसमें लियांग वेनफेंग CEO के रूप में कार्यरत हैं। मई 2024 तक, लियांग ने व्यक्तिगत रूप से दो शेल निगमों के माध्यम से DeepSeek में 84% हिस्सेदारी रखी थी। कंपनी अनुसंधान पर केंद्रित है और उसने कहा है कि उसके पास व्यावसायीकरण की तत्काल योजनाएं नहीं हैं, जिससे वह चीन के AI नियमों के उपभोक्ता-केंद्रित प्रौद्योगिकियों पर लक्षित कुछ प्रावधानों से बच सकती है।

अपने ओपन-वेट ढांचे के कारण, DeepSeek मॉडल Microsoft Azure और Perplexity AI सहित क्लाउड प्रदाताओं द्वारा मूल रूप से होस्ट किए गए हैं। फरवरी 2026 में, Anthropic ने DeepSeek पर अपने स्वयं के LLMs को प्रशिक्षित करने के लिए Claude के साथ लाखों वार्तालाप उत्पन्न करने के लिए हजारों धोखाधड़ी खातों का उपयोग करने का आरोप लगाया। अप्रैल 2026 में, निवेशकों ने $300 मिलियन की फंडिंग राउंड के लिए चर्चा शुरू की, जो कंपनी को $10 बिलियन के मूल्यांकन पर लाएगी। DeepSeek ने मई 2026 की सीरीज़ A राउंड पूरी की जिसमें US$7 बिलियन प्राप्त हुए, जिससे post-money मूल्यांकन US$52 बिलियन हो गया। जुलाई 2026 में, ब्लूमबर्ग और फाइनेंशियल टाइम्स ने 2027 तक एक IPO की तैयारियों की सूचना दी, जिसमें US$70 बिलियन के pre-money मूल्यांकन को लक्षित करने वाली एक और चर्चा थी।

प्रशिक्षण ढांचा

DeepSeek फायर-फ्लायर और फायर-फ्लायर 2 कंप्यूटिंग क्लस्टर संचालित करता है। फायर-फ्लायर 2, जो 2025 तक अभी भी संचालन में है, सह-डिज़ाइन किए गए सॉफ्टवेयर और हार्डवेयर वास्तुकला से बना है। हार्डवेयर 200 Gbps इंटरकनेक्ट के साथ Nvidia GPU का उपयोग करता है, जो क्रॉस-ज़ोन कार्य समर्थन के साथ दो क्षेत्रों में विभाजित है। नेटवर्क टोपोलॉजी उच्च bisection बैंडविड्थ के लिए दो फैट ट्री का उपयोग करती है।

मुख्य सॉफ्टवेयर घटकों में 3FS (फायर-फ्लायर फ़ाइल सिस्टम) शामिल है, जो Direct I/O और RDMA Read का उपयोग करके अतुल्यकालिक यादृच्छिक रीड के लिए डिज़ाइन किया गया एक वितरित समानांतर फ़ाइल सिस्टम है। चूंकि प्रत्येक डेटा रीड यादृच्छिक है और पुन: उपयोग नहीं किया जाता है, कैशिंग अनावश्यक है। एक अन्य घटक hfreduce है, जो एक अतुल्यकालिक संचार लाइब्रेरी है जिसे मूल रूप से Nvidia कलेक्टिव कम्युनिकेशंस लाइब्रेरी फ़ंक्शंस को बदलने के लिए डिज़ाइन किया गया था।

रणनीति और भर्ती

DeepSeek की भर्ती दृष्टिकोण लंबे कार्य अनुभव पर कौशल पर जोर देती है, जिसके परिणामस्वरूप कई नए विश्वविद्यालय स्नातकों की भर्ती होती है। कंपनी कविता और उन्नत गणित जैसे क्षेत्रों में विशेषज्ञता का विस्तार करने के लिए कंप्यूटर विज्ञान पृष्ठभूमि के बिना व्यक्तियों की भर्ती करती है। न्यूयॉर्क टाइम्स के अनुसार, दर्जनों DeepSeek शोधकर्ताओं के पीपुल्स लिबरेशन आर्मी प्रयोगशालाओं और नेशनल डिफेंस के सात बेटों के साथ संबद्धता है या पहले थी।

2025 से, DeepSeek का चैटबॉट पीपुल्स लिबरेशन आर्मी द्वारा गैर-लड़ाकू भूमिकाओं में अपनाया गया था, जिसमें अस्पताल, पीपुल्स आर्म्ड पुलिस अर्धसैनिक, और राष्ट्रीय लामबंदी संगठन शामिल हैं। कंपनी ने अफ्रीका में भी विस्तार किया है, जो अधिक किफायती और कम बिजली-भूखे AI समाधान पेश कर रही है, अफ्रीकी भाषा मॉडल को मजबूत कर रही है और स्टार्टअप उत्पन्न कर रही है, उदाहरण के लिए नैरोबी में। हुआवेई की स्टोरेज और क्लाउड कंप्यूटिंग सेवाओं के साथ, उप-सहारा अफ्रीका की तकनीकी दृश्य पर DeepSeek का प्रभाव काफी है, जो पश्चिमी AI प्लेटफार्मों की तुलना में स्थानीय डेटा संप्रभुता और लचीलापन प्रदान करता है।

स्वागत और प्रभाव

DeepSeek के मॉडल Large language model पारिस्थितिकी तंत्र के भीतर उनकी दक्षता और खुली पहुंच के लिए पहचाने गए हैं। व्यावसायीकरण पर अनुसंधान पर कंपनी का ध्यान इसे OpenAI और Anthropic जैसे प्रतिस्पर्धियों से अलग करता है। इसके प्रशिक्षण नवाचार, जिसमें फायर-फ्लायर क्लस्टर और कस्टम सॉफ्टवेयर शामिल हैं, मशीन लर्निंग और डीप लर्निंग में व्यापक विकास में योगदान करते हैं।

DeepSeek का अफ्रीका में विस्तार और इसके लागत प्रभावी समाधानों ने इसे वैश्विक AI अपनाने में एक महत्वपूर्ण खिलाड़ी के रूप में स्थापित किया है, विशेष रूप से सीमित बुनियादी ढांचे वाले क्षेत्रों में। कंपनी का ओपन-वेट दृष्टिकोण स्थानीय अनुकूलन और तैनाती की अनुमति देता है, जो डेवलपर्स और स्टार्टअप के बढ़ते समुदाय को बढ़ावा देता है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:artificial-intelligence·large-language-model·chinese-company·open-source-software
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास