अंग्रेज़ी से अनुवादित

जनवरी 2025 में चीनी AI प्रयोगशाला DeepSeek द्वारा जारी एक ओपन-वेट्स तर्क मॉडल, जो अपनी रिपोर्ट की गई प्रशिक्षण लागत के एक अंश पर अग्रणी बंद तर्क मॉडल से मेल खाने और अमेरिकी शेयर बाजार में तीव्र प्रतिक्रिया उत्पन्न करने के लिए उल्लेखनीय है।

DeepSeek-R1 एक तर्क मॉडल है जिसे चीनी AI कंपनी डीपसीक ने 20 जनवरी 2025 को जारी किया था। इसे उत्तर देने से पहले विस्तृत विचार-श्रृंखला तर्क उत्पन्न करने के लिए प्रशिक्षित किया गया था, जिसमें बड़े पैमाने पर सुदृढीकरण अधिगम को सीधे एक आधार भाषा मॉडल पर लागू किया गया था, और इसने गणित, कोडिंग और तर्क बेंचमार्क में ओपनएआई के o1 के बराबर प्रदर्शन की सूचना दी। डीपसीक ने R1 के मॉडल वेट्स को MIT लाइसेंस के तहत खुले तौर पर जारी किया, साथ ही एक विस्तृत तकनीकी पेपर भी प्रकाशित किया, ऐसे समय में जब पश्चिमी प्रयोगशालाओं के अधिकांश तुलनीय तर्क मॉडल बंद और केवल API-आधारित थे।

प्रशिक्षण दृष्टिकोण

डीपसीक ने एक प्रारंभिक संस्करण, DeepSeek-R1-Zero, का वर्णन किया, जिसमें बिना किसी पर्यवेक्षित फाइन-ट्यूनिंग चरण के सीधे आधार मॉडल पर बड़े पैमाने पर सुदृढीकरण अधिगम लागू किया गया था। इस दृष्टिकोण ने मजबूत तर्क क्षमता उत्पन्न की, लेकिन आउटपुट कभी-कभी पढ़ने में कठिन होता था, जिसमें भाषाओं का मिश्रण या स्पष्ट संरचना का अभाव होता था। जारी किया गया DeepSeek-R1 मॉडल इस समस्या का समाधान सुदृढीकरण अधिगम से पहले थोड़ी मात्रा में "कोल्ड-स्टार्ट" पर्यवेक्षित डेटा जोड़कर करता है, उसके बाद आगे के RL चरणों के साथ, जिससे अधिक सुसंगत तर्क ट्रेस उत्पन्न होते हैं जबकि अधिकांश क्षमता लाभ बरकरार रहते हैं। डीपसीक ने 1.5 बिलियन से 70 बिलियन पैरामीटर तक के छोटे "डिस्टिल्ड" मॉडलों का एक सेट भी जारी किया, जो फाइन-ट्यूनिंग के माध्यम से क्वेन और Llama जैसे मौजूदा खुले मॉडलों को R1 द्वारा उत्पन्न तर्क ट्रेस पर प्रशिक्षित करके बनाए गए थे, जिससे मजबूत तर्क-शैली व्यवहार कहीं छोटे और अधिक तैनाती-योग्य पैमाने पर उपलब्ध हुआ।

लागत दावे और बाजार प्रतिक्रिया

डीपसीक ने कहा कि इसके अंतर्निहित V3 आधार मॉडल के लिए अंतिम प्रशिक्षण रन में GPU कंप्यूट पर लगभग $5.6 मिलियन की लागत आई, जो OpenAI, एंथ्रोपिक और गूगल डीपमाइंड द्वारा तुलनीय फ्रंटियर मॉडलों को प्रशिक्षित करने पर खर्च की गई सैकड़ों मिलियन से लेकर अरबों की राशि से नाटकीय रूप से कम है। यह दावा, R1 के बेंचमार्क प्रदर्शन और डीपसीक के ऐप और API के माध्यम से मुफ्त सार्वजनिक उपलब्धता के साथ मिलकर, उस घटना को ट्रिगर किया जिसे डीपसीक झटका के रूप में जाना गया: 27 जनवरी 2025 को, एनवीडिया का शेयर एक ही कारोबारी दिन में लगभग 17 प्रतिशत गिर गया, जिससे लगभग $600 बिलियन का बाजार मूल्य समाप्त हो गया, जो उस समय तक एक अमेरिकी कंपनी के लिए सबसे बड़ा एक दिवसीय नुकसान था, क्योंकि निवेशकों ने इस बारे में अपनी धारणाओं का पुनर्मूल्यांकन किया कि फ्रंटियर AI को कितनी कंप्यूट शक्ति की आवश्यकता है। अन्य AI-संबंधित शेयर भी इसके साथ गिरे। विश्लेषकों ने बाद में बहस की कि क्या डीपसीक की रिपोर्ट की गई लागत का आंकड़ा पूर्व शोध लागतों और हार्डवेयर मूल्यह्रास को पूरी तरह से शामिल करता है, और क्या कंपनी के पास अमेरिकी निर्यात नियंत्रणों के बावजूद प्रतिबंधित Nvidia चिप्स तक पहुंच थी, बिना इस प्रश्न को पूरी तरह से हल किए।

स्वागत और प्रभाव

DeepSeek-R1 का व्यापक रूप से स्वतंत्र शोधकर्ताओं द्वारा परीक्षण किया गया और कई कार्यों पर इसके दावे किए गए बेंचमार्क के करीब प्रदर्शन पाया गया, हालांकि यह भी पाया गया कि डीपसीक के अपने होस्ट किए गए ऐप के माध्यम से एक्सेस करने पर यह तियानमेन स्क्वायर और ताइवान जैसे राजनीतिक रूप से संवेदनशील विषयों पर चीनी सरकार-संरेखित सेंसरशिप लागू करता था, एक सीमा जो स्वतंत्र रूप से चलाए जाने पर खुले तौर पर जारी वेट्स पर लागू नहीं होती थी। मॉडल की रिलीज़ ने कंप्यूट-संचालित स्केलिंग प्रतिमान की स्थायित्व और कृत्रिम बुद्धिमत्ता में अमेरिका-चीन प्रतिस्पर्धा के बारे में बहस को तेज कर दिया, जिसमें अमेरिकी अधिकारियों ने इसे AI चिप्स पर निर्यात नियंत्रण कड़ा करने के प्रमाण के रूप में उद्धृत किया, जबकि अन्य ने इसे इस बात के प्रमाण के रूप में उद्धृत किया कि ये नियंत्रण क्षमता को रोकने के बजाय दक्षता नवाचार को बढ़ावा दे रहे थे। R1 को अक्सर 2025 के सबसे महत्वपूर्ण ओपन-वेट्स मॉडल रिलीज़ में से एक के रूप में उद्धृत किया जाता है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:reasoning-models·open-weights·industry
इस पृष्ठ को अंतिम बार संपादित किया गया 2 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास