DeepSeek-R1 एक तर्क मॉडल है जिसे चीनी AI कंपनी डीपसीक ने 20 जनवरी 2025 को जारी किया था। इसे उत्तर देने से पहले विस्तृत विचार-श्रृंखला तर्क उत्पन्न करने के लिए प्रशिक्षित किया गया था, जिसमें बड़े पैमाने पर सुदृढीकरण अधिगम को सीधे एक आधार भाषा मॉडल पर लागू किया गया था, और इसने गणित, कोडिंग और तर्क बेंचमार्क में ओपनएआई के o1 के बराबर प्रदर्शन की सूचना दी। डीपसीक ने R1 के मॉडल वेट्स को MIT लाइसेंस के तहत खुले तौर पर जारी किया, साथ ही एक विस्तृत तकनीकी पेपर भी प्रकाशित किया, ऐसे समय में जब पश्चिमी प्रयोगशालाओं के अधिकांश तुलनीय तर्क मॉडल बंद और केवल API-आधारित थे।
प्रशिक्षण दृष्टिकोण
डीपसीक ने एक प्रारंभिक संस्करण, DeepSeek-R1-Zero, का वर्णन किया, जिसमें बिना किसी पर्यवेक्षित फाइन-ट्यूनिंग चरण के सीधे आधार मॉडल पर बड़े पैमाने पर सुदृढीकरण अधिगम लागू किया गया था। इस दृष्टिकोण ने मजबूत तर्क क्षमता उत्पन्न की, लेकिन आउटपुट कभी-कभी पढ़ने में कठिन होता था, जिसमें भाषाओं का मिश्रण या स्पष्ट संरचना का अभाव होता था। जारी किया गया DeepSeek-R1 मॉडल इस समस्या का समाधान सुदृढीकरण अधिगम से पहले थोड़ी मात्रा में "कोल्ड-स्टार्ट" पर्यवेक्षित डेटा जोड़कर करता है, उसके बाद आगे के RL चरणों के साथ, जिससे अधिक सुसंगत तर्क ट्रेस उत्पन्न होते हैं जबकि अधिकांश क्षमता लाभ बरकरार रहते हैं। डीपसीक ने 1.5 बिलियन से 70 बिलियन पैरामीटर तक के छोटे "डिस्टिल्ड" मॉडलों का एक सेट भी जारी किया, जो फाइन-ट्यूनिंग के माध्यम से क्वेन और Llama जैसे मौजूदा खुले मॉडलों को R1 द्वारा उत्पन्न तर्क ट्रेस पर प्रशिक्षित करके बनाए गए थे, जिससे मजबूत तर्क-शैली व्यवहार कहीं छोटे और अधिक तैनाती-योग्य पैमाने पर उपलब्ध हुआ।
लागत दावे और बाजार प्रतिक्रिया
डीपसीक ने कहा कि इसके अंतर्निहित V3 आधार मॉडल के लिए अंतिम प्रशिक्षण रन में GPU कंप्यूट पर लगभग $5.6 मिलियन की लागत आई, जो OpenAI, एंथ्रोपिक और गूगल डीपमाइंड द्वारा तुलनीय फ्रंटियर मॉडलों को प्रशिक्षित करने पर खर्च की गई सैकड़ों मिलियन से लेकर अरबों की राशि से नाटकीय रूप से कम है। यह दावा, R1 के बेंचमार्क प्रदर्शन और डीपसीक के ऐप और API के माध्यम से मुफ्त सार्वजनिक उपलब्धता के साथ मिलकर, उस घटना को ट्रिगर किया जिसे डीपसीक झटका के रूप में जाना गया: 27 जनवरी 2025 को, एनवीडिया का शेयर एक ही कारोबारी दिन में लगभग 17 प्रतिशत गिर गया, जिससे लगभग $600 बिलियन का बाजार मूल्य समाप्त हो गया, जो उस समय तक एक अमेरिकी कंपनी के लिए सबसे बड़ा एक दिवसीय नुकसान था, क्योंकि निवेशकों ने इस बारे में अपनी धारणाओं का पुनर्मूल्यांकन किया कि फ्रंटियर AI को कितनी कंप्यूट शक्ति की आवश्यकता है। अन्य AI-संबंधित शेयर भी इसके साथ गिरे। विश्लेषकों ने बाद में बहस की कि क्या डीपसीक की रिपोर्ट की गई लागत का आंकड़ा पूर्व शोध लागतों और हार्डवेयर मूल्यह्रास को पूरी तरह से शामिल करता है, और क्या कंपनी के पास अमेरिकी निर्यात नियंत्रणों के बावजूद प्रतिबंधित Nvidia चिप्स तक पहुंच थी, बिना इस प्रश्न को पूरी तरह से हल किए।
स्वागत और प्रभाव
DeepSeek-R1 का व्यापक रूप से स्वतंत्र शोधकर्ताओं द्वारा परीक्षण किया गया और कई कार्यों पर इसके दावे किए गए बेंचमार्क के करीब प्रदर्शन पाया गया, हालांकि यह भी पाया गया कि डीपसीक के अपने होस्ट किए गए ऐप के माध्यम से एक्सेस करने पर यह तियानमेन स्क्वायर और ताइवान जैसे राजनीतिक रूप से संवेदनशील विषयों पर चीनी सरकार-संरेखित सेंसरशिप लागू करता था, एक सीमा जो स्वतंत्र रूप से चलाए जाने पर खुले तौर पर जारी वेट्स पर लागू नहीं होती थी। मॉडल की रिलीज़ ने कंप्यूट-संचालित स्केलिंग प्रतिमान की स्थायित्व और कृत्रिम बुद्धिमत्ता में अमेरिका-चीन प्रतिस्पर्धा के बारे में बहस को तेज कर दिया, जिसमें अमेरिकी अधिकारियों ने इसे AI चिप्स पर निर्यात नियंत्रण कड़ा करने के प्रमाण के रूप में उद्धृत किया, जबकि अन्य ने इसे इस बात के प्रमाण के रूप में उद्धृत किया कि ये नियंत्रण क्षमता को रोकने के बजाय दक्षता नवाचार को बढ़ावा दे रहे थे। R1 को अक्सर 2025 के सबसे महत्वपूर्ण ओपन-वेट्स मॉडल रिलीज़ में से एक के रूप में उद्धृत किया जाता है।