Cerebras वेफर स्केल इंजन (WSE) एक विशाल कृत्रिम बुद्धिमत्ता प्रोसेसर है, जिसे Cerebras Systems द्वारा विकसित किया गया है, यह कंपनी 2015 में एंड्रयू फेल्डमैन और अन्य लोगों द्वारा स्थापित की गई थी। पारंपरिक चिप्स के विपरीत जो सिलिकॉन वेफर से काटे जाते हैं, WSE पूरे वेफर को एक ही चिप के रूप में उपयोग करता है, जिसमें सैकड़ों हजारों कोर और विशाल ऑन-चिप मेमोरी एकीकृत होती है। यह डिज़ाइन Machine learning और Deep learning कार्यभार के लिए पारंपरिक GPU-आधारित प्रणालियों को प्रभावित करने वाली संचार बाधाओं और मेमोरी सीमाओं को कम करने का लक्ष्य रखता है।
पहली पीढ़ी का WSE-1, 2019 में घोषित, में 1.2 ट्रिलियन ट्रांजिस्टर और 400,000 AI-अनुकूलित कोर शामिल थे, जो उस समय निर्मित अब तक की सबसे बड़ी चिप थी। दूसरी पीढ़ी का WSE-2, 2021 में जारी, ने ट्रांजिस्टर संख्या को दोगुना कर 2.6 ट्रिलियन और कोर संख्या को 850,000 तक बढ़ा दिया, साथ ही ऑन-चिप मेमोरी को 40 गीगाबाइट तक बढ़ाया। 2024 में, Cerebras ने WSE-3 पेश किया, जिसने प्रदर्शन और दक्षता में और उन्नति की, जिसका लक्ष्य Large language model और अन्य Generative AI अनुप्रयोगों का प्रशिक्षण था।
आर्किटेक्चर और डिज़ाइन
WSE की आर्किटेक्चर पारंपरिक प्रोसेसर से मौलिक रूप से भिन्न है। कम संख्या में शक्तिशाली कोर पर निर्भर रहने के बजाय, WSE एक ही वेफर पर सैकड़ों हजारों सरल, ऊर्जा-कुशल कोर पैक करता है। ये कोर एक मेश नेटवर्क द्वारा आपस में जुड़े होते हैं जो विशाल बैंडविड्थ प्रदान करता है, जिससे डेटा कोर के बीच तेजी से आगे बढ़ सकता है। WSE चिप पर सीधे बड़ी मात्रा में स्टैटिक रैंडम-एक्सेस मेमोरी (SRAM) भी एकीकृत करता है, जिससे बाहरी मेमोरी तक पहुंच की आवश्यकता कम हो जाती है, जो अक्सर AI कार्यभार में एक प्रदर्शन बाधा होती है।
वेफर-स्केल डिज़ाइन चिप पैकेजिंग और अंतर-चिप संचार की आवश्यकता को समाप्त करता है, जो मल्टी-चिप प्रणालियों में सामान्य हैं। इसके परिणामस्वरूप डेटा-गहन कार्यों के लिए कम विलंबता और उच्च थ्रूपुट होता है। WSE उन्नत अर्धचालक प्रक्रियाओं का उपयोग करके निर्मित किया जाता है, जिसमें WSE-2 और WSE-3 TSMC द्वारा 7-नैनोमीटर प्रक्रिया पर निर्मित हैं।
सॉफ्टवेयर और पारिस्थितिकी तंत्र
Cerebras ने WSE को प्रोग्राम करने के लिए एक सॉफ्टवेयर स्टैक विकसित किया, जिसमें Cerebras सॉफ्टवेयर प्लेटफॉर्म (CSoft) शामिल है। CSoft TensorFlow और PyTorch जैसे लोकप्रिय डीप लर्निंग फ्रेमवर्क का समर्थन करता है, जिससे डेवलपर्स न्यूनतम कोड परिवर्तनों के साथ मौजूदा मॉडल चला सकते हैं। प्लेटफॉर्म में एक कंपाइलर शामिल है जो तंत्रिका नेटवर्क ग्राफ को वेफर के कोर पर मैप करता है, प्रदर्शन और मेमोरी उपयोग के लिए अनुकूलन करता है।
कंपनी Cerebras वेफर-स्केल क्लस्टर भी प्रदान करती है, जो बहुत बड़े मॉडलों के प्रशिक्षण को स्केल करने के लिए कई WSE को जोड़ती है। यह क्लस्टर ट्रिलियन पैरामीटर वाले मॉडलों को संभालने के लिए डिज़ाइन किया गया है, जो आधुनिक Transformer (architecture)-आधारित आर्किटेक्चर में सामान्य हैं।
प्रदर्शन और अनुप्रयोग
WSE ने प्रशिक्षण और अनुमान दोनों में महत्वपूर्ण प्रदर्शन लाभ प्रदर्शित किया है। उदाहरण के लिए, 2023 में, Cerebras ने घोषणा की कि उसका CS-2 सिस्टम, जो WSE-2 द्वारा संचालित है, 175-अरब-पैरामीटर मॉडल (GPT-3 के समान पैमाने पर) को जटिल मॉडल समानांतरता की आवश्यकता के बिना, एक सरल डेटा-समानांतर दृष्टिकोण का उपयोग करके प्रशिक्षित कर सकता है। यह WSE की बड़ी ऑन-चिप मेमोरी और उच्च बैंडविड्थ का लाभ उठाकर हासिल किया गया था।
अनुमान प्रदर्शन भी मजबूत है, कंपनी के अनुसार WSE-3 बड़े भाषा मॉडलों के लिए प्रति सेकंड 1,000 से अधिक टोकन उत्पन्न करने में सक्षम है। यह इसे संवादात्मक AI और कोड जनरेशन जैसे वास्तविक समय के अनुप्रयोगों के लिए उपयुक्त बनाता है।
WSE को विभिन्न संगठनों द्वारा अपनाया गया है, जिनमें सरकारी एजेंसियां और अनुसंधान संस्थान शामिल हैं। उदाहरण के लिए, भारत में Bhabha Atomic Research Centre केंद्र ने वैज्ञानिक कंप्यूटिंग के लिए Cerebras सिस्टम का उपयोग किया है। इसके अतिरिक्त, Cerebras ने मध्य पूर्व में AI सुपरकंप्यूटर बनाने के लिए g42 (एक प्रौद्योगिकी होल्डिंग कंपनी) के साथ साझेदारी की है।
अन्य AI चिप्स के साथ तुलना
WSE अन्य विशेष AI प्रोसेसरों के साथ प्रतिस्पर्धा करता है, जैसे AWS Trainium Amazon Web Services से, Groq के टेन्सर स्ट्रीमिंग प्रोसेसर, और SambaNova के पुनर्विन्यास योग्य डेटाफ्लो इकाइयां। NVIDIA के GPU के विपरीत (जो प्रदान की गई सूची में नहीं हैं लेकिन एक प्रमुख प्रतियोगी हैं), WSE ऑन-चिप मेमोरी को अधिकतम करने और डेटा आवागमन को कम करने पर केंद्रित है। यह दृष्टिकोण कुछ कार्यभारों के लिए अधिक कुशल हो सकता है, लेकिन यह निर्माण उपज और सिस्टम एकीकरण में चुनौतियां भी प्रस्तुत करता है।
Graphcore के IPU (इंटेलिजेंस प्रोसेसिंग यूनिट) की तुलना में, WSE एक अलग व्यापार-बंद प्रदान करता है: अधिक कोर लेकिन प्रोग्रामिंग में कम लचीलापन। WSE का वेफर-स्केल डिज़ाइन इसे Intel और AMD की पेशकशों से भी अलग करता है, जो कई डाइज़ के साथ पारंपरिक चिप पैकेजिंग का उपयोग करते हैं।
चुनौतियां और सीमाएं
WSE की मुख्य चुनौतियों में से एक निर्माण उपज है। चूंकि पूरे वेफर को एक ही चिप के रूप में उपयोग किया जाता है, वेफर में कोई भी दोष पूरी चिप को अनुपयोगी बना सकता है। Cerebras ने अतिरेक और दोष-परिहार तकनीकों को लागू करके इसे संबोधित किया है, जैसे दोषपूर्ण कोर के आसपास मैपिंग। हालांकि, यह अभी भी अधिकतम आकार को सीमित करता है और लागत बढ़ाता है।
एक और सीमा बिजली की खपत और शीतलन है। WSE-2 15 किलोवाट तक बिजली की खपत करता है, जिसके लिए विशेष शीतलन समाधान की आवश्यकता होती है। Cerebras गर्मी को प्रभावी ढंग से नष्ट करने के लिए एक कस्टम तरल-शीतलित प्रणाली का उपयोग करता है।
सॉफ्टवेयर संगतता भी एक चिंता का विषय है। जबकि CSoft लोकप्रिय फ्रेमवर्क का समर्थन करता है, कुछ उन्नत सुविधाएं या कस्टम संचालन पूरी तरह से अनुकूलित नहीं हो सकते हैं। कंपनी उपयोगिता में सुधार के लिए अपने सॉफ्टवेयर पारिस्थितिकी तंत्र का विस्तार करना जारी रखती है।
भविष्य की दिशाएं
Cerebras WSE आर्किटेक्चर को विकसित करना जारी रखता है। WSE-3, 2024 में घोषित, और भी बड़े मॉडलों और तेज़ प्रशिक्षण समय का समर्थन करने के लिए डिज़ाइन किया गया है। कंपनी AI से परे अनुप्रयोगों, जैसे वैज्ञानिक सिमुलेशन और उच्च-प्रदर्शन कंप्यूटिंग की भी खोज कर रही है।
2024 में, Cerebras ने एक प्रारंभिक सार्वजनिक पेशकश (IPO) के लिए आवेदन किया, जो विस्तार की योजनाओं का संकेत देता है। कंपनी AI हार्डवेयर बाजार में स्थापित खिलाड़ियों के साथ अधिक सीधे प्रतिस्पर्धा करने का लक्ष्य रखती है।
निष्कर्ष
Cerebras वेफर स्केल इंजन पारंपरिक चिप डिज़ाइन से एक साहसिक प्रस्थान का प्रतिनिधित्व करता है, जो AI कार्यभार के लिए अभूतपूर्व पैमाने और प्रदर्शन प्रदान करता है। जबकि इसे निर्माण और अपनाने में चुनौतियों का सामना करना पड़ता है, इसने उच्च-स्तरीय AI कंप्यूटिंग बाजार में एक विशिष्ट स्थान बनाया है। जैसे-जैसे AI मॉडल बढ़ते रहते हैं, WSE का ऑन-चिप संसाधनों को अधिकतम करने का दृष्टिकोण तेजी से प्रासंगिक हो सकता है।