अंग्रेज़ी से अनुवादित

Cerebras-GPT बड़े भाषा मॉडलों का एक परिवार है, जिसे Cerebras Systems द्वारा विकसित किया गया है, और इसे CS-2 वेफर-स्केल प्रणाली पर चिंचिला स्केलिंग नियम का उपयोग करके प्रशिक्षित किया गया है। 2023 में जारी, इसमें 111M से 13B पैरामीटर तक के मॉडल शामिल हैं, जो कुशल प्रशिक्षण और ओपन-सोर्स उपलब्धता के लिए डिज़ाइन किए गए हैं।

Cerebras-GPT बड़े भाषा मॉडल का एक खुला-स्रोत परिवार है, जिसे Cerebras Systems द्वारा विकसित किया गया है, जो अपने वेफर-स्केल तंत्रिका नेटवर्क त्वरक के लिए जानी जाने वाली कंपनी है। मॉडलों को कंप्यूट-इष्टतम प्रदर्शन प्राप्त करने के लिए डिज़ाइन किया गया था, जिसका अर्थ है कि उन्हें चिंचिला स्केलिंग कानून के अनुसार मॉडल आकार और प्रशिक्षण डेटा की मात्रा को संतुलित करने के लिए प्रशिक्षित किया गया था, जो बताता है कि एक निश्चित कंप्यूट बजट के लिए, आनुपातिक रूप से अधिक डेटा वाले बड़े मॉडल बेहतर प्रदर्शन देते हैं। Cerebras-GPT मार्च 2023 में जारी किया गया था, जिसका लक्ष्य बड़े पैमाने पर अत्याधुनिक मॉडलों को प्रशिक्षित करने के लिए Cerebras की CS-2 प्रणाली की दक्षता प्रदर्शित करना था।

इस परिवार में 111 मिलियन से 13 बिलियन तक के पैरामीटर गणना वाले मॉडल शामिल हैं, विशेष रूप से: 111M, 256M, 590M, 1.3B, 2.7B, 6.7B, और 13B। सभी मॉडलों को एक ही सार्वजनिक डेटासेट, पाइल, पर प्रशिक्षित किया गया था, जो पुस्तकों, शैक्षणिक पत्रों और वेब सामग्री से पाठ का एक विविध संग्रह है। प्रशिक्षण में प्रति मॉडल एक निश्चित कंप्यूट बजट का उपयोग किया गया, जो चिंचिला इष्टतम अनुपात का पालन करता है, लगभग 20 टोकन प्रति पैरामीटर, यह सुनिश्चित करते हुए कि प्रत्येक मॉडल को उसके आकार के लिए प्रदर्शन को अधिकतम करने के लिए उचित मात्रा में डेटा पर प्रशिक्षित किया गया था। मॉडलों को एडम ऑप्टिमाइज़र के साथ कोसाइन लर्निंग रेट शेड्यूल और ग्रेडिएंट क्लिपिंग का उपयोग करके प्रशिक्षित किया गया था ताकि प्रशिक्षण को स्थिर किया जा सके।

आर्किटेक्चर और प्रशिक्षण

Cerebras-GPT मॉडल मानक ट्रांसफॉर्मर आर्किटेक्चर का उपयोग करते हैं, विशेष रूप से डिकोडर-केवल संस्करण, जो जनरेटिव भाषा मॉडल के लिए सामान्य है। प्रत्येक मॉडल मल्टी-हेड अटेंशन, लेयर नॉर्मलाइज़ेशन, और सीखे गए पोजीशनल एम्बेडिंग का उपयोग करता है। मॉडलों को CS-2 प्रणाली पर प्रशिक्षित किया गया था, जो 850,000 से अधिक कोर के साथ एक एकल सिलिकॉन वेफर को एकीकृत करता है, जिससे कई GPU में वितरित प्रशिक्षण की आवश्यकता के बिना उच्च-थ्रूपुट प्रशिक्षण सक्षम होता है। इस आर्किटेक्चर ने Cerebras को पारंपरिक GPU क्लस्टरों की तुलना में एक अंश समय और ऊर्जा में मॉडलों को प्रशिक्षित करने की अनुमति दी, क्योंकि वेफर-स्केल डिज़ाइन संचार ओवरहेड को कम करता है।

प्रशिक्षण bfloat16 परिशुद्धता में आयोजित किया गया था, और मॉडलों को बिना किसी पूर्व-मौजूदा चेकपॉइंट के शुरू से प्रशिक्षित किया गया था। प्रशिक्षण प्रक्रिया में 256 अनुक्रमों का बैच आकार उपयोग किया गया, प्रत्येक की लंबाई 2048 टोकन थी, और प्रत्येक मॉडल के लिए कुल प्रशिक्षण टोकन चिंचिला सूत्र द्वारा निर्धारित किए गए थे। उदाहरण के लिए, 13B मॉडल को लगभग 260 बिलियन टोकन पर प्रशिक्षित किया गया था, जबकि 111M मॉडल को लगभग 2.2 बिलियन टोकन पर प्रशिक्षित किया गया था। प्रशिक्षण डेटा को विविधता सुनिश्चित करने के लिए फेरबदल और संसाधित किया गया था, और मॉडलों का मूल्यांकन मानक बेंचमार्क जैसे भाषा मॉडलिंग पर्प्लेक्सिटी और डाउनस्ट्रीम कार्यों पर किया गया था।

प्रदर्शन और बेंचमार्क

Cerebras-GPT मॉडलों का मूल्यांकन कई बेंचमार्क पर किया गया, जिसमें LAMBADA, HellaSwag, और Winogrande शामिल हैं, जो भाषा समझ और तर्क का परीक्षण करते हैं। परिणामों ने दिखाया कि मॉडलों ने समान आकार के अन्य खुले-स्रोत मॉडलों, जैसे OpenAI और Anthropic के साथ प्रतिस्पर्धात्मक प्रदर्शन किया, भले ही उन्हें एक सरल रेसिपी के साथ प्रशिक्षित किया गया था। उदाहरण के लिए, 13B मॉडल ने LAMBADA सटीकता 72.3% हासिल की, जो उस समय उपलब्ध अन्य 13B मॉडलों के बराबर है। मॉडलों ने पाइल के होल्ड-आउट सत्यापन सेट पर भी मजबूत प्रदर्शन दिखाया, जिसमें मॉडल आकार बढ़ने के साथ पर्प्लेक्सिटी घटती गई, जैसा कि अपेक्षित था।

Cerebras-GPT का एक उल्लेखनीय पहलू कंप्यूट दक्षता पर इसका ध्यान है। कंपनी ने बताया कि CS-2 पर 13B मॉडल को प्रशिक्षित करने में लगभग 10 दिन लगे, जबकि 512 NVIDIA A100 GPU के क्लस्टर पर एक तुलनीय प्रशिक्षण रन लगभग 30 दिन लेता। यह दक्षता वेफर-स्केल डिज़ाइन के लिए जिम्मेदार है, जो मॉडल समानांतरता की आवश्यकता को समाप्त करता है और अंतर-चिप संचार को कम करता है। मॉडलों को Apache 2.0 लाइसेंस के तहत जारी किया गया था, जो प्रतिबंधों के बिना उपयोग और संशोधन की अनुमति देता है, जो खुले-स्रोत समुदाय में अनुसंधान और विकास को बढ़ावा देने के लिए एक जानबूझकर कदम था।

अन्य मॉडलों के साथ तुलना

रिलीज़ के समय, Cerebras-GPT खुले-स्रोत मॉडलों के बीच चिंचिला स्केलिंग कानून के पालन के लिए अलग खड़ा था। कई पहले के मॉडल, जैसे GPT-3, को कंप्यूट-इष्टतम से अधिक डेटा के साथ प्रशिक्षित किया गया था, जिससे अक्षमताएं हुईं। Cerebras-GPT पहले परिवारों में से एक था जिसने स्पष्ट रूप से कंप्यूट-इष्टतम दृष्टिकोण का पालन किया, जिसका अर्थ था कि प्रत्येक मॉडल को उसके पैरामीटर गणना के लिए बिल्कुल सही मात्रा में डेटा पर प्रशिक्षित किया गया था। यह दृष्टिकोण इस तथ्य से मान्य था कि मॉडलों ने उप-इष्टतम डेटा-से-पैरामीटर अनुपात के साथ प्रशिक्षित मॉडलों के बराबर या बेहतर प्रदर्शन हासिल किया।

बाद के मॉडलों जैसे LLaMA (जो 2023 में बाद में जारी किया गया था) की तुलना में, Cerebras-GPT अधिकतम आकार में छोटा था लेकिन स्केलिंग का अधिक व्यवस्थित अध्ययन प्रदान करता था। मॉडल अपनी प्रतिलिपि प्रस्तुत करने की क्षमता के लिए भी उल्लेखनीय थे, क्योंकि प्रशिक्षण कोड और कॉन्फ़िगरेशन खुले-स्रोत थे, जिससे शोधकर्ताओं को परिणामों को दोहराने की अनुमति मिली। हालांकि, मॉडलों को निर्देश-ट्यून या चैट के लिए फाइन-ट्यून नहीं किया गया था, इसलिए वे मुख्य रूप से स्केलिंग कानूनों और कुशल प्रशिक्षण पर अनुसंधान के लिए थे, न कि अनुप्रयोगों में तैनाती के लिए।

प्रभाव और विरासत

Cerebras-GPT ने मामूली हार्डवेयर पर चलाए जा सकने वाले मॉडलों का एक परिवार प्रदान करके बड़े भाषा मॉडलों के लोकतंत्रीकरण की व्यापक प्रवृत्ति में योगदान दिया। सबसे छोटा मॉडल (111M) एक एकल GPU पर फाइन-ट्यून किया जा सकता था, जबकि सबसे बड़ा (13B) एक मल्टी-GPU सेटअप की आवश्यकता थी लेकिन कई अनुसंधान प्रयोगशालाओं के लिए सुलभ था। रिलीज़ ने बड़े मॉडलों को प्रशिक्षित करने की लागत और ऊर्जा पदचिह्न को कम करने में वेफर-स्केल एकीकरण जैसे वैकल्पिक हार्डवेयर आर्किटेक्चर की क्षमता को भी उजागर किया।

मॉडलों का उपयोग बाद के अनुसंधान में पाठ्यक्रम सीखने और डेटा संवर्धन तकनीकों पर किया गया, क्योंकि उनकी खुली-स्रोत प्रकृति ने आसान प्रयोग की अनुमति दी। Cerebras Systems ने बड़े मॉडलों को विकसित करना जारी रखा, जैसे Cerebras-GPT 7B और बाद में Cerebras-GPT 13B वेरिएंट, लेकिन मूल परिवार कंप्यूट-इष्टतम प्रशिक्षण के लिए एक संदर्भ बिंदु बना हुआ है। कंपनी ने अनुभव का उपयोग अपनी अगली पीढ़ी के हार्डवेयर, CS-3, के विकास को सूचित करने के लिए भी किया, जिसकी घोषणा 2024 में की गई थी।

उपलब्धता और उपयोग

Cerebras-GPT मॉडल Hugging Face और Cerebras Model Zoo के माध्यम से उपलब्ध हैं, जो पूर्व-प्रशिक्षित चेकपॉइंट और अनुमान स्क्रिप्ट प्रदान करते हैं। मॉडलों का उपयोग PyTorch जैसे मानक मशीन लर्निंग फ्रेमवर्क के साथ किया जा सकता है, और प्रशिक्षण कोड GitHub पर उपलब्ध है। Apache 2.0 लाइसेंस व्यावसायिक उपयोग की अनुमति देता है, जिससे मॉडल स्टार्टअप और उद्यमों के लिए आकर्षक बनते हैं जो लाइसेंस शुल्क के बिना भाषा मॉडल तैनात करना चाहते हैं। हालांकि, उपयोगकर्ताओं को पता होना चाहिए कि मॉडल मानव प्राथमिकताओं के साथ संरेखित नहीं थे, इसलिए वे पक्षपाती या हानिकारक आउटपुट उत्पन्न कर सकते हैं, और तैनाती के लिए उचित सुरक्षा उपायों की सिफारिश की जाती है।

संक्षेप में, Cerebras-GPT कृत्रिम बुद्धिमत्ता के क्षेत्र में एक महत्वपूर्ण योगदान है, यह प्रदर्शित करता है कि विशेष हार्डवेयर के साथ कंप्यूट-इष्टतम प्रशिक्षण प्राप्त करने योग्य है और स्केलिंग कानूनों और मॉडल दक्षता का अध्ययन करने वाले शोधकर्ताओं के लिए एक मूल्यवान संसाधन प्रदान करता है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:large-language-models·open-source-ai·scaling-laws·wafer-scale-computing
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास