अंग्रेज़ी से अनुवादित

GPT-NeoX एक 20-अरब-पैरामीटर वाला ओपन-सोर्स ऑटोरेग्रेसिव ट्रांसफॉर्मर लार्ज लैंग्वेज मॉडल है, जिसे EleutherAI द्वारा विकसित किया गया था और फरवरी 2022 में जारी किया गया था। इसे AI में अनुसंधान और पुनरुत्पादनशीलता के लिए डिज़ाइन किया गया है।

GPT-NeoX एक 20-अरब-पैरामीटर बड़ा भाषा मॉडल है, जिसे शोध समूह EleutherAI द्वारा विकसित किया गया है। फरवरी 2022 में जारी, यह एक ओपन-सोर्स ऑटोरेग्रेसिव ट्रांसफॉर्मर मॉडल है, जिसे गहन शिक्षण और जनरेटिव एआई में अनुसंधान को आगे बढ़ाने के लिए डिज़ाइन किया गया है। यह मॉडल मालिकाना प्रणालियों के लिए सार्वजनिक रूप से सुलभ विकल्प प्रदान करने के लिए बनाया गया था, जिससे शोधकर्ता बिना वाणिज्यिक प्रतिबंधों के बड़े पैमाने के तंत्रिका नेटवर्क का अध्ययन कर सकें।

GPT-NeoX पहले के GPT मॉडलों के वास्तुशिल्प सिद्धांतों पर आधारित है, जिसमें मल्टी-हेड अटेंशन और अवशिष्ट कनेक्शन के साथ डिकोडर-केवल ट्रांसफॉर्मर का उपयोग किया गया है। इसका प्रशिक्षण वेब टेक्स्ट, पुस्तकों और अन्य स्रोतों के विविध कोरपस पर शामिल था, जिसमें सामान्यीकरण में सुधार के लिए व्यापक कवरेज पर जोर दिया गया। मॉडल के 20 अरब पैरामीटर इसे बड़े भाषा मॉडलों के बीच मध्यम आकार की श्रेणी में रखते हैं, जो कम्प्यूटेशनल लागत और प्रदर्शन के बीच संतुलन बनाते हैं।

वास्तुकला और डिज़ाइन

मॉडल स्थिरता और दक्षता के लिए कई संवर्द्धन के साथ एक मानक ट्रांसफॉर्मर वास्तुकला का उपयोग करता है। यह प्रत्येक सबलेयर से पहले लेयर नॉर्मलाइज़ेशन लागू करता है, जो प्रशिक्षण अभिसरण में सुधार करता है। स्थितीय एन्कोडिंग सीखी जाती हैं, जिससे मॉडल टोकन क्रम को पकड़ सकता है। अटेंशन तंत्र मल्टी-हेड अटेंशन के साथ लागू किया गया है, जो 20 अरब पैरामीटर को 64 परतों और प्रति परत 16 अटेंशन हेड्स में विभाजित करता है।

GPT-NeoX प्रशिक्षण के दौरान विस्फोटक ग्रेडिएंट्स को रोकने के लिए ग्रेडिएंट क्लिपिंग शामिल करता है, और अपने ऑप्टिमाइज़र के रूप में एडम का उपयोग करता है, जिसमें सीखने की दर अनुसूची शामिल है जिसमें वार्मअप और कोसाइन क्षय शामिल है। मॉडल का छिपा हुआ आकार 6144 है, और इसकी फीड-फॉरवर्ड परतें 24,576 आयामों तक विस्तारित होती हैं। ये विकल्प मॉडल क्षमता और मेमोरी फुटप्रिंट के बीच संतुलन को दर्शाते हैं, जिससे अमेज़न वेब सर्विसेज क्लस्टर पर प्रशिक्षण संभव होता है।

प्रशिक्षण डेटा और प्रक्रिया

EleutherAI ने GPT-NeoX को द पाइल नामक एक क्यूरेटेड डेटासेट पर प्रशिक्षित किया, जो 22 विविध स्रोतों से संकलित एक बड़े पैमाने का अंग्रेजी कोरपस है। इसमें शैक्षणिक पेपर, पुस्तकें, वेब पेज और कोड रिपॉजिटरी शामिल हैं, जो कुल लगभग 800 गीगाबाइट टेक्स्ट हैं। प्रशिक्षण प्रक्रिया में 512 अनुक्रमों का बैच आकार उपयोग किया गया, प्रत्येक में 2048 टोकन, और लगभग 400,000 चरणों तक चला। कुल कम्प्यूटेशनल व्यय लगभग 1.2 एक्साफ्लॉप्स अनुमानित था, जो 96 NVIDIA A100 GPU के क्लस्टर पर निष्पादित किया गया।

प्रशिक्षण में मजबूती में सुधार के लिए डेटा संवर्द्धन तकनीकों जैसे यादृच्छिक मास्किंग और टोकन ड्रॉपआउट का उपयोग किया गया। बड़े मॉडल आकार को संभालने के लिए, EleutherAI ने GPU के बीच मॉडल समानांतरता का उपयोग किया, परतों और अटेंशन हेड्स को मेमोरी बाधाओं के भीतर फिट करने के लिए विभाजित किया। अंतिम चेकपॉइंट एक खुले लाइसेंस के तहत जारी किया गया था, जो अनुसंधान और वाणिज्यिक अनुप्रयोगों के लिए अप्रतिबंधित उपयोग की अनुमति देता है।

प्रदर्शन और मूल्यांकन

GPT-NeoX का मूल्यांकन कई बेंचमार्क पर किया गया, जिसमें भाषा मॉडलिंग पर्प्लेक्सिटी, प्रश्न उत्तरण और सामान्य ज्ञान तर्क कार्य शामिल हैं। LAMBADA डेटासेट पर, इसने 3.99 की पर्प्लेक्सिटी हासिल की, जो मजबूत अगले-शब्द भविष्यवाणी दर्शाती है। ज़ीरो-शॉट सेटिंग्स में, यह समान आकार के मॉडलों के साथ प्रतिस्पर्धात्मक प्रदर्शन करता था, हालांकि यह OpenAI और गूगल डीपमाइंड जैसे बड़े मालिकाना मॉडलों से पीछे रहा।

मॉडल ने कोड जनरेशन कार्यों में विशेष ताकत दिखाई, जो इसके प्रशिक्षण डेटा में GitHub कोड के शामिल होने के कारण है। HumanEval बेंचमार्क पर, इसने 6.4% का pass@1 स्कोर हासिल किया, जो कार्यात्मक कोड उत्पन्न करने में मध्यम क्षमता दर्शाता है। मशीन लर्निंग बेंचमार्क में इसका प्रदर्शन ओपन-सोर्स मॉडलों के मूल्य को उजागर करता है, जिससे पुनरुत्पादक अनुसंधान संभव होता है, क्योंकि परिणाम समुदाय द्वारा स्वतंत्र रूप से सत्यापित किए जा सकते हैं।

प्रभाव और विरासत

GPT-NeoX ने बाद के ओपन-सोर्स प्रयासों के लिए एक आधारभूत मॉडल के रूप में कार्य किया, जिसने LLaMA और Falcon जैसे बाद के मॉडलों के विकास को प्रभावित किया। इसकी रिलीज़ ने प्रदर्शित किया कि उच्च-गुणवत्ता वाले बड़े भाषा मॉडल गैर-वाणिज्यिक संगठनों द्वारा प्रशिक्षित किए जा सकते हैं, जो तकनीकी दिग्गजों के प्रभुत्व को चुनौती देते हैं। मॉडल के खुले वज़न ने कृत्रिम बुद्धिमत्ता सुरक्षा, व्याख्यात्मकता और फाइन-ट्यूनिंग में अनुसंधान की सुविधा प्रदान की, कई अध्ययनों ने इसे आधार रेखा के रूप में उपयोग किया।

परियोजना ने खुले एआई उपकरणों के व्यापक पारिस्थितिकी तंत्र में भी योगदान दिया, जिसमें EleutherAI मूल्यांकन हार्नेस का विकास शामिल है, जिसने खुले मॉडलों के लिए बेंचमार्क परीक्षण को मानकीकृत किया। GPT-NeoX की वास्तुकला और प्रशिक्षण विधियों को विस्तार से दस्तावेजित किया गया, जो दूसरों के लिए पुनरुत्पादन और विस्तार के लिए एक खाका प्रदान करता है। इसकी विरासत पारदर्शी और सुलभ एआई अनुसंधान के लिए चल रहे प्रयास में बनी हुई है, जैसा कि EleutherAI और अन्य समूहों के बाद के रिलीज़ों में देखा गया है।

सीमाएं और विचार

अपनी क्षमताओं के बावजूद, GPT-NeoX में उल्लेखनीय सीमाएं हैं। इसके 20 अरब पैरामीटर कई समकालीन मॉडलों से छोटे हैं, जिससे जटिल तर्क कार्यों पर कम प्रदर्शन होता है। मॉडल पक्षपाती या हानिकारक आउटपुट उत्पन्न कर सकता है, जो इसके प्रशिक्षण डेटा में पूर्वाग्रहों को दर्शाता है। इसमें वाणिज्यिक प्रणालियों में उपयोग किए जाने वाले फाइन-ट्यूनिंग और संरेखण तकनीकों की भी कमी है, जिससे यह अतिरिक्त सुरक्षा उपायों के बिना उपयोगकर्ता-सामना वाले अनुप्रयोगों में सीधे तैनाती के लिए कम उपयुक्त है।

GPT-NeoX का उपयोग करने वाले शोधकर्ताओं को इसकी कम्प्यूटेशनल आवश्यकताओं पर विचार करना चाहिए, जो अनुमान और फाइन-ट्यूनिंग के लिए पर्याप्त हैं। मॉडल का मेमोरी फुटप्रिंट विशिष्ट उपभोक्ता हार्डवेयर से अधिक है, जिसके लिए क्लाउड इंफ्रास्ट्रक्चर या विशेष एक्सेलेरेटर की आवश्यकता होती है। इन कारकों ने इसके प्राथमिक उपयोग को उत्पादन प्रणाली के बजाय अनुसंधान उपकरण के रूप में आकार दिया है, हालांकि यह बड़े पैमाने के ट्रांसफॉर्मर मॉडलों का अध्ययन करने के लिए एक मूल्यवान संसाधन बना हुआ है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:large-language-models·open-source-ai·transformer-models·eleutherai
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास