अंग्रेज़ी से अनुवादित

GPT-NeoX एलुथरएआई द्वारा विकसित एक ओपन-सोर्स 20-बिलियन-पैरामीटर ऑटोरेग्रेसिव लार्ज लैंग्वेज मॉडल है, जिसे 2022 में जारी किया गया था। यह उस समय के ओपन मॉडलों के बीच अपने पैमाने और कुशल प्रशिक्षण कार्यान्वयन के लिए उल्लेखनीय है।

GPT-NeoX एल्यूथरएआई नामक शोध समूह द्वारा विकसित एक ओपन-सोर्स बड़ा भाषा मॉडल है। फरवरी 2022 में जारी, यह 20-अरब-पैरामीटर वाला ऑटोरेग्रेसिव ट्रांसफॉर्मर मॉडल है, जो इसे अपने रिलीज़ के समय उपलब्ध सबसे बड़े पूर्ण रूप से ओपन-सोर्स भाषा मॉडलों में से एक बनाता है। मॉडल को कृत्रिम बुद्धिमत्ता में अनुसंधान को आगे बढ़ाने के लिए डिज़ाइन किया गया था, जो मालिकाना प्रणालियों के लिए सार्वजनिक रूप से सुलभ विकल्प प्रदान करता है, जिसमें इसके वजन, प्रशिक्षण कोड और मूल्यांकन विवरण स्वतंत्र रूप से उपलब्ध कराए गए हैं। GPT-NeoX पहले की GPT-Neo श्रृंखला पर आधारित है, जो प्राकृतिक भाषा कार्यों की एक श्रृंखला में प्रदर्शन में सुधार के लिए वास्तुकला और प्रशिक्षण तकनीकों को बढ़ाता है।

मॉडल की वास्तुकला मानक डिकोडर-केवल ट्रांसफॉर्मर डिज़ाइन का पालन करती है, जिसमें बहु-शीर्ष ध्यान को स्थितीय एन्कोडिंग और परत सामान्यीकरण के साथ शामिल किया गया है। यह अपनी 44-परत संरचना में अवशिष्ट-नेटवर्क कनेक्शन का उपयोग करता है, जिसमें छिपा हुआ आयाम 6144 और 32 ध्यान शीर्ष हैं। मॉडल को वेब क्रॉल, पुस्तकों और शैक्षणिक पत्रों से प्राप्त विविध पाठ कोष पर प्रशिक्षित किया गया था, जो कुल लगभग 825 गीगाबाइट डेटा है। प्रशिक्षण 96 NVIDIA A100 GPU के क्लस्टर पर मेगाट्रॉन-डीपस्पीड फ्रेमवर्क का उपयोग करके आयोजित किया गया था, जिसने मॉडल प्रूनिंग और कई नोड्स में समानांतरीकरण को सक्षम किया। प्रशिक्षण प्रक्रिया में लगभग दो महीने लगे और अनुमानित 1.1 एक्साफ्लॉप्स कंप्यूट का उपभोग किया।

प्रशिक्षण और अनुकूलन

GPT-NeoX ने बड़े पैमाने पर प्रशिक्षण को स्थिर करने के लिए कई उन्नत मशीन-लर्निंग तकनीकों का उपयोग किया। मॉडल ने विस्फोटक ग्रेडिएंट को रोकने के लिए ग्रेडिएंट-क्लिपिंग का उपयोग किया और सीखने-दर-अनुसूची को वार्मअप चरण के बाद कोसाइन क्षय के साथ अपनाया। वजन-आरंभीकरण पिछले ट्रांसफॉर्मर मॉडलों की प्रथाओं के बाद स्केल किए गए विचरण के साथ सामान्य वितरण का उपयोग करके किया गया था। प्रशिक्षण उद्देश्य मानक कारण भाषा मॉडलिंग था, जो पूर्व संदर्भ को देखते हुए अगले टोकन की भविष्यवाणी करता था। दक्षता में सुधार के लिए, टीम ने अनुक्रम-से-अनुक्रम बैचिंग लागू की और पैरामीटर अपडेट के लिए एडम-ऑप्टिमाइज़र के साथ एसजीडी-वेरिएंट का उपयोग किया। मॉडल ने नियमितीकरण के लिए ड्रॉपआउट भी शामिल किया, हालांकि क्षमता को संरक्षित करने के लिए छोटे मॉडलों की तुलना में कम दरों पर।

क्षमताएं और प्रदर्शन

GPT-NeoX LAMBADA, HellaSwag और SuperGLUE जैसे बेंचमार्क पर मजबूत प्रदर्शन प्रदर्शित करता है, जो अक्सर समान आकार के मॉडलों को टक्कर देता है या उनसे आगे निकल जाता है जो पूरी तरह से खुले नहीं हैं। यह गहन-शिक्षण कार्यों में उत्कृष्ट है जिनके लिए लंबी-सीमा निर्भरता की आवश्यकता होती है, जैसे कहानी निर्माण और खुले-अंत प्रश्न उत्तर। मॉडल नियंत्रित पाठ निर्माण के लिए टॉप-के-सैंपलिंग, टॉप-पी-सैंपलिंग और तापमान-स्केलिंग का समर्थन करता है, जिससे उपयोगकर्ता रचनात्मकता और निर्धारण को समायोजित कर सकते हैं। इसका 20-अरब-पैरामीटर पैमाना सूक्ष्म तंत्रिका-नेटवर्क प्रतिनिधित्व को सक्षम बनाता है, लेकिन अनुमान के लिए पर्याप्त कम्प्यूटेशनल संसाधनों की भी आवश्यकता होती है, आमतौर पर कई उच्च-अंत GPU की आवश्यकता होती है। मॉडल कई आकारों में उपलब्ध है, जिसमें 1.3B और 2.7B वेरिएंट शामिल हैं, हालांकि 20B संस्करण प्रमुख है।

प्रभाव और पारिस्थितिकी तंत्र

GPT-NeoX का ओपन-सोर्स जनरेटिव-एआई समुदाय पर महत्वपूर्ण प्रभाव पड़ा है। यह बाद के मॉडलों के लिए एक आधार के रूप में कार्य करता था, जिसमें GPT-J और GPT-NeoX-20B व्युत्पन्न शामिल हैं, और अन्य संगठनों को बड़े पैमाने पर खुले मॉडल जारी करने के प्रयासों को प्रेरित किया। प्रशिक्षण कोड और बुनियादी ढांचे का व्यापक रूप से पुन: उपयोग किया गया है, जो एल्यूथरएआई मूल्यांकन हार्नेस जैसे उपकरणों के विकास में योगदान देता है। मॉडल की रिलीज़ ने बड़े मॉडलों के प्रशिक्षण की पर्यावरणीय लागत और एआई अनुसंधान में पारदर्शिता के महत्व के बारे में चर्चा भी शुरू की। इसकी तुलना अक्सर ओपनएआई और एंथ्रोपिक के मालिकाना मॉडलों से की जाती है, हालांकि यह उनके सबसे बड़े प्रस्तावों से छोटा बना हुआ है।

सीमाएं और नैतिक विचार

कई बड़े भाषा मॉडलों की तरह, GPT-NeoX पक्षपाती या हानिकारक सामग्री उत्पन्न कर सकता है, जो इसके प्रशिक्षण डेटा में मौजूद पूर्वाग्रहों को दर्शाता है। इसमें कोई अंतर्निहित सुरक्षा फ़िल्टर नहीं है, और उपयोगकर्ताओं को अतिरिक्त मॉडरेशन लागू करने की सलाह दी जाती है। मॉडल का आकार इसे उपभोक्ता हार्डवेयर पर तैनाती के लिए अव्यावहारिक बनाता है, जिससे अच्छी तरह से वित्त पोषित संस्थानों तक पहुंच सीमित हो जाती है। एल्यूथरएआई ने जोर दिया है कि मॉडल एक शोध कलाकृति है, उत्पादन प्रणाली नहीं, और जिम्मेदार उपयोग को प्रोत्साहित करता है। प्रशिक्षण डेटा में कॉपीराइट सामग्री शामिल है, जो उचित उपयोग के बारे में कानूनी प्रश्न उठाती है, हालांकि मॉडल Apache 2.0 लाइसेंस के तहत जारी किया गया है, जो व्यापक डाउनस्ट्रीम उपयोग की अनुमति देता है।

उपलब्धता और उपयोग

GPT-NeoX हगिंग फेस और एल्यूथरएआई GitHub रिपॉजिटरी से डाउनलोड के लिए उपलब्ध है। मॉडल को ट्रांसफॉर्मर लाइब्रेरी या मूल मेगाट्रॉन-डीपस्पीड कोडबेस का उपयोग करके चलाया जा सकता है। डेवलपर्स के लिए, यह प्रदर्शन और पहुंच के बीच संतुलन प्रदान करता है, जिसमें समुदाय-निर्मित क्वांटाइज़्ड संस्करण मेमोरी आवश्यकताओं को कम करते हैं। मॉडल का उपयोग व्याख्यात्मकता, पाठ्यक्रम-शिक्षण और आरएलएआईएफ पर अकादमिक अनुसंधान में किया गया है, और नई वास्तुकलाओं के मूल्यांकन के लिए एक आधार रेखा के रूप में कार्य करता है। इसकी खुली प्रकृति विशेष डोमेन पर फाइन-ट्यूनिंग की अनुमति देती है, जो इसे मशीन-लर्निंग चिकित्सकों के लिए एक बहुमुखी उपकरण बनाती है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:large-language-model·open-source-ai·transformer·eleutherai
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास