अंग्रेज़ी से अनुवादित

GPT-2 एक OpenAI द्वारा निर्मित बड़ा भाषा मॉडल है, जिसे 2019 में जारी किया गया था, जो अपनी उन्नत पाठ निर्माण क्षमता और सुरक्षा चिंताओं के कारण प्रारंभिक प्रतिबंधित रिलीज़ के लिए जाना जाता है।

GPT-2 (जनरेटिव प्री-ट्रेंड ट्रांसफॉर्मर 2) एक बड़ा भाषा मॉडल है जिसे ओपनएआई द्वारा विकसित किया गया है, जो उनकी मौलिक GPT श्रृंखला की दूसरी पुनरावृत्ति का प्रतिनिधित्व करता है। इसे 8 मिलियन वेब पेजों के डेटासेट पर पूर्व-प्रशिक्षित किया गया था और इसने पाठ निर्माण, अनुवाद, सारांशीकरण और प्रश्न-उत्तर में महत्वपूर्ण प्रगति प्रदर्शित की। मॉडल को शुरू में संभावित दुरुपयोग की चिंताओं के कारण सार्वजनिक रिलीज़ से रोक दिया गया था, लेकिन अंततः नवंबर 2019 में पूरी तरह से जारी किया गया।

GPT-2 अपने पूर्ववर्ती GPT-1 का सीधा विस्तार है, जिसमें पैरामीटर संख्या और प्रशिक्षण डेटासेट आकार दोनों में दस गुना वृद्धि हुई है। यह एक ट्रांसफॉर्मर वास्तुकला का उपयोग करता है, जो इनपुट पाठ के प्रासंगिक भागों पर चुनिंदा रूप से ध्यान केंद्रित करने के लिए ध्यान तंत्र का उपयोग करता है, जिससे अधिक समानांतरीकरण संभव होता है और पिछले RNN/CNN/LSTM-आधारित मॉडलों से बेहतर प्रदर्शन होता है। इसकी सामान्य-उद्देश्यीय सीखने की क्षमता ने इसे अनुक्रम में अगले आइटम की सटीक भविष्यवाणी करके विभिन्न कार्यों को करने की अनुमति दी, हालांकि लंबे अंशों पर यह दोहरावदार या अर्थहीन हो सकता था। GPT-2 को बाद में GPT-3 और GPT-4 जैसे मॉडलों द्वारा प्रतिस्थापित किया गया, जो अब ओपन सोर्स नहीं हैं।

प्रशिक्षण और वास्तुकला

GPT-2 के प्रशिक्षण ने ट्रांसफॉर्मर वास्तुकला की बड़े पैमाने पर समानांतरीकरण की क्षमता का लाभ उठाया, जिससे इसे पिछले प्राकृतिक भाषा प्रसंस्करण मॉडलों की तुलना में बड़े कॉर्पोरा पर प्रशिक्षित किया जा सका। ओपनएआई ने शुरू में कॉमनक्रॉल पर विचार किया, जो एक बड़ा वेब-क्रॉल किया गया कॉर्पस है, लेकिन समझ से बाहर सामग्री के कारण इसे अस्वीकार कर दिया। इसके बजाय, उन्होंने वेबटेक्स्ट नामक एक नया कॉर्पस विकसित किया, जो दिसंबर 2017 से पहले कम से कम 3 कर्मा वाले रेडिट पोस्ट से लिंक किए गए पृष्ठों को स्क्रैप करके बनाया गया था। कॉर्पस को HTML को सादे पाठ में पार्स करके, डुप्लिकेट हटाकर और ओवरफिटिंग से बचने के लिए विकिपीडिया पृष्ठों को बाहर करके साफ किया गया था।

GPT-2 की प्रशिक्षण लागत लगभग $43,000 होने का अनुमान है, जो आंद्रेज कार्पैथी के एक बयान पर आधारित है, जिसमें 32 TPU v3 चिप्स का उपयोग 168 घंटों के लिए लगभग $8 प्रति चिप प्रति घंटे की दर से किया गया था। अन्य स्रोत लगभग $256 प्रति घंटे की लागत का हवाला देते हैं। तुलना में, BERT और XLNet को प्रशिक्षित करने की लागत क्रमशः $6,912 और $245,000 थी। GPT-2 की वास्तुकला एक गहरा तंत्रिका नेटवर्क है जिसमें एक जनरेटिव प्री-ट्रेंड ट्रांसफॉर्मर है, जो पुनरावृत्ति या कनवल्शन के बजाय ध्यान लागू करता है।

रिलीज़ और प्रारंभिक प्रतिबंध

GPT-2 की घोषणा 14 फरवरी 2019 को की गई थी। पिछले ओपनएआई मॉडलों के विपरीत, स्रोत कोड तुरंत जारी नहीं किया गया था, दुर्भावनापूर्ण उपयोग के जोखिमों का हवाला देते हुए। चुनिंदा प्रेस आउटलेट्स को सीमित पहुंच दी गई थी, और ओपनएआई ने उत्पाद समीक्षा उत्पन्न करने के लिए ठीक-ट्यून किया गया एक संस्करण प्रदर्शित किया, जिसका उपयोग स्पैम फिल्टर से बचने के लिए किया जा सकता था। जेरेमी हॉवर्ड जैसे शोधकर्ताओं ने वेब को ठोस गद्य से भरने की क्षमता की चेतावनी दी, जबकि एलन इंस्टीट्यूट फॉर आर्टिफिशियल इंटेलिजेंस ने "तंत्रिका नकली समाचार" के लिए एक पहचान उपकरण की घोषणा की।

खतरे पर राय विभाजित थीं। कुछ, जैसे अनिमा आनंदकुमार, ने प्रतिबंधों को "दुर्भावनापूर्ण बकवास" कहा, जबकि द ग्रेडिएंट ने एक खुला पत्र प्रकाशित किया जिसमें तकनीक की तुलना प्रिंटिंग प्रेस और फोटोशॉप से की गई। विवाद के बावजूद, ओपनएआई ने 20 अगस्त 2019 को 774 मिलियन पैरामीटर वाला एक आंशिक संस्करण जारी किया, और 5 नवंबर 2019 को पूर्ण 1.5-बिलियन-पैरामीटर मॉडल जारी किया।

मॉडल वेरिएंट और प्रतिकृतियां

GPT-2 श्रृंखला में विभिन्न आकारों के चार मॉडल शामिल थे, जो चरणों में जारी किए गए थे। सबसे छोटा मॉडल फरवरी 2019 में उपलब्ध कराया गया था, जिसके बाद बड़े मॉडल आए। पूर्ण 1.5-बिलियन-पैरामीटर मॉडल अंतिम रिलीज़ था। मॉडल के तरीकों को प्रकाशनों में वर्णित किया गया था, जिससे दूसरों को इसे मुफ्त सॉफ्टवेयर के रूप में दोहराने की अनुमति मिली। ऐसी ही एक प्रतिकृति, ओपनजीपीटी-2, अगस्त 2019 में वेबटेक्स्ट के एक स्वतंत्र रूप से लाइसेंस प्राप्त संस्करण के साथ जारी की गई थी, जिसकी कंप्यूट लागत लगभग $50,000 थी।

प्रभाव और विरासत

GPT-2 की रिलीज़ ने जनरेटिव एआई में एक महत्वपूर्ण मील का पत्थर चिह्नित किया, जो बड़े पैमाने पर ट्रांसफॉर्मर की क्षमता को प्रदर्शित करता है। सुसंगत पाठ उत्पन्न करने की इसकी क्षमता की द वर्ज और द गार्डियन जैसे आउटलेट्स द्वारा प्रशंसा की गई, हालांकि यह नोट किया गया कि लंबे अंश दोहरावदार हो सकते हैं। मॉडल के प्रारंभिक रोक ने एआई अनुसंधान में खुली पहुंच और सुरक्षा के बारे में बहस छेड़ दी, जिसने जिम्मेदार एआई विकास पर भविष्य की चर्चाओं को प्रभावित किया। GPT-2 को GPT-3 और GPT-4 द्वारा सफल बनाया गया, जिन्होंने क्षेत्र को आगे बढ़ाना जारी रखा लेकिन ओपन-सोर्स से दूर चले गए।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:large-language-model·openai·transformer·generative-ai
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास