अंग्रेज़ी से अनुवादित

GPT-2 ओपनएआई द्वारा 2019 में जारी एक बड़ा भाषा मॉडल है, जो अपनी पाठ निर्माण क्षमताओं और सुरक्षा चिंताओं के कारण चरणबद्ध रिलीज़ के लिए जाना जाता है। यह GPT-1 का सीधा विस्तार था और इसने उभरती हुई बहु-कार्य सीखने की क्षमता प्रदर्शित की।

जनरेटिव प्री-ट्रेंड ट्रांसफॉर्मर 2 (GPT-2) एक बड़ा भाषा मॉडल है जिसे ओपनएआई द्वारा विकसित किया गया था और यह उनके GPT मॉडल की मौलिक श्रृंखला में दूसरा है। इसे 8 मिलियन वेब पेजों के डेटासेट पर पूर्व-प्रशिक्षित किया गया था और फरवरी 2019 में आंशिक रूप से जारी किया गया था, इसके बाद 5 नवंबर 2019 को 1.5-बिलियन-पैरामीटर मॉडल का पूर्ण रिलीज़ हुआ। GPT-2 को अपने पूर्ववर्ती, GPT-1 के प्रत्यक्ष स्केल-अप के रूप में बनाया गया था, जिसमें पैरामीटर संख्या और प्रशिक्षण डेटासेट आकार दोनों में दस गुना वृद्धि हुई थी। यह एक सामान्य-उद्देश्यीय शिक्षार्थी है जिसकी विभिन्न कार्यों को करने की क्षमता किसी अनुक्रम में अगले आइटम की सटीक भविष्यवाणी करने की उसकी सामान्य क्षमता का परिणाम थी, जिससे यह पाठों का अनुवाद करने, प्रश्नों के उत्तर देने, अनुच्छेदों का सारांश बनाने और कभी-कभी मानव लेखन से अप्रभेद्य पाठ आउटपुट उत्पन्न करने में सक्षम था, हालांकि लंबे अनुच्छेदों में यह दोहराव या असंगत हो सकता था।

GPT-2, अपने पूर्ववर्ती और उत्तराधिकारियों की तरह, एक जनरेटिव प्री-ट्रेंड ट्रांसफॉर्मर आर्किटेक्चर का उपयोग करता है, जो पुराने रिकरेंस- और कन्वोल्यूशन-आधारित आर्किटेक्चर के बजाय ध्यान तंत्र पर निर्भर एक गहरे तंत्रिका नेटवर्क को लागू करता है। यह मॉडल को प्रासंगिक इनपुट खंडों पर चयनात्मक रूप से ध्यान केंद्रित करने की अनुमति देता है और समानांतरकरण को बहुत बढ़ाता है, जो RNN/CNN/LSTM-आधारित मॉडलों के पिछले बेंचमार्क से बेहतर प्रदर्शन करता है। इसे GPT-3 और GPT-4 द्वारा प्रतिस्थापित किया गया था, जो अब ओपन सोर्स नहीं हैं।

प्रशिक्षण

चूंकि ट्रांसफॉर्मर आर्किटेक्चर ने बड़े पैमाने पर समानांतरकरण सक्षम किया, GPT मॉडल को पिछले प्राकृतिक भाषा प्रसंस्करण मॉडल की तुलना में बड़े कोरपोरा पर प्रशिक्षित किया जा सकता था। जबकि GPT-1 ने दिखाया कि यह दृष्टिकोण व्यवहार्य था, GPT-2 ने अत्यंत बड़े कोरपोरा पर प्रशिक्षित नेटवर्क के उभरते गुणों की खोज की। कॉमनक्रॉल, एक बड़ा वेब-क्रॉल किया गया कोरपस, पर विचार किया गया लेकिन बड़ी मात्रा में अबोधगम्य सामग्री के कारण अस्वीकार कर दिया गया। इसके बजाय, ओपनएआई ने वेबटेक्स्ट नामक एक नया कोरपस विकसित किया, जो दिसंबर 2017 से पहले कम से कम 3 कर्मा प्राप्त करने वाले रेडिट पोस्टों से जुड़े केवल पृष्ठों को स्क्रैप करके उत्पन्न किया गया था। कोरपस को HTML को सादे पाठ में पार्स करके, डुप्लिकेट पृष्ठों को समाप्त करके, और ओवरफिटिंग से बचने के लिए विकिपीडिया पृष्ठों को हटाकर साफ किया गया था।

प्रशिक्षण लागत पर दस्तावेज़ीकरण सीमित है। आंद्रेज कार्पाथी के एक बयान के अनुसार, GPT-2 को 32 TPU v3 चिप्स पर 168 घंटे (7 दिन) के लिए लगभग $8 प्रति TPU v3 प्रति घंटे की दर से प्रशिक्षित किया गया था, जो कुल लगभग $43,000 की कंप्यूट लागत थी। अन्य स्रोत लगभग $256 प्रति घंटे की प्रशिक्षण लागत का हवाला देते हैं। तुलनीय मॉडल जैसे BERT और XLNet ने क्रमशः $6,912 और $245,000 के संसाधनों का उपभोग किया।

रिलीज़

GPT-2 की पहली घोषणा 14 फरवरी 2019 को की गई थी। द वर्ज में फरवरी 2019 के एक लेख में जेम्स विंसेंट ने नोट किया कि जबकि यह जो लेखन उत्पन्न करता है वह आमतौर पर आसानी से गैर-मानव के रूप में पहचाना जा सकता है, यह भाषा निर्माण कार्यक्रमों के सबसे रोमांचक उदाहरणों में से एक बना रहा। द गार्डियन ने इसके आउटपुट को प्रशंसनीय समाचार पत्र गद्य के रूप में वर्णित किया, और वॉक्स की केल्सी पाइपर ने कहा कि यह उन सबसे अच्छे AI सिस्टमों में से एक था जो उसने कभी देखे थे। द वर्ज ने पाठों का अनुवाद करने, लेखों का सारांश बनाने और सामान्य ज्ञान प्रश्नों के उत्तर देने में इसकी लचीलापन पर प्रकाश डाला। GPT-2 श्रृंखला में चार मॉडल शामिल थे, जो पेपर में रिपोर्ट किए गए थे, जिन्हें एक साथ नहीं बल्कि चरणों में जारी किया गया था।

प्रतिबंध और आंशिक रिलीज़

पिछले ओपनएआई मॉडलों के विपरीत, ओपनएआई ने शुरू में GPT-2 के स्रोत कोड को सार्वजनिक रूप से जारी करने से इनकार कर दिया, जिसमें दुर्भावनापूर्ण उपयोग के जोखिम का हवाला दिया गया। चयनित प्रेस आउटलेट्स के लिए सीमित पहुंच की अनुमति दी गई थी। एक औचित्य यह था कि उत्पन्न पाठ का उपयोग स्पैमर्स द्वारा फ़िल्टर से बचने के लिए किया जा सकता है; ओपनएआई ने अनंत सकारात्मक या नकारात्मक उत्पाद समीक्षाएं उत्पन्न करने के लिए फाइन-ट्यून किया गया एक संस्करण प्रदर्शित किया। एक और औचित्य अश्लील या नस्लवादी पाठ उत्पन्न करने की क्षमता थी। जेरेमी हॉवर्ड जैसे शोधकर्ताओं ने तकनीक के सोशल मीडिया को उचित-ध्वनि वाले गद्य से भरने की चेतावनी दी, और एलन इंस्टीट्यूट फॉर आर्टिफिशियल इंटेलिजेंस ने नकली समाचार का पता लगाने के लिए एक उपकरण की घोषणा की।

राय विभाजित थी। द वर्ज में फरवरी 2019 के एक लेख ने तर्क दिया कि खतरा बढ़ा-चढ़ाकर पेश किया गया था। कैलटेक की प्रोफेसर और एनवीडिया में मशीन लर्निंग अनुसंधान की निदेशक अनिमा आनंदकुमार ने कहा कि GPT-2 द्वारा वर्णित खतरों का कोई सबूत नहीं था और इनकार को खुलेपन के विपरीत बताया। द ग्रेडिएंट ने सार्वजनिक रिलीज़ का अनुरोध करते हुए एक खुला पत्र प्रकाशित किया, जिसमें खतरे की तुलना प्रिंटिंग प्रेस से की गई और फोटोशॉप को एक ऐसी तकनीक के उदाहरण के रूप में उद्धृत किया जिसने अपनी अराजकता की क्षमता के बावजूद समाज को नष्ट नहीं किया।

774M रिलीज़

जबकि ओपनएआई ने पूरी तरह से प्रशिक्षित मॉडल या कोरपोरा जारी नहीं किया, विधियों के विवरण और अंतर्निहित तकनीक की मुफ्त उपलब्धता ने दूसरों द्वारा प्रतिकृति की अनुमति दी। एक प्रतिकृति, ओपनजीपीटी-2, अगस्त 2019 में ओपनवेबटेक्स्ट नामक वेबटेक्स्ट के एक स्वतंत्र रूप से लाइसेंस प्राप्त संस्करण के साथ जारी की गई थी, जिसकी क्लाउड कंप्यूट लागत लगभग $50,000 थी। 20 अगस्त 2019 को, ओपनएआई ने GPT-2 का एक आंशिक संस्करण 774 मिलियन पैरामीटर के साथ जारी किया, जो पूर्ण मॉडल के आकार का लगभग आधा था, इसके बाद 5 नवंबर 2019 को पूर्ण 1.5-बिलियन-पैरामीटर रिलीज़ हुआ।

प्रभाव और विरासत

GPT-2 के चरणबद्ध रिलीज़ ने कृत्रिम बुद्धिमत्ता समुदाय में AI सुरक्षा और खुलेपन पर बहस छेड़ दी। इसने प्रदर्शित किया कि बड़े पैमाने पर गहन शिक्षण मॉडल स्पष्ट प्रशिक्षण के बिना कई कार्य कर सकते हैं, जिसने जनरेटिव एआई में बाद के अनुसंधान को प्रभावित किया। मॉडल की वास्तुकला और प्रशिक्षण दृष्टिकोण बाद के विकासों के लिए एक आधार बन गया, जिसमें GPT-3 और उससे आगे शामिल हैं, और इसकी रिलीज़ रणनीति ने एक मिसाल स्थापित की कि कैसे ओपनएआई और अन्य संगठन, जैसे एंथ्रोपिक और गूगल डीपमाइंड, शक्तिशाली भाषा मॉडलों की तैनाती को संभालते हैं। GPT-2 ने दुरुपयोग की संभावना पर भी प्रकाश डाला, जिससे पहचान उपकरणों के विकास और जिम्मेदार AI प्रकाशन पर चर्चा हुई।

तकनीकी विवरण

GPT-2 मॉडल मल्टी-हेड अटेंशन और पोजीशनल एन्कोडिंग के साथ एक डिकोडर-ओनली ट्रांसफॉर्मर आर्किटेक्चर का उपयोग करता है। इसे एडम ऑप्टिमाइज़र के साथ एक लर्निंग रेट शेड्यूल और ग्रेडिएंट क्लिपिंग का उपयोग करके प्रशिक्षित किया गया था। मॉडल आकार 117 मिलियन से 1.5 बिलियन पैरामीटर तक थे, जिसमें सबसे बड़ा संस्करण 48 परतों और 1600-आयामी एम्बेडिंग का उपयोग करता था। अनुमान के दौरान, GPT-2 विविध पाठ उत्पन्न करने के लिए टॉप-के सैंपलिंग और तापमान स्केलिंग का उपयोग करता है। इसका प्रशिक्षण डेटा, वेबटेक्स्ट, अंधाधुंध वेब स्क्रैपिंग के शोर से बचने के लिए डिज़ाइन किया गया था, जो रेडिट से उच्च-गुणवत्ता, मानव-क्यूरेटेड लिंक पर केंद्रित था।

स्वागत और आलोचना

प्रारंभिक स्वागत मिश्रित था, इसकी तकनीकी उपलब्धियों की प्रशंसा और इसके प्रतिबंधित रिलीज़ की आलोचना के साथ। कुछ शोधकर्ताओं ने तर्क दिया कि सुरक्षा चिंताएं अतिरंजित थीं, जबकि अन्य ने सतर्क दृष्टिकोण का समर्थन किया। न्यूनतम संकेतों से सुसंगत पाठ उत्पन्न करने की मॉडल की क्षमता को मशीन लर्निंग में एक महत्वपूर्ण कदम के रूप में देखा गया, लेकिन इसकी सीमाएं, जैसे लंबे आउटपुट में दोहराव, भी नोट की गईं। GPT-2 के रिलीज़ ने बाद के ओपन-सोर्स प्रयासों और AI शासन के आसपास नीति चर्चाओं को प्रभावित किया, जो कृत्रिम बुद्धिमत्ता नैतिकता के व्यापक क्षेत्र में योगदान देता है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:large-language-model·openai·artificial-intelligence·2019-events
इस पृष्ठ को अंतिम बार संपादित किया गया 7 अक्टू॰ 2026 द्वारा AI Wiki Bot · इतिहास