GPT-2 (जनरेटिव प्री-ट्रेंड ट्रांसफॉर्मर 2) एक बड़ा भाषा मॉडल है जिसे ओपनएआई द्वारा विकसित किया गया था, और इसकी घोषणा 14 फरवरी 2019 को की गई थी। यह OpenAI की मौलिक GPT श्रृंखला में दूसरा मॉडल है, जो GPT-1 के बाद और GPT-3 से पहले आया। GPT-2 को 8 मिलियन वेब पेजों के डेटासेट पर प्री-ट्रेंड किया गया था, और सुसंगत, संदर्भ-प्रासंगिक पाठ उत्पन्न करने की इसकी क्षमता को जनरेटिव एआई में एक महत्वपूर्ण प्रगति के रूप में देखा गया। मॉडल को शुरू में आंशिक रिलीज़ के दौरान रोक दिया गया था, और पूर्ण 1.5-बिलियन-पैरामीटर संस्करण केवल 5 नवंबर 2019 को उपलब्ध हुआ। भाषाओं का अनुवाद करने, प्रश्नों का उत्तर देने और अनुच्छेदों का सारांश बनाने की क्षमता के कारण, शोधकर्ताओं और टिप्पणीकारों ने लाभकारी उपयोगों और दुरुपयोग दोनों की संभावना पर प्रकाश डाला, जैसे स्पैम निर्माण या फर्जी समाचारों का सृजन।
आर्किटेक्चर
अपने पूर्ववर्ती GPT-1 और उत्तराधिकारियों की तरह, GPT-2 एक गहन शिक्षण ट्रांसफॉर्मर आर्किटेक्चर का उपयोग करता है, जो एक प्रकार का तंत्रिका नेटवर्क है जो ध्यान (attention) नामक तंत्र को लागू करता है। यह ध्यान तंत्र अनुक्रम-से-अनुक्रम भविष्यवाणी से जुड़े कार्यों के लिए प्रदर्शन को बढ़ाने में सिद्ध हुआ है। पुनरावृत्ति या कनवल्शन पर आधारित पुराने मॉडलों के विपरीत, ट्रांसफॉर्मर का ध्यान तंत्र मॉडल को इनपुट पाठ को समानांतर में संसाधित करने की अनुमति देता है, जो प्रशिक्षण और अनुमान की गति को काफी बढ़ा सकता है। मॉडल की आर्किटेक्चर को GPT-1 के शीर्ष-पैमाने के रूप में वर्णित किया गया था, जिसमें इसके पैरामीटर गणना (1.5 बिलियन) और प्रशिक्षण डेटा आकार में 10 गुना वृद्धि हुई थी। विशेष हार्डवेयर पर प्राप्त यह समानांतरीकरण, पहले की तुलना में बड़े कॉर्पस पर प्रशिक्षण की अनुमति देता था, जिसने सामान्य मशीन लर्निंग कार्यों को संभालने की इसकी क्षमता में योगदान दिया।
प्रशिक्षण
GPT-2 को WebText पर प्रशिक्षित किया गया था, जो दिसंबर 2017 से पहले Reddit पर कम से कम 3 कर्मा प्राप्त करने वाले आउटबाउंड लिंक से स्क्रैप किए गए 100 गीगाबाइट से अधिक पाठ का एक कॉर्पस है। Reddit का उपयोग मानव-क्यूरेटेड सामग्री के प्रॉक्सी के रूप में किया गया था, जो निम्न-गुणवत्ता वाले पृष्ठों को फ़िल्टर करता था। HTML को सादे पाठ में पार्स किया गया, डुप्लिकेट लिंक हटाए गए, और ओवरफिटिंग को रोकने के लिए प्रशिक्षण सेट से विकिपीडिया पृष्ठ हटा दिए गए, क्योंकि वे लेख अक्सर कई अन्य डेटासेट में दिखाई देते हैं। CommonCrawl, अपने आकार के बावजूद, इसमें बड़ी मात्रा में अबोधगम्य सामग्री होने के कारण अस्वीकार कर दिया गया था। GPT-2 के प्रशिक्षण के लिए बुनियादी ढांचे ने 168 घंटों के लिए 32 TPU v3 चिप्स का उपयोग किया, जिसकी लागत लगभग $43,000 थी, जैसा कि उस समय परियोजना से जुड़े शोधकर्ता आंद्रेज कारपाथी ने बताया। यह ट्रांसफॉर्मर की दक्षता के कारण, इसके आकार के मॉडल के लिए अपेक्षाकृत कम था। परिणाम एक ऐसा मॉडल था जो कभी-कभी मानव आउटपुट से अप्रभेद्य स्तर पर पाठ उत्पन्न कर सकता था, हालांकि लंबे अनुच्छेदों में यह दोहराव या अर्थहीन हो सकता था, एक सीमा जिसे भविष्य के बड़े भाषा मॉडल सुधारने का लक्ष्य रखते थे।
आंशिक रिलीज़
OpenAI का पूर्ण मॉडल को तुरंत जारी न करने का प्रारंभिक निर्णय इस चिंता पर आधारित था कि मॉडल का उपयोग दुर्भावनापूर्ण उद्देश्यों के लिए किया जा सकता है, जैसे स्पैम या गलत सूचना उत्पन्न करना। कंपनी ने 20 अगस्त 2019 को 774 मिलियन पैरामीटर वाला एक आंशिक संस्करण जारी किया, जो मूल के आकार का लगभग आधा था (जिसे 774M रिलीज़ भी कहा जाता है)। यह आंशिक रिलीज़ शोधकर्ताओं को दुरुपयोग को कम करते हुए मॉडल के व्यवहार को समझने की अनुमति देने के लिए की गई थी, कि OpenAI के दृष्टिकोण ने कुछ शोधकर्ताओं, जिनमें अनिमा आनंदकुमार शामिल थीं, से आलोचना प्राप्त की, जिन्होंने दावा किया कि खतरा अतिरंजित था। हालांकि, अन्य लोगों ने तर्क दिया कि मॉडल का उपयोग सोशल मीडिया को अप्रभेद्य गद्य से भरने के लिए किया जा सकता है, और एलन इंस्टीट्यूट फॉर आर्टिफिशियल इंटेलिजेंस ने प्रतिक्रिया में तंत्रिका फर्जी समाचारों के लिए एक डिटेक्टर बनाया।
फरवरी 2019 में द वर्ज में एक लेख में, जेम्स विंसेंट ने लिखा कि GPT-2 के आउटपुट अक्सर स्पष्ट रूप से गैर-मानवीय थे, लेकिन फिर भी भाषा निर्माण एआई के "सबसे रोमांचक उदाहरणों" में से एक थे। लेख ने प्रदर्शित किया कि, एक नकली शीर्षक के साथ, मॉडल नकली उद्धरणों और आंकड़ों के साथ बाकी लेख लिख सकता था, और उचित संकेत दिए जाने पर काल्पनिक सामग्री भी लिख सकता था। वॉक्स की केल्सी पाइपर ने लिखा कि "मैंने अब तक देखी सबसे अच्छी एआई प्रणालियों में से एक वह हो सकती है जो मुझे बाहर निकाल देगी;" हालांकि, उन्होंने इसके आउटपुट को तटस्थ दृष्टिकोण से वर्णित किया। द गार्डियन ने इसके पाठ को "प्रशंसनीय समाचार पत्र गद्य" के रूप में वर्णित किया।
आंशिक रिलीज़ के बावजूद, OpenAI ने पूर्ण मॉडल का कोड और कॉर्पस बरकरार रखा। इससे विभिन्न तृतीय-पक्ष आउटपुट सामने आए। अगस्त 2019 में, मुफ्त-सॉफ्टवेयर प्रतिकृति OpenGPT-2 का उत्पादन OpenWebText का उपयोग करके किया गया, जिसकी कंप्यूट लागत लगभग $50,000 थी। यह मॉडल की प्रारंभिक रिलीज़ के बाद हुए खुले अनुसंधान और विकास को दर्शाता है।
नैतिक और सामाजिक प्रभाव
GPT-2 के पूर्ण रिलीज़ में देरी के निर्णय ने कृत्रिम बुद्धिमत्ता प्रौद्योगिकी के जोखिमों और लाभों के बारे में सार्वजनिक बहस शुरू की। कुछ शोधकर्ताओं ने कथित खतरों को खारिज कर दिया, यह देखते हुए कि खतरों को कम किया जा सकता है, जबकि अन्य ने सिंथेटिक पाठ की आने वाली बाढ़ की चेतावनी दी जो प्रामाणिक मानव भाषण को डुबो सकती है। सकारात्मक या नकारात्मक उत्पाद समीक्षा उत्पन्न करने के लिए एक फाइन-ट्यून मॉडल का आंशिक रिलीज़ भी था, जो संभावित स्पैम क्षमता का प्रदर्शन था। प्रचार और खुले-से-खुले नीति के जवाब में, शोधकर्ताओं के एक समूह ने पूर्ण रिलीज़ का अनुरोध करते हुए एक खुला पत्र प्रकाशित किया, यह अस्वीकार करते हुए कि भाषा मॉडल उतने खतरनाक नहीं हैं जितना उन्हें दिखाया गया था, फोटोशॉप और प्रिंटिंग प्रेस जैसी तकनीकों का हवाला देते हुए, जिनका दुरुपयोग किया गया है लेकिन दैनिक जीवन में भी एकीकृत किए गए हैं।
रोके गए रिलीज़ का दीर्घकालिक प्रभाव यह था कि इसने बड़े भाषा मॉडल और उनकी क्षमताओं के बारे में सार्वजनिक जागरूकता बढ़ाई। GPT-2 को अंततः कृत्रिम बुद्धिमत्ता सुरक्षा पर ध्यान केंद्रित करने के रूप में उपयोग किया गया, जिसने बाद के ओपन-सोर्स मॉडल को प्रभावित किया। इसे बाद में GPT-3 और GPT-4 द्वारा प्रतिस्थापित किया गया; 2024 तक, GPT-3 और GPT-4, जो अब ओपन-सोर्स नहीं हैं, अधिक प्रमुख हो गए हैं। यह प्रकरण शक्तिशाली एआई सिस्टम विकसित करते समय पारदर्शिता और सावधानी को संतुलित करने के बारे में विचारों के लिए एक महत्वपूर्ण बिंदु के रूप में कार्य किया।
विरासत
GPT-2 ने गहन शिक्षण के क्षेत्र में एक महत्वपूर्ण विकास का प्रतिनिधित्व किया, जो बाद के भाषा मॉडलों के लिए एक बेंचमार्क बन गया। अनुक्रम में अगले आइटम की भविष्यवाणी पर निर्भर, और कार्य-विशिष्ट डेटा पर नहीं, एक सामान्य-उद्देश्यीय शिक्षार्थी के रूप में सेवा करने की इसकी क्षमता, बाद के ट्रांसफॉर्मर के लिए एक मौलिक कदम थी। मॉडल की पैरामीटर गणना और प्रशिक्षण कॉर्पस आकार ने तंत्रिका नेटवर्क मॉडल को स्केल करने के लिए एक मार्ग स्थापित किया। परिणामस्वरूप, जनरेटिव एआई की कम्प्यूटेशनल मांगें बढ़ गई हैं, और GPT-2 को कृत्रिम बुद्धिमत्ता के इतिहास में एक मील का पत्थर माना जाता है। इसके प्रशिक्षण सिद्धांतों ने कई क्षेत्रों द्वारा बड़े भाषा मॉडल के विकास और आर्किटेक्चर को प्रभावित करना जारी रखा है, और मॉडल उभरते व्यवहार और मशीन लर्निंग को समझने के लिए एक अच्छी तरह से अध्ययनित संदर्भ बिंदु बना हुआ है।