GPT-2 (जनरेटिव प्रीट्रेंड ट्रांसफॉर्मर 2) एक बड़ा भाषा मॉडल है जिसे ओपनएआई द्वारा विकसित किया गया था और पहली बार फरवरी 2019 में घोषित किया गया था। ट्रांसफॉर्मर आर्किटेक्चर पर निर्मित, GPT-2 को WebText पर प्रशिक्षित किया गया था, जो लगभग 8 मिलियन वेब पेजों का एक डेटासेट है, जिसमें विशुद्ध रूप से ऑटोरेग्रेसिव अगले-टोकन भविष्यवाणी उद्देश्य का उपयोग किया गया था, जो सीधे 2018 में जारी छोटे मूल GPT मॉडल का अनुसरण करता है।
चरणबद्ध रिलीज़
GPT-2 मुख्य रूप से अपने आर्किटेक्चर के लिए नहीं, बल्कि इसके लिए व्यापक रूप से जाना गया कि ओपनएआई ने इसे कैसे जारी किया। पूर्ण मॉडल में 1.5 बिलियन पैरामीटर थे, जो उस समय सार्वजनिक भाषा मॉडल के लिए असामान्य रूप से बड़ा आकार था, और यह छोटे प्रॉम्प्ट से सुसंगत बहु-पैराग्राफ पाठ उत्पन्न करता था, जिसकी धाराप्रवाहता ने कई शोधकर्ताओं को आश्चर्यचकित कर दिया। नकली समाचार, स्पैम और बड़े पैमाने पर प्रतिरूपण जैसे दुर्भावनापूर्ण उपयोगों के बारे में चिंताओं का हवाला देते हुए, ओपनएआई ने शुरू में पूर्ण 1.5B पैरामीटर मॉडल जारी करने से इनकार कर दिया, केवल छोटे संस्करण प्रकाशित किए और संभावित दुरुपयोग का अध्ययन करते रहे। यह निर्णय, जिसे सार्वजनिक रूप से मॉडल के "जारी करने के लिए बहुत खतरनाक" होने के रूप में प्रस्तुत किया गया था, ने अनुसंधान समुदाय के कुछ हिस्सों से महत्वपूर्ण आलोचना प्राप्त की, जिन्होंने तर्क दिया कि यह या तो अत्यधिक सतर्कता थी, एक विपणन रणनीति थी, या शोध परिणामों को रोकने के लिए एक अजीब मिसाल कायम करता था। ओपनएआई ने धीरे-धीरे अपना रुख बदला, नवंबर 2019 में पूर्ण 1.5B पैरामीटर मॉडल जारी किया, जब उसने बताया कि उसके चरणबद्ध-रिलीज़ अध्ययन में उस पैमाने पर दुरुपयोग के मजबूत सबूत नहीं मिले, जिसका उसे डर था।
महत्व
GPT-2 उन पहले मॉडलों में से एक था जिसने मजबूत शून्य-शॉट कार्य प्रदर्शन का प्रदर्शन किया, जिसने कार्य-विशिष्ट फाइन-ट्यूनिंग के बिना सारांश, अनुवाद और प्रश्न उत्तर उत्पन्न किए, केवल प्राकृतिक भाषा में उदाहरणों के साथ प्रॉम्प्ट किए जाने से, जो इसके उत्तराधिकारी जीपीटी-3 में बाद में फ्यू-शॉट लर्निंग और इन-कॉन्टेक्स्ट लर्निंग के रूप में औपचारिक रूप से परिभाषित किए जाने वाले का एक प्रारंभिक उदाहरण था। इसका पैमाना, मूल GPT से लगभग दस गुना बड़ा, ने भी शोधकर्ताओं के लिए एक प्रारंभिक डेटा बिंदु के रूप में कार्य किया, जिसे वे बाद में अधिक औपचारिक रूप से स्केलिंग-लॉ के रूप में वर्णित करेंगे: कि मॉडल और डेटा आकार बढ़ाने से भाषा मॉडलिंग प्रदर्शन में पूर्वानुमानित रूप से सुधार हुआ।
विरासत
GPT-2 की रिलीज़ रणनीति एआई शासन और एआई-सुरक्षा बहस में व्यापक रूप से उद्धृत केस स्टडी बन गई, जो खुले बनाम बंद मॉडल रिलीज़ पर बाद के अधिक स्थायी तर्कों का पूर्वाभास करती है, जो लामा और अन्य ओपन-वेट मॉडल जैसी प्रणालियों के साथ फिर से उभरे। ओपनएआई की अपनी उत्पाद लाइन के भीतर, GPT-2 की वास्तुकला और प्रशिक्षण दृष्टिकोण ने जीपीटी-3 के लिए सीधा आधार बनाया, जो अगले वर्ष 100 गुना से अधिक पैरामीटर गणना के साथ जारी किया गया था, और अंततः चैटजीपीटी उत्पाद के लिए, जिसने 2022 में GPT वंश को मुख्यधारा के ध्यान में लाया। शोधकर्ता एलेक रैडफोर्ड और ओपनएआई में उनके सहयोगियों को GPT-2 के प्राथमिक लेखकों के रूप में श्रेय दिया जाता है।