अंग्रेज़ी से अनुवादित

2019年期间,OpenAI分阶段发布的一个大型自回归语言模型,因其最初决定出于滥用担忧而保留完整权重所引发的争议而闻名。

GPT-2 (जनरेटिव प्रीट्रेंड ट्रांसफॉर्मर 2) एक बड़ा भाषा मॉडल है जिसे ओपनएआई द्वारा विकसित किया गया था और पहली बार फरवरी 2019 में घोषित किया गया था। ट्रांसफॉर्मर आर्किटेक्चर पर निर्मित, GPT-2 को WebText पर प्रशिक्षित किया गया था, जो लगभग 8 मिलियन वेब पेजों का एक डेटासेट है, जिसमें विशुद्ध रूप से ऑटोरेग्रेसिव अगले-टोकन भविष्यवाणी उद्देश्य का उपयोग किया गया था, जो सीधे 2018 में जारी छोटे मूल GPT मॉडल का अनुसरण करता है।

चरणबद्ध रिलीज़

GPT-2 मुख्य रूप से अपने आर्किटेक्चर के लिए नहीं, बल्कि इसके लिए व्यापक रूप से जाना गया कि ओपनएआई ने इसे कैसे जारी किया। पूर्ण मॉडल में 1.5 बिलियन पैरामीटर थे, जो उस समय सार्वजनिक भाषा मॉडल के लिए असामान्य रूप से बड़ा आकार था, और यह छोटे प्रॉम्प्ट से सुसंगत बहु-पैराग्राफ पाठ उत्पन्न करता था, जिसकी धाराप्रवाहता ने कई शोधकर्ताओं को आश्चर्यचकित कर दिया। नकली समाचार, स्पैम और बड़े पैमाने पर प्रतिरूपण जैसे दुर्भावनापूर्ण उपयोगों के बारे में चिंताओं का हवाला देते हुए, ओपनएआई ने शुरू में पूर्ण 1.5B पैरामीटर मॉडल जारी करने से इनकार कर दिया, केवल छोटे संस्करण प्रकाशित किए और संभावित दुरुपयोग का अध्ययन करते रहे। यह निर्णय, जिसे सार्वजनिक रूप से मॉडल के "जारी करने के लिए बहुत खतरनाक" होने के रूप में प्रस्तुत किया गया था, ने अनुसंधान समुदाय के कुछ हिस्सों से महत्वपूर्ण आलोचना प्राप्त की, जिन्होंने तर्क दिया कि यह या तो अत्यधिक सतर्कता थी, एक विपणन रणनीति थी, या शोध परिणामों को रोकने के लिए एक अजीब मिसाल कायम करता था। ओपनएआई ने धीरे-धीरे अपना रुख बदला, नवंबर 2019 में पूर्ण 1.5B पैरामीटर मॉडल जारी किया, जब उसने बताया कि उसके चरणबद्ध-रिलीज़ अध्ययन में उस पैमाने पर दुरुपयोग के मजबूत सबूत नहीं मिले, जिसका उसे डर था।

महत्व

GPT-2 उन पहले मॉडलों में से एक था जिसने मजबूत शून्य-शॉट कार्य प्रदर्शन का प्रदर्शन किया, जिसने कार्य-विशिष्ट फाइन-ट्यूनिंग के बिना सारांश, अनुवाद और प्रश्न उत्तर उत्पन्न किए, केवल प्राकृतिक भाषा में उदाहरणों के साथ प्रॉम्प्ट किए जाने से, जो इसके उत्तराधिकारी जीपीटी-3 में बाद में फ्यू-शॉट लर्निंग और इन-कॉन्टेक्स्ट लर्निंग के रूप में औपचारिक रूप से परिभाषित किए जाने वाले का एक प्रारंभिक उदाहरण था। इसका पैमाना, मूल GPT से लगभग दस गुना बड़ा, ने भी शोधकर्ताओं के लिए एक प्रारंभिक डेटा बिंदु के रूप में कार्य किया, जिसे वे बाद में अधिक औपचारिक रूप से स्केलिंग-लॉ के रूप में वर्णित करेंगे: कि मॉडल और डेटा आकार बढ़ाने से भाषा मॉडलिंग प्रदर्शन में पूर्वानुमानित रूप से सुधार हुआ।

विरासत

GPT-2 की रिलीज़ रणनीति एआई शासन और एआई-सुरक्षा बहस में व्यापक रूप से उद्धृत केस स्टडी बन गई, जो खुले बनाम बंद मॉडल रिलीज़ पर बाद के अधिक स्थायी तर्कों का पूर्वाभास करती है, जो लामा और अन्य ओपन-वेट मॉडल जैसी प्रणालियों के साथ फिर से उभरे। ओपनएआई की अपनी उत्पाद लाइन के भीतर, GPT-2 की वास्तुकला और प्रशिक्षण दृष्टिकोण ने जीपीटी-3 के लिए सीधा आधार बनाया, जो अगले वर्ष 100 गुना से अधिक पैरामीटर गणना के साथ जारी किया गया था, और अंततः चैटजीपीटी उत्पाद के लिए, जिसने 2022 में GPT वंश को मुख्यधारा के ध्यान में लाया। शोधकर्ता एलेक रैडफोर्ड और ओपनएआई में उनके सहयोगियों को GPT-2 के प्राथमिक लेखकों के रूप में श्रेय दिया जाता है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:generative-ai·language-models·openai
इस पृष्ठ को अंतिम बार संपादित किया गया 2 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास