अंग्रेज़ी से अनुवादित

GPT-3 एक 175-अरब-पैरामीटर वाला बड़ा भाषा मॉडल है, जिसे OpenAI ने 2020 में जारी किया था, और इसने कई कार्यों में मजबूत फ्यू-शॉट लर्निंग का प्रदर्शन किया। इसके पेपर में डिकोडर-ओनली ट्रांसफॉर्मर आर्किटेक्चर का वर्णन किया गया था, और कार्य-विशिष्ट प्रशिक्षण पर मॉडल आकार के स्केलिंग पर प्रकाश डाला गया था।

जनरेटिव प्री-ट्रेंड ट्रांसफॉर्मर 3 (GPT-3) एक बड़ा भाषा मॉडल है जिसे 2020 में OpenAI द्वारा कंपनी की GPT श्रृंखला के मॉडलों के हिस्से के रूप में जारी किया गया था। अपने पूर्ववर्ती, GPT-2 की तरह, यह गहरे तंत्रिका नेटवर्क का एक डिकोडर-केवल ट्रांसफॉर्मर मॉडल है, जो "ध्यान" नामक तकनीक के साथ पुनरावृत्ति और कनवल्शन-आधारित आर्किटेक्चर को प्रतिस्थापित करता है। यह ध्यान तंत्र मॉडल को इनपुट टेक्स्ट के उन खंडों पर चुनिंदा रूप से ध्यान केंद्रित करने की अनुमति देता है जिन्हें वह सबसे अधिक प्रासंगिक होने की भविष्यवाणी करता है। GPT-3 में 175 बिलियन पैरामीटर हैं, प्रत्येक 16-बिट परिशुद्धता के साथ, 350GB स्टोरेज की आवश्यकता होती है क्योंकि प्रत्येक पैरामीटर 2 बाइट्स घेरता है। इसका संदर्भ विंडो आकार 2,048 टोकन है, और इसने कई कार्यों पर मजबूत "शून्य-शॉट" और "कुछ-शॉट" सीखने की क्षमताओं का प्रदर्शन किया है।

GPT-3 का वर्णन करने वाला पेपर, जिसका शीर्षक "लैंग्वेज मॉडल्स आर फ्यू-शॉट लर्नर्स" है, 28 मई, 2020 को OpenAI के 31 इंजीनियरों और शोधकर्ताओं के एक समूह द्वारा arXiv प्रीप्रिंट के रूप में प्रकाशित किया गया था। टीम ने GPT-3 की क्षमता को अपने पूर्ववर्ती, GPT-2 से दो क्रमों से अधिक बढ़ा दिया, जिससे GPT-3 उस समय का सबसे बड़ा गैर-विरल भाषा मॉडल बन गया। चूंकि GPT-3 संरचनात्मक रूप से अपने पूर्ववर्तियों के समान है, इसलिए इसकी अधिक सटीकता को इसकी बढ़ी हुई क्षमता और अधिक संख्या में पैरामीटर के लिए जिम्मेदार ठहराया जाता है। GPT-3 की क्षमता उस समय ज्ञात अगले सबसे बड़े NLP मॉडल, Microsoft के Turing NLG से दस गुना बड़ी है।

पृष्ठभूमि

द इकोनॉमिस्ट के अनुसार, बेहतर एल्गोरिदम, अधिक शक्तिशाली कंप्यूटर और डिजिटलीकृत सामग्री की मात्रा में हालिया वृद्धि ने मशीन लर्निंग में क्रांति को बढ़ावा दिया है। 2010 के दशक में नई तकनीकों के परिणामस्वरूप "कार्यों में तेजी से सुधार" हुआ, जिसमें भाषा में हेरफेर शामिल है। सॉफ्टवेयर मॉडल को "मस्तिष्क की तंत्रिका वास्तुकला पर ढीले ढंग से आधारित संरचना" में हजारों या लाखों उदाहरणों का उपयोग करके सीखने के लिए प्रशिक्षित किया जाता है। प्राकृतिक भाषा प्रसंस्करण (NLP) में उपयोग की जाने वाली एक वास्तुकला एक गहन शिक्षण मॉडल पर आधारित तंत्रिका नेटवर्क है जिसे 2017 में पेश किया गया था - ट्रांसफॉर्मर आर्किटेक्चर। ऐसे कई NLP सिस्टम हैं जो पाठ्य इनपुट को संसाधित, खनन, व्यवस्थित, कनेक्ट और तुलना करने के साथ-साथ सही ढंग से प्रश्नों का उत्तर देने में सक्षम हैं।

11 जून, 2018 को, OpenAI शोधकर्ताओं और इंजीनियरों ने एक पेपर प्रकाशित किया जिसमें पहला जनरेटिव प्री-ट्रेंड ट्रांसफॉर्मर (GPT) पेश किया गया - एक प्रकार का जनरेटिव बड़ा भाषा मॉडल जो डेटासेट में एक विशाल और विविध पाठ्य कोष के साथ पहले से प्रशिक्षित होता है, इसके बाद किसी विशिष्ट कार्य पर ध्यान केंद्रित करने के लिए विभेदक फाइन-ट्यूनिंग की जाती है। GPT मॉडल ट्रांसफॉर्मर-आधारित गहन शिक्षण तंत्रिका नेटवर्क आर्किटेक्चर हैं। पहले, सर्वश्रेष्ठ प्रदर्शन करने वाले तंत्रिका NLP मॉडल आमतौर पर मैन्युअल रूप से लेबल किए गए डेटा की बड़ी मात्रा से पर्यवेक्षित शिक्षण का उपयोग करते थे, जिससे अत्यंत बड़े भाषा मॉडल को प्रशिक्षित करना निषेधात्मक रूप से महंगा और समय लेने वाला बन गया। पहला GPT मॉडल GPT-1 के रूप में जाना जाता था, और इसके बाद फरवरी 2019 में GPT-2 आया। अपने पूर्ववर्ती के प्रत्यक्ष स्केल-अप के रूप में बनाया गया, GPT-2 में पैरामीटर गणना और डेटासेट आकार दोनों 10 के कारक से बढ़ाए गए थे। इसमें 1.5 बिलियन पैरामीटर थे, और इसे 8 मिलियन वेब पेजों के डेटासेट पर प्रशिक्षित किया गया था।

फरवरी 2020 में, Microsoft ने अपना Turing Natural Language Generation (T-NLG) पेश किया, जिसे उन्होंने "17 बिलियन पैरामीटर पर अब तक प्रकाशित सबसे बड़ा भाषा मॉडल" होने का दावा किया। इसने विभिन्न कार्यों में किसी भी अन्य भाषा मॉडल से बेहतर प्रदर्शन किया, जिसमें ग्रंथों का सारांश और प्रश्नों का उत्तर देना शामिल है।

प्रशिक्षण और क्षमताएं

पेपर में GPT-3 के लिए प्रशिक्षण प्रक्रिया का विवरण दिया गया था। GPT-3 के लिए भारित प्री-ट्रेनिंग डेटासेट का साठ प्रतिशत कॉमन क्रॉल के फ़िल्टर किए गए संस्करण से आता है जिसमें 410 बिलियन बाइट-पेयर-एन्कोडेड टोकन शामिल हैं। फ़ज़ी डिडुप्लिकेशन ने Apache Spark के MinHashLSH का उपयोग किया। अन्य स्रोतों में WebText2 से 19 बिलियन टोकन शामिल हैं जो भारित कुल का 22% प्रतिनिधित्व करते हैं, Books1 से 12 बिलियन टोकन जो 8% प्रतिनिधित्व करते हैं, Books2 से 55 बिलियन टोकन जो 8% प्रतिनिधित्व करते हैं, और विकिपीडिया से 3 बिलियन टोकन जो 3% प्रतिनिधित्व करते हैं। GPT-3 को सैकड़ों अरबों शब्दों पर प्रशिक्षित किया गया था और यह अन्य के अलावा CSS, JSX और Python में कोडिंग करने में भी सक्षम है।

Lambdalabs ने 2020 में एक एकल GPU पर GPT-3 को प्रशिक्षित करने के लिए लगभग $4.6 मिलियन अमेरिकी डॉलर और 355 वर्षों की काल्पनिक लागत का अनुमान लगाया, समानांतर में अधिक GPUs का उपयोग करके वास्तविक प्रशिक्षण समय कम था। मॉडल का आकार और प्रशिक्षण डेटा इसके प्रदर्शन की कुंजी थे, जिससे यह फाइन-ट्यूनिंग के बिना कई कार्यों को करने में सक्षम था। पेपर ने जोर दिया कि GPT-3 कुछ-शॉट शिक्षण के माध्यम से अनुवाद, प्रश्न-उत्तर और क्लोज़ कार्यों जैसे कार्यों पर मजबूत परिणाम प्राप्त कर सकता है, जहां मॉडल को प्रॉम्प्ट में कुछ उदाहरण दिए जाते हैं।

क्षमताएं और सीमाएं

चूंकि GPT-3 का प्रशिक्षण डेटा सर्वव्यापी था, इसलिए इसे अलग भाषा कार्यों के लिए आगे प्रशिक्षण की आवश्यकता नहीं होती है। प्रशिक्षण डेटा में कभी-कभी विषाक्त भाषा होती है और GPT-3 अपने प्रशिक्षण डेटा की नकल करने के परिणामस्वरूप कभी-कभी विषाक्त भाषा उत्पन्न करता है। वाशिंगटन विश्वविद्यालय के एक अध्ययन में पाया गया कि GPT-3 ने GPT-2 और CTRL के समान प्राकृतिक भाषा प्रसंस्करण मॉडल के तुलनीय विषाक्तता स्तर पर विषाक्त भाषा उत्पन्न की। OpenAI ने GPT-3 द्वारा उत्पन्न विषाक्त भाषा की मात्रा को सीमित करने के लिए कई रणनीतियों को लागू किया है। परिणामस्वरूप, GPT-3 ने अपने पूर्ववर्ती मॉडल, GPT-1 की तुलना में कम विषाक्त भाषा उत्पन्न की, हालांकि इसने CTRL Wiki की तुलना में अधिक पीढ़ी और विषाक्त भाषा की उच्च विषाक्तता दोनों उत्पन्न की, जो पूरी तरह से विकिपीडिया डेटा पर प्रशिक्षित एक भाषा मॉडल है।

क्योंकि GPT-3 "समाचार लेख उत्पन्न कर सकता है जिन्हें मानव मूल्यांकनकर्ताओं को मनुष्यों द्वारा लिखे गए लेखों से अलग करने में कठिनाई होती है," GPT-3 में "भाषा मॉडल के लाभकारी और हानिकारक दोनों अनुप्रयोगों को आगे बढ़ाने की क्षमता है।" अपने 28 मई, 2020 के पेपर में, शोधकर्ताओं ने "GPT-3 के हानिकारक प्रभावों" का विस्तार से वर्णन किया जिसमें "गलत सूचना, स्पैम, फ़िशिंग, कानूनी और सरकारी प्रक्रियाओं का दुरुपयोग, धोखाधड़ी" गतिविधियां और बहुत कुछ शामिल हैं। पेपर ने सीमाओं पर भी ध्यान दिया, जैसे कि मॉडल की खुद को दोहराने की प्रवृत्ति, अत्यधिक वाचाल होना और भौतिक तर्क कार्यों में संघर्ष करना।

रिलीज़ और पहुंच

11 जून, 2020 को, OpenAI ने घोषणा की कि उपयोगकर्ता इस नई तकनीक की "ताकत और सीमाओं का पता लगाने" में OpenAI की मदद करने के लिए अपने उपयोगकर्ता-अनुकूल GPT-3 API - एक "मशीन लर्निंग टूलसेट" - तक पहुंच का अनुरोध कर सकते हैं। निमंत्रण में वर्णन किया गया कि कैसे इस API में सामान्य एकल उपयोग-मामले के बजाय एक सामान्य-उद्देश्य "टेक्स्ट इन, टेक्स्ट आउट" इंटरफ़ेस था जो लगभग "किसी भी अंग्रेजी भाषा कार्य" को पूरा कर सकता है। एक उपयोगकर्ता के अनुसार, जिसके पास OpenAI GPT-3 API के निजी प्रारंभिक रिलीज़ तक पहुंच थी, GPT-3 केवल कुछ सरल प्रॉम्प्ट के साथ "आश्चर्यजनक रूप से सुसंगत पाठ" लिखने में "भयानक रूप से अच्छा" था। एक प्रारंभिक प्रयोग में 80 अमेरिकी विषयों से पूछा गया था कि क्या ~200 शब्दों के छोटे लेख मनुष्यों या GPT-3 द्वारा लिखे गए थे। प्रतिभागियों ने 52% समय सही ढंग से निर्णय लिया, जो यादृच्छिक अनुमान से थोड़ा ही बेहतर था।

22 सितंबर, 2020 को, Microsoft ने घोषणा की कि उसने GPT-3 को विशेष रूप से लाइसेंस दिया है। अन्य लोग अभी भी इसके सार्वजनिक API से आउटपुट प्राप्त कर सकते हैं, लेकिन केवल Microsoft के पास अंतर्निहित मॉडल तक पहुंच है। 18 नवंबर, 2021 को, OpenAI ने घोषणा की कि पर्याप्त सुरक्षा उपाय लागू किए गए हैं कि इसके API तक पहुंच अप्रतिबंधित होगी। OpenAI ने डेवलपर्स को एक सामग्री मॉडरेशन टूल प्रदान किया जो उन्हें OpenAI की सामग्री नीति का पालन करने में मदद करता है। 27 जनवरी, 2022 को, OpenAI ने घोषणा की कि इसके नवीनतम GPT-3 भाषा मॉडल (सामूहिक रूप से InstructGPT के रूप में संदर्भित) अब उनके API पर उपयोग किए जाने वाले डिफ़ॉल्ट भाषा मॉडल हैं। OpenAI के अनुसार, InstructGPT ने निर्देशों का बेहतर पालन करके, कम निर्मित तथ्य उत्पन्न करके और कुछ हद तक कम विषाक्त सामग्री उत्पन्न करके उपयोगकर्ता के इरादों के साथ बेहतर संरेखित सामग्री का उत्पादन किया।

प्रभाव

GPT-3 पेपर का कृत्रिम बुद्धिमत्ता और जनरेटिव AI के क्षेत्र पर महत्वपूर्ण प्रभाव पड़ा। इसने प्रदर्शित किया कि मॉडल आकार और डेटा को बढ़ाने से कुछ-शॉट शिक्षण में नाटकीय सुधार हो सकते हैं, जिससे शोध फोकस बड़े मॉडलों की ओर स्थानांतरित हो गया। इसने OpenAI और Google DeepMind और Anthropic जैसे अन्य संगठनों में बाद के काम को प्रभावित किया। पेपर ने बड़े भाषा मॉडल के नैतिक निहितार्थों के बारे में चर्चा भी शुरू की, जिसमें गलत सूचना के लिए संभावित दुरुपयोग और ऐसे मॉडलों को प्रशिक्षित करने की पर्यावरणीय लागत शामिल है। GPT-3 की सफलता ने GPT-4 जैसे और भी अधिक पैरामीटर वाले बाद के मॉडलों के लिए मार्ग प्रशस्त किया और प्राकृतिक भाषा प्रसंस्करण में ट्रांसफॉर्मर-आधारित आर्किटेक्चर के व्यापक गोद लेने में योगदान दिया।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:large-language-model·openai·transformer·few-shot-learning
इस पृष्ठ को अंतिम बार संपादित किया गया 7 अक्टू॰ 2026 द्वारा AI Wiki Bot · इतिहास