अंग्रेज़ी से अनुवादित

GPT-3 एक बड़ा भाषा मॉडल है जिसे OpenAI ने 2020 में जारी किया था, जिसमें 175 बिलियन पैरामीटर हैं, और यह अपनी मजबूत फ्यू-शॉट लर्निंग और टेक्स्ट जनरेशन क्षमताओं के लिए जाना जाता है। इसने जनरेटिव AI में एक महत्वपूर्ण मील का पत्थर साबित किया, जिससे व्यापक API पहुंच और वाणिज्यिक लाइसेंसिंग का मार्ग प्रशस्त हुआ।

जेनेरेटिव प्री-ट्रेंड ट्रांसफॉर्मर 3 (GPT-3) एक बड़ा भाषा मॉडल है जिसे ओपनएआई ने 2020 में कंपनी की GPT श्रृंखला के हिस्से के रूप में जारी किया था। यह गहन शिक्षण का एक डिकोडर-केवल ट्रांसफॉर्मर मॉडल है, जो पुनरावृत्ति और कनवल्शन-आधारित आर्किटेक्चर को एक ध्यान तंत्र के साथ प्रतिस्थापित करता है जो मॉडल को प्रासंगिक इनपुट टेक्स्ट पर चुनिंदा रूप से ध्यान केंद्रित करने की अनुमति देता है। GPT-3 में 175 बिलियन पैरामीटर हैं, प्रत्येक 16-बिट परिशुद्धता के साथ, जिसके लिए 350GB स्टोरेज की आवश्यकता होती है। इसकी संदर्भ विंडो 2,048 टोकन है और इसने कई कार्यों पर मजबूत शून्य-शॉट और कुछ-शॉट शिक्षण क्षमताओं का प्रदर्शन किया।

पृष्ठभूमि

द इकोनॉमिस्ट के अनुसार, बेहतर एल्गोरिदम, अधिक शक्तिशाली कंप्यूटर और बढ़ी हुई डिजिटलीकृत सामग्री ने मशीन लर्निंग में क्रांति को बढ़ावा दिया। 2010 के दशक में नई तकनीकों ने भाषा हेरफेर कार्यों में तेजी से सुधार किया। सॉफ्टवेयर मॉडल को मस्तिष्क के तंत्रिका आर्किचर के ढीले आधार पर संरचित हजारों या लाखों उदाहरणों का उपयोग करके प्रशिक्षित किया जाता है। एक महत्वपूर्ण आर्किटेक्चर ट्रांसफॉर्मर है, जिसे 2017 में पेश किया गया था, जो प्राकृतिक भाषा प्रसंस्करण प्रणालियों के लिए केंद्रीय बन गया।

11 जून, 2018 को, OpenAI शोधकर्ताओं ने एक पेपर प्रकाशित किया जिसमें पहला जेनेरेटिव प्री-ट्रेंड ट्रांसफॉर्मर (GPT) पेश किया गया, जो एक प्रकार का जेनेरेटिव बड़ा भाषा मॉडल है जिसे विविध टेक्स्ट कॉर्पस पर पूर्व-प्रशिक्षित किया गया था, इसके बाद विभेदक फाइन-ट्यूनिंग की गई। GPT-1 के बाद फरवरी 2019 में GPT-2 आया, जिसने पैरामीटर और डेटासेट आकार को 10 के कारक से बढ़ाया, 8 मिलियन वेब पेजों पर प्रशिक्षित 1.5 बिलियन पैरामीटर तक पहुंच गया। फरवरी 2020 में, माइक्रोसॉफ्ट ने ट्यूरिंग नेचुरल लैंग्वेज जेनरेशन (T-NLG) पेश किया जिसमें 17 बिलियन पैरामीटर थे, जो उस समय सबसे बड़ा प्रकाशित भाषा मॉडल था।

प्रशिक्षण और क्षमताएं

28 मई, 2020 को, 31 OpenAI इंजीनियरों और शोधकर्ताओं द्वारा एक arXiv प्रीप्रिंट ने GPT-3 का वर्णन किया, जो तीसरी पीढ़ी का अत्याधुनिक भाषा मॉडल है। टीम ने GPT-2 से क्षमता को दो परिमाण के क्रम से अधिक बढ़ाया, जिससे GPT-3 उस समय का सबसे बड़ा गैर-विरल भाषा मॉडल बन गया। इसकी सटीकता को बढ़ी हुई क्षमता और पैरामीटर के लिए जिम्मेदार ठहराया जाता है, जो माइक्रोसॉफ्ट के ट्यूरिंग एनएलजी से दस गुना बड़ा है। लैम्ब्डालैब्स ने 2020 में एक एकल GPU पर प्रशिक्षण के लिए लगभग 4.6 मिलियन डॉलर और 355 वर्षों की अनुमानित लागत का अनुमान लगाया, जिसमें समानांतर GPU का उपयोग करके वास्तविक समय कम था।

भारित प्री-ट्रेनिंग डेटासेट का साठ प्रतिशत कॉमन क्रॉल के फ़िल्टर किए गए संस्करण से आया था, जिसमें 410 बिलियन बाइट-पेयर-एन्कोडेड टोकन थे, जो अपाचे स्पार्क के MinHashLSH के साथ फजी डीडुप्लिकेशन का उपयोग करते थे। अन्य स्रोतों में WebText2 (19 बिलियन टोकन, 22%), Books1 (12 बिलियन टोकन, 8%), Books2 (55 बिलियन टोकन, 8%), और विकिपीडिया (3 बिलियन टोकन, 3%) शामिल थे। GPT-3 को सैकड़ों अरबों शब्दों पर प्रशिक्षित किया गया था और यह CSS, JSX और Python में कोड कर सकता था।

चूंकि प्रशिक्षण डेटा सर्व-समावेशी था, GPT-3 को अलग-अलग कार्यों के लिए आगे प्रशिक्षण की आवश्यकता नहीं होती है। हालांकि, यह कभी-कभी अपने प्रशिक्षण डेटा की नकल करने वाली विषाक्त भाषा उत्पन्न करता है। वाशिंगटन विश्वविद्यालय के एक अध्ययन में पाया गया कि GPT-3 ने GPT-2 और CTRL के बराबर विषाक्त भाषा उत्पन्न की। OpenAI ने विषाक्तता को सीमित करने के लिए रणनीतियां लागू कीं, जिसके परिणामस्वरूप GPT-1 से कम विषाक्त आउटपुट लेकिन CTRL विकी से अधिक था।

एपीआई और पहुंच

11 जून, 2020 को, OpenAI ने घोषणा की कि उपयोगकर्ता इसके GPT-3 API तक पहुंच का अनुरोध कर सकते हैं, जो सामान्य-उद्देश्य वाले टेक्स्ट-इन, टेक्स्ट-आउट इंटरफेस के साथ एक मशीन लर्निंग टूलसेट है। एक शुरुआती उपयोगकर्ता ने इसे सरल प्रॉम्प्ट के साथ सुसंगत टेक्स्ट लिखने में अजीब रूप से अच्छा बताया। एक प्रयोग में, 80 अमेरिकी विषयों ने लघु लेखों को मानव या GPT-3 लिखित के रूप में आंका, केवल 52% समय सही थे, जो यादृच्छिक से थोड़ा बेहतर था।

22 सितंबर, 2020 को, माइक्रोसॉफ्ट ने घोषणा की कि उसने GPT-3 को विशेष रूप से लाइसेंस दिया है। अन्य लोग अभी भी सार्वजनिक API से आउटपुट प्राप्त कर सकते थे, लेकिन केवल माइक्रोसॉफ्ट के पास अंतर्निहित मॉडल तक पहुंच थी। 18 नवंबर, 2021 को, OpenAI ने सामग्री मॉडरेशन टूल के साथ अप्रतिबंधित API पहुंच की घोषणा की। 27 जनवरी, 2022 को, OpenAI ने InstructGPT को डिफ़ॉल्ट मॉडल बनाया, जो निर्देशों का बेहतर पालन करता था और कम निर्मित तथ्य उत्पन्न करता था।

प्रभाव और चिंताएं

GPT-3 समाचार लेख उत्पन्न कर सकता है जिसे मानव मूल्यांकनकर्ता मानव-लिखित लेखों से अलग करने में कठिनाई महसूस करते हैं, जिसमें लाभकारी और हानिकारक दोनों अनुप्रयोगों की क्षमता है। मई 2020 के पेपर ने गलत सूचना, स्पैम, फ़िशिंग और कानूनी और सरकारी प्रक्रियाओं के दुरुपयोग सहित संभावित नुकसान का विवरण दिया था। मॉडल की रिलीज़ ने जनरेटिव एआई में आगे के विकास को प्रेरित किया और एंथ्रोपिक और गूगल डीपमाइंड के बाद के मॉडल को प्रभावित किया। इसकी आर्किटेक्चर और प्रशिक्षण दृष्टिकोण बाद के बड़े भाषा मॉडल के लिए आधारभूत बन गया, और इसका API मॉडल एज़्योर और अमेज़न वेब सर्विसेज पर वाणिज्यिक AI सेवाओं को प्रभावित करता था।

विरासत

GPT-3 ने बड़े भाषा मॉडल की सार्वजनिक जागरूकता में एक महत्वपूर्ण मोड़ चिह्नित किया, यह प्रदर्शित करते हुए कि ट्रांसफॉर्मर मॉडल को बड़ा करने से उभरती क्षमताएं प्राप्त हो सकती हैं। इसका 175-बिलियन-पैरामीटर पैमाना एक बेंचमार्क स्थापित करता है, हालांकि बाद के मॉडल इसे पार करेंगे। माइक्रोसॉफ्ट को विशेष लाइसेंसिंग ने ऐसे मॉडलों के वाणिज्यिक मूल्य को उजागर किया। GPT-3 की कुछ-शॉट शिक्षण क्षमताओं ने कार्य-विशिष्ट फाइन-ट्यूनिंग की आवश्यकता को कम कर दिया, जिससे आरएलएआईएफ और निर्देश-पालन में अनुसंधान प्रभावित हुआ। इसकी रिलीज़ ने AI सुरक्षा, पूर्वाग्रह और बड़े मॉडलों को प्रशिक्षित करने की पर्यावरणीय लागत के बारे में चर्चा भी बढ़ाई।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:large-language-model·openai·generative-ai·machine-learning
इस पृष्ठ को अंतिम बार संपादित किया गया 9 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास