जेनेरेटिव प्री-ट्रेंड ट्रांसफॉर्मर 3 (GPT-3) एक बड़ा भाषा मॉडल है जिसे ओपनएआई ने 2020 में कंपनी की GPT श्रृंखला के हिस्से के रूप में जारी किया था। यह गहन शिक्षण का एक डिकोडर-केवल ट्रांसफॉर्मर मॉडल है, जो पुनरावृत्ति और कनवल्शन-आधारित आर्किटेक्चर को एक ध्यान तंत्र के साथ प्रतिस्थापित करता है जो मॉडल को प्रासंगिक इनपुट टेक्स्ट पर चुनिंदा रूप से ध्यान केंद्रित करने की अनुमति देता है। GPT-3 में 175 बिलियन पैरामीटर हैं, प्रत्येक 16-बिट परिशुद्धता के साथ, जिसके लिए 350GB स्टोरेज की आवश्यकता होती है। इसकी संदर्भ विंडो 2,048 टोकन है और इसने कई कार्यों पर मजबूत शून्य-शॉट और कुछ-शॉट शिक्षण क्षमताओं का प्रदर्शन किया।
पृष्ठभूमि
द इकोनॉमिस्ट के अनुसार, बेहतर एल्गोरिदम, अधिक शक्तिशाली कंप्यूटर और बढ़ी हुई डिजिटलीकृत सामग्री ने मशीन लर्निंग में क्रांति को बढ़ावा दिया। 2010 के दशक में नई तकनीकों ने भाषा हेरफेर कार्यों में तेजी से सुधार किया। सॉफ्टवेयर मॉडल को मस्तिष्क के तंत्रिका आर्किचर के ढीले आधार पर संरचित हजारों या लाखों उदाहरणों का उपयोग करके प्रशिक्षित किया जाता है। एक महत्वपूर्ण आर्किटेक्चर ट्रांसफॉर्मर है, जिसे 2017 में पेश किया गया था, जो प्राकृतिक भाषा प्रसंस्करण प्रणालियों के लिए केंद्रीय बन गया।
11 जून, 2018 को, OpenAI शोधकर्ताओं ने एक पेपर प्रकाशित किया जिसमें पहला जेनेरेटिव प्री-ट्रेंड ट्रांसफॉर्मर (GPT) पेश किया गया, जो एक प्रकार का जेनेरेटिव बड़ा भाषा मॉडल है जिसे विविध टेक्स्ट कॉर्पस पर पूर्व-प्रशिक्षित किया गया था, इसके बाद विभेदक फाइन-ट्यूनिंग की गई। GPT-1 के बाद फरवरी 2019 में GPT-2 आया, जिसने पैरामीटर और डेटासेट आकार को 10 के कारक से बढ़ाया, 8 मिलियन वेब पेजों पर प्रशिक्षित 1.5 बिलियन पैरामीटर तक पहुंच गया। फरवरी 2020 में, माइक्रोसॉफ्ट ने ट्यूरिंग नेचुरल लैंग्वेज जेनरेशन (T-NLG) पेश किया जिसमें 17 बिलियन पैरामीटर थे, जो उस समय सबसे बड़ा प्रकाशित भाषा मॉडल था।
प्रशिक्षण और क्षमताएं
28 मई, 2020 को, 31 OpenAI इंजीनियरों और शोधकर्ताओं द्वारा एक arXiv प्रीप्रिंट ने GPT-3 का वर्णन किया, जो तीसरी पीढ़ी का अत्याधुनिक भाषा मॉडल है। टीम ने GPT-2 से क्षमता को दो परिमाण के क्रम से अधिक बढ़ाया, जिससे GPT-3 उस समय का सबसे बड़ा गैर-विरल भाषा मॉडल बन गया। इसकी सटीकता को बढ़ी हुई क्षमता और पैरामीटर के लिए जिम्मेदार ठहराया जाता है, जो माइक्रोसॉफ्ट के ट्यूरिंग एनएलजी से दस गुना बड़ा है। लैम्ब्डालैब्स ने 2020 में एक एकल GPU पर प्रशिक्षण के लिए लगभग 4.6 मिलियन डॉलर और 355 वर्षों की अनुमानित लागत का अनुमान लगाया, जिसमें समानांतर GPU का उपयोग करके वास्तविक समय कम था।
भारित प्री-ट्रेनिंग डेटासेट का साठ प्रतिशत कॉमन क्रॉल के फ़िल्टर किए गए संस्करण से आया था, जिसमें 410 बिलियन बाइट-पेयर-एन्कोडेड टोकन थे, जो अपाचे स्पार्क के MinHashLSH के साथ फजी डीडुप्लिकेशन का उपयोग करते थे। अन्य स्रोतों में WebText2 (19 बिलियन टोकन, 22%), Books1 (12 बिलियन टोकन, 8%), Books2 (55 बिलियन टोकन, 8%), और विकिपीडिया (3 बिलियन टोकन, 3%) शामिल थे। GPT-3 को सैकड़ों अरबों शब्दों पर प्रशिक्षित किया गया था और यह CSS, JSX और Python में कोड कर सकता था।
चूंकि प्रशिक्षण डेटा सर्व-समावेशी था, GPT-3 को अलग-अलग कार्यों के लिए आगे प्रशिक्षण की आवश्यकता नहीं होती है। हालांकि, यह कभी-कभी अपने प्रशिक्षण डेटा की नकल करने वाली विषाक्त भाषा उत्पन्न करता है। वाशिंगटन विश्वविद्यालय के एक अध्ययन में पाया गया कि GPT-3 ने GPT-2 और CTRL के बराबर विषाक्त भाषा उत्पन्न की। OpenAI ने विषाक्तता को सीमित करने के लिए रणनीतियां लागू कीं, जिसके परिणामस्वरूप GPT-1 से कम विषाक्त आउटपुट लेकिन CTRL विकी से अधिक था।
एपीआई और पहुंच
11 जून, 2020 को, OpenAI ने घोषणा की कि उपयोगकर्ता इसके GPT-3 API तक पहुंच का अनुरोध कर सकते हैं, जो सामान्य-उद्देश्य वाले टेक्स्ट-इन, टेक्स्ट-आउट इंटरफेस के साथ एक मशीन लर्निंग टूलसेट है। एक शुरुआती उपयोगकर्ता ने इसे सरल प्रॉम्प्ट के साथ सुसंगत टेक्स्ट लिखने में अजीब रूप से अच्छा बताया। एक प्रयोग में, 80 अमेरिकी विषयों ने लघु लेखों को मानव या GPT-3 लिखित के रूप में आंका, केवल 52% समय सही थे, जो यादृच्छिक से थोड़ा बेहतर था।
22 सितंबर, 2020 को, माइक्रोसॉफ्ट ने घोषणा की कि उसने GPT-3 को विशेष रूप से लाइसेंस दिया है। अन्य लोग अभी भी सार्वजनिक API से आउटपुट प्राप्त कर सकते थे, लेकिन केवल माइक्रोसॉफ्ट के पास अंतर्निहित मॉडल तक पहुंच थी। 18 नवंबर, 2021 को, OpenAI ने सामग्री मॉडरेशन टूल के साथ अप्रतिबंधित API पहुंच की घोषणा की। 27 जनवरी, 2022 को, OpenAI ने InstructGPT को डिफ़ॉल्ट मॉडल बनाया, जो निर्देशों का बेहतर पालन करता था और कम निर्मित तथ्य उत्पन्न करता था।
प्रभाव और चिंताएं
GPT-3 समाचार लेख उत्पन्न कर सकता है जिसे मानव मूल्यांकनकर्ता मानव-लिखित लेखों से अलग करने में कठिनाई महसूस करते हैं, जिसमें लाभकारी और हानिकारक दोनों अनुप्रयोगों की क्षमता है। मई 2020 के पेपर ने गलत सूचना, स्पैम, फ़िशिंग और कानूनी और सरकारी प्रक्रियाओं के दुरुपयोग सहित संभावित नुकसान का विवरण दिया था। मॉडल की रिलीज़ ने जनरेटिव एआई में आगे के विकास को प्रेरित किया और एंथ्रोपिक और गूगल डीपमाइंड के बाद के मॉडल को प्रभावित किया। इसकी आर्किटेक्चर और प्रशिक्षण दृष्टिकोण बाद के बड़े भाषा मॉडल के लिए आधारभूत बन गया, और इसका API मॉडल एज़्योर और अमेज़न वेब सर्विसेज पर वाणिज्यिक AI सेवाओं को प्रभावित करता था।
विरासत
GPT-3 ने बड़े भाषा मॉडल की सार्वजनिक जागरूकता में एक महत्वपूर्ण मोड़ चिह्नित किया, यह प्रदर्शित करते हुए कि ट्रांसफॉर्मर मॉडल को बड़ा करने से उभरती क्षमताएं प्राप्त हो सकती हैं। इसका 175-बिलियन-पैरामीटर पैमाना एक बेंचमार्क स्थापित करता है, हालांकि बाद के मॉडल इसे पार करेंगे। माइक्रोसॉफ्ट को विशेष लाइसेंसिंग ने ऐसे मॉडलों के वाणिज्यिक मूल्य को उजागर किया। GPT-3 की कुछ-शॉट शिक्षण क्षमताओं ने कार्य-विशिष्ट फाइन-ट्यूनिंग की आवश्यकता को कम कर दिया, जिससे आरएलएआईएफ और निर्देश-पालन में अनुसंधान प्रभावित हुआ। इसकी रिलीज़ ने AI सुरक्षा, पूर्वाग्रह और बड़े मॉडलों को प्रशिक्षित करने की पर्यावरणीय लागत के बारे में चर्चा भी बढ़ाई।