जनरेटिव प्री-ट्रेंड ट्रांसफॉर्मर 3 (GPT-3) एक बड़ा भाषा मॉडल है जिसे OpenAI ने 2020 में कंपनी की GPT श्रृंखला के हिस्से के रूप में जारी किया था। यह एक डिकोडर-ओनली ट्रांसफॉर्मर मॉडल है जो गहरे तंत्रिका नेटवर्क पर आधारित है, जो पुनरावृत्ति और कनवल्शन-आधारित आर्किटेक्चर को एक ध्यान तंत्र के साथ प्रतिस्थापित करता है जो प्रासंगिक इनपुट टेक्स्ट पर चयनात्मक ध्यान केंद्रित करने की अनुमति देता है। GPT-3 में 175 बिलियन पैरामीटर हैं, प्रत्येक 16-बिट परिशुद्धता के साथ, जिसके लिए 350GB स्टोरेज की आवश्यकता होती है, और 2,048 टोकन की संदर्भ विंडो है, जो कई कार्यों पर मजबूत ज़ीरो-शॉट और फ्यू-शॉट सीखने की क्षमताओं का प्रदर्शन करता है।
पृष्ठभूमि
GPT-3 का विकास मशीन लर्निंग में एक व्यापक क्रांति का हिस्सा था, जो बेहतर एल्गोरिदम, अधिक शक्तिशाली कंप्यूटर और बढ़े हुए डिजिटलीकृत डेटा द्वारा संचालित था। 2017 में पेश किया गया ट्रांसफॉर्मर आर्किटेक्चर, प्राकृतिक भाषा प्रसंस्करण (NLP) प्रणालियों के लिए एक प्रमुख आधार बन गया। OpenAI शोधकर्ताओं ने 11 जून, 2018 को एक पेपर प्रकाशित किया, जिसमें पहला जनरेटिव प्री-ट्रेंड ट्रांसफॉर्मर (GPT-1) पेश किया गया, जो एक प्रकार का जनरेटिव बड़ा भाषा मॉडल है जो बड़े टेक्स्ट कॉर्पस पर पूर्व-प्रशिक्षित होता है और विशिष्ट कार्यों के लिए फाइन-ट्यून किया जाता है। GPT-2, फरवरी 2019 में जारी, GPT-1 को 1.5 बिलियन पैरामीटर के साथ बढ़ाया गया और 8 मिलियन वेब पेजों पर प्रशिक्षित किया गया। फरवरी 2020 में, Microsoft ने 17 बिलियन पैरामीटर के साथ ट्यूरिंग नेचुरल लैंग्वेज जनरेशन (T-NLG) पेश किया, जो उस समय का सबसे बड़ा भाषा मॉडल था।
प्रशिक्षण और क्षमताएँ
28 मई, 2020 को, 31 OpenAI इंजीनियरों और शोधकर्ताओं द्वारा एक arXiv प्रीप्रिंट ने GPT-3 का वर्णन किया, जो तीसरी पीढ़ी का अत्याधुनिक भाषा मॉडल है। GPT-3 की क्षमता GPT-2 से दो से अधिक परिमाण के क्रम से बढ़ाई गई थी, जिससे यह उस समय का सबसे बड़ा गैर-स्पार्स भाषा मॉडल बन गया। इसकी सटीकता को इसकी बढ़ी हुई क्षमता और पैरामीटरों की संख्या के लिए जिम्मेदार ठहराया जाता है, जो Microsoft के ट्यूरिंग NLG से दस गुना बड़ा है। Lambdalabs ने एक काल्पनिक प्रशिक्षण लागत का अनुमान लगाया, लगभग $4.6 मिलियन और एकल GPU पर 355 वर्ष, समानांतर GPU का उपयोग करके वास्तविक समय कम होता है।
प्री-ट्रेनिंग डेटासेट में 60% फ़िल्टर किया गया कॉमन क्रॉल (410 बिलियन बाइट-पेयर-एन्कोडेड टोकन), 22% WebText2 (19 बिलियन टोकन), 8% Books1 (12 बिलियन टोकन), 8% Books2 (55 बिलियन टोकन), और 3% विकिपीडिया (3 बिलियन टोकन) शामिल थे। फ़ज़ी डिडुप्लिकेशन के लिए Apache Spark के MinHashLSH का उपयोग किया गया। GPT-3 को सैकड़ों अरबों शब्दों पर प्रशिक्षित किया गया था और यह CSS, JSX और Python में कोड कर सकता था।
चूंकि प्रशिक्षण डेटा सर्वव्यापी था, GPT-3 को विभिन्न कार्यों के लिए आगे प्रशिक्षण की आवश्यकता नहीं थी। हालांकि, यह कभी-कभी अपने प्रशिक्षण डेटा की नकल करने के कारण विषाक्त भाषा उत्पन्न करता था। वाशिंगटन विश्वविद्यालय के एक अध्ययन में पाया गया कि GPT-3 की विषाक्तता GPT-2 और CTRL के बराबर थी। OpenAI ने विषाक्त आउटपुट को सीमित करने के लिए रणनीतियाँ लागू कीं, जिसके परिणामस्वरूप GPT-1 से कम विषाक्तता लेकिन CTRL Wiki से अधिक थी।
11 जून, 2020 को, OpenAI ने अपने GPT-3 API तक पहुंच की घोषणा की, जो किसी भी अंग्रेजी भाषा के कार्य के लिए टेक्स्ट-इन, टेक्स्ट-आउट इंटरफ़ेस के साथ एक मशीन लर्निंग टूलसेट है। शुरुआती उपयोगकर्ताओं ने इसे सुसंगत टेक्स्ट लिखने में "डरावना रूप से अच्छा" पाया। एक प्रयोग में, 80 अमेरिकी विषयों ने छोटे लेखों को मानव या GPT-3-लिखित के रूप में आंका, केवल 52% समय सही ढंग से पहचाना, जो यादृच्छिक से थोड़ा बेहतर था। 18 नवंबर, 2021 को, OpenAI ने सामग्री मॉडरेशन टूल के साथ API एक्सेस को प्रतिबंधित कर दिया। 27 जनवरी, 2022 को, InstructGPT मॉडल डिफ़ॉल्ट बन गए, जो कम निर्मित तथ्यों और कम विषाक्तता के साथ बेहतर संरेखित सामग्री उत्पन्न करते हैं।
GPT-3 की मानव-लिखित लेखों से अप्रभेद्य समाचार लेख उत्पन्न करने की क्षमता में लाभकारी और हानिकारक दोनों अनुप्रयोगों की क्षमता है, जिसमें गलत सूचना, स्पैम, फ़िशिंग और कानूनी प्रक्रियाओं का दुरुपयोग शामिल है, जैसा कि 28 मई, 2020 के पेपर में विस्तृत है।
वाणिज्यिक लाइसेंसिंग
22 सितंबर, 2020 को, Microsoft ने घोषणा की कि उसने GPT-3 को विशेष रूप से लाइसेंस दिया है। जबकि अन्य लोग अभी भी सार्वजनिक API का उपयोग कर सकते थे, केवल Microsoft के पास अंतर्निहित मॉडल तक पहुंच थी। यह विशेष लाइसेंसिंग OpenAI के साथ Microsoft की व्यापक साझेदारी का हिस्सा थी, जिसमें निवेश और Azure सेवाओं में एकीकरण शामिल था।
प्रभाव और विरासत
GPT-3 ने कृत्रिम बुद्धिमत्ता के क्षेत्र को महत्वपूर्ण रूप से प्रभावित किया, ट्रांसफॉर्मर मॉडल को स्केल करने की शक्ति का प्रदर्शन किया। इसकी फ्यू-शॉट सीखने की क्षमताओं ने कार्य-विशिष्ट फाइन-ट्यूनिंग की आवश्यकता को कम कर दिया, जिससे InstructGPT और बाद में GPT-4 जैसे बाद के मॉडल प्रेरित हुए। रिलीज़ ने बड़े भाषा मॉडल के नैतिक निहितार्थों के बारे में चर्चाएँ भी शुरू कीं, जिसमें पूर्वाग्रह, गलत सूचना और पहुंच नियंत्रण शामिल हैं।
GPT-3 का आर्किटेक्चर और प्रशिक्षण दृष्टिकोण बाद के बड़े भाषा मॉडलों के लिए एक बेंचमार्क बन गया, जिसमें Anthropic और Google DeepMind के मॉडल शामिल हैं। API और Microsoft लाइसेंसिंग के माध्यम से इसकी वाणिज्यिक सफलता ने AI अनुसंधान के लिए एक व्यवसाय मॉडल स्थापित किया, जिसने व्यापक जनरेटिव AI परिदृश्य को प्रभावित किया।
तकनीकी विवरण
GPT-3 मल्टी-हेड अटेंशन और पोजीशनल एन्कोडिंग के साथ एक ट्रांसफॉर्मर आर्किटेक्चर का उपयोग करता है। यह एन्कोडर-डिकोडर मॉडल के विपरीत, डिकोडर-ओनली डिज़ाइन का उपयोग करता है, और लेयर नॉर्मलाइज़ेशन और रेज़िड्यूअल नेटवर्क जैसी तकनीकों का उपयोग करता है। प्रशिक्षण में Adam जैसे ऑप्टिमाइज़र और लर्निंग रेट शेड्यूल के साथ ग्रेडिएंट डिसेंट शामिल था। मॉडल के पैरामीटर 16-बिट परिशुद्धता के साथ संग्रहीत होते हैं, जिससे मेमोरी आवश्यकताएँ कम हो जाती हैं।
GPT-3 की 2,048 टोकन की संदर्भ विंडो इनपुट की लंबाई को सीमित करती है जिसे यह संसाधित कर सकता है, लेकिन यह कई पैराग्राफों में सुसंगत टेक्स्ट उत्पन्न कर सकता है। इसकी फ्यू-शॉट लर्निंग प्रॉम्प्टिंग के माध्यम से प्राप्त की जाती है, जहाँ उदाहरण इनपुट में प्रदान किए जाते हैं, बिना मॉडल वेट अपडेट किए। यह क्षमता एक प्रमुख नवाचार थी, जिसने फाइन-ट्यूनिंग के बिना व्यापक प्रयोज्यता को सक्षम किया।
स्वागत और चिंताएँ
GPT-3 ने अपने प्रभावशाली टेक्स्ट जनरेशन के लिए व्यापक ध्यान आकर्षित किया, लेकिन संभावित दुरुपयोग के बारे में भी चिंताएँ उठाईं। शोधकर्ताओं ने नकली समाचार, स्पैम और फ़िशिंग सामग्री उत्पन्न करने जैसे जोखिमों पर प्रकाश डाला। OpenAI के शुरुआती प्रतिबंधित एक्सेस और बाद के सामग्री मॉडरेशन टूल का उद्देश्य इन जोखिमों को कम करना था। सुधारों के बावजूद, विषाक्त भाषा उत्पन्न करने की मॉडल की प्रवृत्ति एक चिंता बनी रही, जिससे AI सुरक्षा और संरेखण में चल रहे अनुसंधान हुए।
Microsoft को विशेष लाइसेंसिंग विवादास्पद थी, क्योंकि इसने अन्य शोधकर्ताओं और कंपनियों के लिए अंतर्निहित मॉडल तक पहुंच सीमित कर दी थी। हालांकि, सार्वजनिक API ने व्यापक प्रयोग की अनुमति दी, जिससे भाषा मॉडल अनुप्रयोगों के तेजी से विकास में योगदान मिला।
GPT-3 की रिलीज़ ने कृत्रिम बुद्धिमत्ता में एक मील का पत्थर चिह्नित किया, बड़े पैमाने पर ट्रांसफॉर्मर मॉडल की क्षमता का प्रदर्शन किया और मशीन लर्निंग और डीप लर्निंग के भविष्य को आकार दिया। इसका प्रभाव बाद के मॉडलों और बढ़ते जनरेटिव AI क्षेत्र में देखा जाता है।