जनरेटिव प्री-ट्रेंड ट्रांसफॉर्मर 3 (GPT-3) एक बड़ा भाषा मॉडल है जिसे OpenAI ने 2020 में कंपनी की GPT श्रृंखला के मॉडलों के भाग के रूप में जारी किया था। यह एक डिकोडर-ओनली ट्रांसफॉर्मर मॉडल है जो गहरे तंत्रिका नेटवर्क पर आधारित है, जो प्रासंगिक इनपुट खंडों पर चयनात्मक रूप से ध्यान केंद्रित करने के लिए एक ध्यान तंत्र का उपयोग करता है। 175 बिलियन पैरामीटरों के साथ, प्रत्येक को 16-बिट परिशुद्धता में संग्रहीत किया गया है, GPT-3 को 350GB भंडारण की आवश्यकता होती है और यह 2,048 टोकनों की संदर्भ विंडो का समर्थन करता है। इसने कई कार्यों में मजबूत शून्य-शॉट और कुछ-शॉट सीखने का प्रदर्शन किया, और इसकी रिलीज़ की घोषणा 11 जून, 2020 को एक API के माध्यम से की गई थी।
पृष्ठभूमि
द इकोनॉमिस्ट के अनुसार, बेहतर एल्गोरिदम, अधिक शक्तिशाली कंप्यूटर, और बढ़ता डिजिटलीकृत कॉर्पस मशीन लर्निंग में क्रांति को बढ़ावा देते हैं। 2010 के दशक में नई तकनीकों ने भाषा हेरफेर में तेजी से सुधार लाया, जो मस्तिष्क पर आधारित ढीले तंत्रिका आर्किटेक्चर पर निर्भर था। 2017 में पेश किया गया ट्रांसफॉर्मर आर्किटेक्चर, प्राकृतिक भाषा प्रसंस्करण प्रणालियों के लिए आधारभूत बन गया। जून 2018 में, OpenAI ने पहला जनरेटिव प्री-ट्रेंड ट्रांसफॉर्मर (GPT-1) प्रकाशित किया, जो एक बड़े पाठ कॉर्पस पर प्रशिक्षित और फिर विशिष्ट कार्यों के लिए ठीक-ट्यून किया गया मॉडल था। GPT-2 फरवरी 2019 में आया, जिसमें पैरामीटर और डेटासेट का आकार दस गुना बढ़ाया गया, जो 8 मिलियन वेब पेजों पर प्रशिक्षित 1.5 बिलियन पैरामीटरों तक पहुंच गया। फरवरी 2020 में, Microsoft ने ट्यूरिंग एनएलजी पेश किया, जो 17-बिलियन-पैरामीटर मॉडल था, जिसे उस समय सबसे बड़ा माना गया।
प्रशिक्षण और क्षमताएं
28 मई, 2020 को, 31 OpenAI इंजीनियरों और शोधकर्ताओं द्वारा एक arXiv प्रीप्रिंट ने GPT-3 के विकास का वर्णन किया, जिसमें मॉडल क्षमता को GPT-2 से दो से अधिक परिमाण के क्रम से बढ़ाया गया, जिससे यह उस अवधि का सबसे बड़ा गैर-विरल भाषा मॉडल बन गया। इसकी सटीकता बढ़ी हुई क्षमता और पैरामीटरों से उपजी थी, जो Microsoft के ट्यूरिंग एनएलजी से दस गुना बड़ी थी। Lambdalabs ने 2020 में प्रशिक्षण लागत $4.6 मिलियन और एकल GPU पर 355 वर्षों का अनुमान लगाया। पूर्व-प्रशिक्षण डेटा में फ़िल्टर किए गए Common Crawl (भारित डेटा का 60%) के 410 बिलियन बाइट-पेयर एन्कोडेड टोकन शामिल थे, साथ ही WebText2, Books1, Books2, और विकिपीडिया (3%) भी शामिल थे। GPT-3 पायथन, JSX, और CSS में कोड भी लिख सकता था।
GPT-3 में कार्य-विशिष्ट फाइन-ट्यूनिंग की कमी थी, इसके बजाय यह व्यापक निर्देशों को संभालता था। हालाँकि, प्रशिक्षण डेटा में विषाक्त भाषा शामिल थी जिसे मॉडल कभी-कभी पुन: उत्पन्न कर सकता था। वाशिंगटन विश्वविद्यालय के एक अध्ययन में पाया गया कि GPT-3 की विषाक्तता GPT-2 और CTRL के बराबर थी। OpenAI ने शमन रणनीतियों को लागू किया, जिससे GPT-1 की तुलना में विषाक्त आउटपुट कम हो गए।
API पहुंच और मूल्यांकन
11 जून, 2020 को, OpenAI ने एक सामान्य-उद्देश्य API जारी किया जिसमें टेक्स्ट-इन टेक्स्ट-आउट इंटरफ़ेस था, जो एकल-उपयोग मामलों के बजाय किसी भी अंग्रेजी भाषा के कार्य को सक्षम बनाता था। प्रारंभिक परीक्षकों ने GPT-3 को सुसंगत पाठ उत्पादन में अजीब रूप से अच्छा बताया। 80 अमेरिकी प्रतिभागियों के एक प्रयोग में, केवल 52% सही दर ने GPT-3 लेखों को मानव-लेखित लेखों से अलग किया, जो यादृच्छिक अनुमान से थोड़ा अधिक था। 18 नवंबर, 2021 तक, OpenAI ने सामग्री मॉडरेशन टूल के साथ अपने API तक पहुंच को व्यापक बनाया। 27 जनवरी, 2022 को, InstructGPT डिफ़ॉल्ट API मॉडल बन गया, जिसने निर्देशों का पालन करने में सुधार किया और निर्मित तथ्यों को कम किया।
लाइसेंसिंग और प्रभाव
22 सितंबर, 2020 को, Microsoft ने GPT-3 के अंतर्निहित मॉडल के लिए एक विशेष लाइसेंस की घोषणा की। अन्य लोग सार्वजनिक API का उपयोग कर सकते थे, लेकिन केवल Microsoft ही कोड और वज़न तक पहुंच सकता था। GPT-3 ने समाचार लेख उत्पन्न करने की क्षमता प्रदर्शित की जिन्हें मानव लेखन से अलग करना कठिन था, जिससे गलत सूचना और धोखाधड़ी के बारे में चिंताएं पैदा हुईं। शोधकर्ताओं ने स्पैम और कानूनी दुरुपयोग सहित संभावित हानिकारक प्रभावों का वर्णन किया।