GPT-3 (जनरेटिव प्रीट्रेन्ड ट्रांसफॉर्मर 3) एक बड़ा भाषा मॉडल है जिसे ओपनएआई द्वारा विकसित किया गया था और मई 2020 के एक पेपर, "लैंग्वेज मॉडल्स आर फ्यू-शॉट लर्नर्स" में पेश किया गया था, जिसके बाद 2020 के शेष भाग में व्यापक API पहुंच प्रदान की गई। अपने पूर्ववर्ती जीपीटी-2 की तरह, GPT-3 ट्रांसफॉर्मर आर्किटेक्चर पर आधारित है और ऑटोरेग्रेसिव नेक्स्ट-टोकन उद्देश्य के साथ प्रशिक्षित है, लेकिन इसे नाटकीय रूप से 175 बिलियन पैरामीटर तक बढ़ाया गया है, जो GPT-2 के पूर्ण मॉडल से 100 गुना से अधिक बड़ा है, और इसे कॉमन क्रॉल, पुस्तकों और विकिपीडिया पाठ के मिश्रण पर प्रशिक्षित किया गया है।
फ्यू-शॉट लर्निंग
GPT-3 का केंद्रीय शोध योगदान यह प्रदर्शित करना था कि एक पर्याप्त रूप से बड़ा भाषा मॉडल, अपने प्रॉम्प्ट में केवल कुछ उदाहरणों के साथ, बिना किसी ग्रेडिएंट-आधारित फाइन-ट्यूनिंग के, अनुवाद, प्रश्न उत्तर, अंकगणित और सरल तर्क सहित कई प्रकार के कार्य कर सकता है। यह क्षमता, जिसे प्रमुख लेखक टॉम ब्राउन सहित ओपनएआई शोधकर्ताओं ने फ्यू-शॉट लर्निंग और अधिक सामान्यतः इन-कॉन्टेक्स्ट लर्निंग के रूप में वर्णित किया, ने सुझाव दिया कि अकेले पैमाना कार्य-विशिष्ट प्रशिक्षण का विकल्प हो सकता है, एक निष्कर्ष जिसने भाषा मॉडलिंग में स्केलिंग-नियमों के बारे में उभरती मान्यताओं को मजबूत किया और क्षेत्र में बाद के शोध प्राथमिकताओं को आकार दिया।
व्यावसायिक लॉन्च
GPT-3 के वजन को सार्वजनिक रूप से जारी करने के बजाय, जैसा कि इसने अंततः GPT-2 के साथ किया था, ओपनएआई ने GPT-3 को जून 2020 से विशेष रूप से एक भुगतान API के माध्यम से उपलब्ध कराया, शुरू में एक निजी बीटा के रूप में। इस निर्णय ने एक व्यावसायिक मॉडल स्थापित किया, जिसे बाद में उद्योग में व्यापक रूप से अपनाया गया, जिसमें सीमांत भाषा मॉडल को स्थानीय रूप से डाउनलोड और चलाने के बजाय एक मीटर्ड क्लाउड सेवा के रूप में एक्सेस किया जाता है, जो बाद के वर्षों में प्रतिस्पर्धियों द्वारा जारी ओपन-वेट मॉडल के विपरीत है। API ने तुरंत GPT-3 के शीर्ष पर उत्पाद बनाने वाले स्टार्टअप्स की एक लहर को आकर्षित किया, जिसमें शुरुआती AI लेखन सहायक, चैटबॉट और कोड-जनरेशन उपकरण शामिल थे, और माइक्रोसॉफ्ट ने ओपनएआई में अपने व्यापक निवेश के हिस्से के रूप में 2020 में GPT-3 के अंतर्निहित मॉडल वजन के लिए अलग से एक विशेष लाइसेंस प्राप्त किया।
प्रभाव और सीमाएं
GPT-3 को मुख्यधारा और प्रौद्योगिकी प्रेस में व्यापक रूप से इस बात के प्रमाण के रूप में कवर किया गया था कि भाषा मॉडल गुणात्मक रूप से नई क्षमताओं के करीब पहुंच रहे थे, और इसने सीधे आरएलएचएफ सहित तकनीकों के साथ प्रशिक्षित निर्देश-ट्यून किए गए वेरिएंट के विकास को सूचित किया, यह कार्य नवंबर 2022 में चैटजीपीटी की रिलीज़ में परिणत हुआ, जो GPT-3.5 वेरिएंट पर बनाया गया था। GPT-3 ने तथ्यात्मक रूप से गलत लेकिन धाराप्रवाह आउटपुट उत्पन्न करने की प्रवृत्ति के लिए भी महत्वपूर्ण आलोचना आकर्षित की, जो क्षेत्र में बाद में मतिभ्रम के रूप में जाना जाने वाला एक प्रारंभिक प्रमुख उदाहरण था, साथ ही इसके प्रशिक्षण डेटा में मौजूद पूर्वाग्रहों को पुन: उत्पन्न करने के लिए भी। इसका उत्तराधिकारी, जीपीटी-4, मार्च 2023 में मल्टीमॉडल इनपुट सहित काफी विस्तारित क्षमताओं के साथ जारी किया गया था।