अंग्रेज़ी से अनुवादित

GPT-3 एक बड़ा भाषा मॉडल है जिसे OpenAI ने 2020 में जारी किया था, जिसमें 175 बिलियन पैरामीटर हैं, जो मजबूत फ्यू-शॉट लर्निंग और व्यापक टेक्स्ट जनरेशन क्षमताओं के लिए जाना जाता है।

जनरेटिव प्री-ट्रेंड ट्रांसफॉर्मर 3 (GPT-3) एक Large language model है जिसे OpenAI द्वारा 2020 में कंपनी की GPT श्रृंखला के भाग के रूप में जारी किया गया था। यह एक डिकोडर-ओनली Transformer (architecture) मॉडल है जो Deep learning तंत्रिका नेटवर्क वास्तुकला पर आधारित है, जो पुनरावृत्ति और कन्वोल्यूशन-आधारित डिज़ाइनों को एक ध्यान तंत्र के साथ प्रतिस्थापित करता है जो मॉडल को इनपुट पाठ के प्रासंगिक खंडों पर चुनिंदा रूप से ध्यान केंद्रित करने की अनुमति देता है। GPT-3 में 175 बिलियन पैरामीटर हैं, प्रत्येक 16-बिट परिशुद्धता के साथ संग्रहीत है, जिसके लिए 350GB भंडारण की आवश्यकता होती है, और 2,048 टोकन की एक संदर्भ विंडो होती है। इसने कई कार्यों में मजबूत शून्य-शॉट और कुछ-शॉट सीखने की क्षमताओं का प्रदर्शन किया।

22 सितंबर, 2020 को, माइक्रोसॉफ्ट ने घोषणा की कि उसने GPT-3 को विशेष रूप से लाइसेंस दिया है। अन्य लोग अभी भी इसकी सार्वजनिक API से आउटपुट प्राप्त कर सकते थे, लेकिन केवल माइक्रोसॉफ्ट के पास अंतर्निहित मॉडल तक पहुंच थी।

पृष्ठभूमि

एल्गोरिदम में सुधार, अधिक शक्तिशाली कंप्यूटर, और बढ़ी हुई डिजिटल सामग्री ने 2010 के दशक के दौरान Machine learning में एक क्रांति को बढ़ावा दिया, जिससे भाषा हेरफेर सहित कार्यों में तेजी से सुधार हुआ। सॉफ्टवेयर मॉडल को मस्तिष्क की तंत्रिका वास्तुकला पर ढीले ढंग से आधारित संरचनाओं में हजारों या लाखों उदाहरणों का उपयोग करके प्रशिक्षित किया जाता है। प्राकृतिक भाषा प्रसंस्करण में उपयोग की जाने वाली एक वास्तुकला ट्रांसफॉर्मर वास्तुकला पर आधारित एक तंत्रिका नेटवर्क है, जिसे 2017 में पेश किया गया था। इसने पाठ्य इनपुट को संसाधित करने, खनन करने, व्यवस्थित करने, जोड़ने और तुलना करने के साथ-साथ प्रश्नों का उत्तर देने में सक्षम प्रणालियों को सक्षम किया।

11 जून, 2018 को, OpenAI शोधकर्ताओं ने एक पेपर प्रकाशित किया जिसमें पहले जनरेटिव प्री-ट्रेंड ट्रांसफॉर्मर (GPT) की शुरुआत की गई, जो एक प्रकार का जनरेटिव बड़ा भाषा मॉडल है जो विशाल और विविध पाठ कोष पर पूर्व-प्रशिक्षित है, इसके बाद विशिष्ट कार्यों के लिए विभेदक फाइन-ट्यूनिंग की जाती है। पहले, सर्वश्रेष्ठ प्रदर्शन करने वाले तंत्रिका एनएलपी मॉडल आमतौर पर मैन्युअल रूप से लेबल किए गए डेटा की बड़ी मात्रा से पर्यवेक्षित शिक्षा का उपयोग करते थे, जो महंगा और समय लेने वाला था। पहले GPT मॉडल के बाद फरवरी 2019 में GPT-2 आया, जो 8 मिलियन वेब पेजों पर प्रशिक्षित 1.5 बिलियन पैरामीटर के साथ एक सीधा स्केल-अप था। फरवरी 2020 में, माइक्रोसॉफ्ट ने ट्यूरिंग नेचुरल लैंग्वेज जनरेशन (T-NLG) पेश किया, जिसे 17 बिलियन पैरामीटर के साथ सबसे बड़ा भाषा मॉडल होने का दावा किया गया।

प्रशिक्षण और क्षमताएं

28 मई, 2020 को, OpenAI के 31 इंजीनियरों और शोधकर्ताओं द्वारा एक arXiv प्रीप्रिंट ने GPT-3 का वर्णन किया, जो एक तीसरी पीढ़ी का अत्याधुनिक भाषा मॉडल है। टीम ने GPT-2 से क्षमता में दो से अधिक परिमाण के क्रम से वृद्धि की, जिससे GPT-3 उस समय का सबसे बड़ा गैर-विरल भाषा मॉडल बन गया। इसकी अधिक सटीकता को बढ़ी हुई क्षमता और मापदंडों के लिए जिम्मेदार ठहराया गया है, जो माइक्रोसॉफ्ट के ट्यूरिंग एनएलजी से दस गुना बड़ा है। लैम्ब्डाब्लैब्स ने 2020 में एक एकल GPU पर GPT-3 को प्रशिक्षित करने के लिए लगभग $4.6 मिलियन और 355 वर्षों की काल्पनिक लागत का अनुमान लगाया, जिसमें समानांतर GPU का उपयोग करके वास्तविक प्रशिक्षण समय कम था।

भारित प्री-ट्रेनिंग डेटासेट का साठ प्रतिशत कॉमन क्रॉल के एक फ़िल्टर किए गए संस्करण से आया था जिसमें 410 बिलियन बाइट-पेयर-एन्कोडेड टोकन शामिल थे। फजी डिडुप्लिकेशन ने अपाचे स्पार्क के MinHashLSH का उपयोग किया। अन्य स्रोतों में WebText2 से 19 बिलियन टोकन (कुल का 22%), Books1 से 12 बिलियन टोकन (8%), Books2 से 55 बिलियन टोकन (8%), और विकिपीडिया से 3 बिलियन टोकन (3%) शामिल थे। GPT-3 को सैकड़ों अरबों शब्दों पर प्रशिक्षित किया गया था और यह CSS, JSX और Python में कोड भी कर सकता था।

चूंकि प्रशिक्षण डेटा सर्वव्यापी था, GPT-3 को विभिन्न भाषा कार्यों के लिए आगे प्रशिक्षण की आवश्यकता नहीं थी। प्रशिक्षण डेटा में कभी-कभी विषाक्त भाषा होती थी, और GPT-3 कभी-कभी इसकी नकल करके विषाक्त भाषा उत्पन्न करता था। वाशिंगटन विश्वविद्यालय के एक अध्ययन में पाया गया कि GPT-3 ने GPT-2 और CTRL के बराबर स्तर पर विषाक्त भाषा उत्पन्न की। OpenAI ने विषाक्त आउटपुट को सीमित करने के लिए रणनीतियों को लागू किया, जिसके परिणामस्वरूप GPT-1 की तुलना में कम विषाक्त भाषा हुई, हालांकि CTRL विकी की तुलना में अधिक पीढ़ी और उच्च विषाक्तता थी, जो पूरी तरह से विकिपीडिया डेटा पर प्रशिक्षित एक मॉडल है।

सार्वजनिक पहुंच और विकास

11 जून, 2020 को, OpenAI ने घोषणा की कि उपयोगकर्ता प्रौद्य्योगिकी की ताकत और सीमाओं का पता लगाने के लिए इसकी GPT-3 API, एक मशीन लर्निंग टूलसेट, तक पहुंच का अनुरोध कर सकते हैं। API में एक सामान्य-उद्देश्यीय टेक्स्ट-इन, टेक्स्ट-आउट इंटरफ़ेस था जो लगभग किसी भी अंग्रेजी भाषा के कार्य को पूरा कर सकता था। एक प्रारंभिक उपयोगकर्ता ने GPT-3 को सरल संकेतों के साथ सुसंगत पाठ लिखने में अजीब रूप से अच्छा बताया। एक प्रारंभिक प्रयोग में, 80 अमेरिकी विषयों ने छोटे लेखों को मानव-लिखित या GPT-3-जनरेटेड के रूप में आंका, केवल 52% समय की सही पहचान की, जो यादृच्छिक अनुमान से थोड़ा बेहतर था।

18 नवंबर, 2021 को, OpenAI ने घोषणा की कि API पहुंच को अप्रतिबंधित बनाने के लिए पर्याप्त सुरक्षा उपाय लागू किए गए हैं, जिससे डेवलपर्स को एक सामग्री मॉडरेशन उपकरण प्रदान किया गया। 27 जनवरी, 2022 को, OpenAI ने घोषणा की कि इसके नवीनतम GPT-3 मॉडल, सामूहिक रूप से InstructGPT के रूप में संदर्भित, API पर डिफ़ॉल्ट बन गए, जो उपयोगकर्ता के इरादों के साथ बेहतर संरेखित सामग्री का उत्पादन करते हैं, निर्देशों का बेहतर पालन करते हैं, कम निर्मित तथ्य उत्पन्न करते हैं, और कुछ हद तक कम विषाक्त सामग्री उत्पन्न करते हैं।

प्रभाव और चिंताएं

क्योंकि GPT-3 समाचार लेख उत्पन्न कर सकता था जिसे मानव मूल्यांकनकर्ता मानव-लिखित से अलग करने में कठिनाई महसूस करते थे, इसमें भाषा मॉडल के लाभकारी और हानिकारक दोनों अनुप्रयोगों को आगे बढ़ाने की क्षमता थी। 28 मई, 2020 के पेपर में, शोधकर्ताओं ने गलत सूचना, स्पैम, फ़िशिंग, कानूनी और सरकारी प्रक्रियाओं के दुरुपयोग, और धोखाधड़ी गतिविधियों सहित संभावित हानिकारक प्रभावों का वर्णन किया। मॉडल की व्यापक क्षमताओं ने Generative AI के सामाजिक निहितार्थों और जिम्मेदार तैनाती की आवश्यकता के बारे में चर्चाओं को बढ़ावा दिया।

विरासत

GPT-3 ने Artificial intelligence के विकास में एक महत्वपूर्ण मील का पत्थर चिह्नित किया, यह प्रदर्शित करते हुए कि ट्रांसफॉर्मर मॉडल को स्केल करने से भाषा समझ और पीढ़ी में नाटकीय सुधार हो सकते हैं। इसकी वास्तुकला और प्रशिक्षण दृष्टिकोण ने बाद के मॉडलों को प्रभावित किया, जिसमें OpenAI के भीतर उत्तराधिकारी और Anthropic और Google DeepMind जैसे अन्य संगठनों के प्रयास शामिल हैं। माइक्रोसॉफ्ट को विशेष लाइसेंसिंग ने बड़े भाषा मॉडल के व्यावसायिक मूल्य को उजागर किया और क्लाउड-कंप्यूटिंग सेवाओं के प्रतिस्पर्धी परिदृश्य को आकार दिया, जिसमें Microsoft Azure ने GPT-3 को अपनी पेशकशों में एकीकृत किया। GPT-3 ने बड़े मॉडलों के संरेखण, सुरक्षा और मूल्यांकन में अनुसंधान को भी उत्प्रेरित किया, जो Neural network अनुसंधान के व्यापक क्षेत्र में योगदान देता है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:large-language-model·openai·generative-ai·machine-learning
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास