अंग्रेज़ी से अनुवादित

GPT-3 एक बड़ा भाषा मॉडल है जिसे OpenAI ने 2020 में जारी किया था, जिसमें 175 बिलियन पैरामीटर और मजबूत फ्यू-शॉट लर्निंग है, जो न्यूनतम प्रॉम्प्ट से टेक्स्ट जनरेशन और कार्य पूर्णता को सक्षम बनाता है।

जनरेटिव प्री-ट्रेंड ट्रांसफॉर्मर 3 (GPT-3) एक बड़ा भाषा मॉडल है जिसे OpenAI ने 2020 में कंपनी की GPT श्रृंखला के हिस्से के रूप में जारी किया था। यह एक डिकोडर-ओनली ट्रांसफॉर्मर मॉडल है जो गहरे तंत्रिका नेटवर्क पर आधारित है, जो पुनरावृत्ति और कनवल्शन-आधारित आर्किटेक्चर को एक ध्यान तंत्र के साथ प्रतिस्थापित करता है जो प्रासंगिक इनपुट टेक्स्ट पर चयनात्मक ध्यान केंद्रित करने की अनुमति देता है। GPT-3 में 175 बिलियन पैरामीटर हैं, प्रत्येक 16-बिट परिशुद्धता के साथ, जिसके लिए 350GB स्टोरेज की आवश्यकता होती है, और 2,048 टोकन की संदर्भ विंडो है, जो कई कार्यों पर मजबूत ज़ीरो-शॉट और फ्यू-शॉट सीखने की क्षमताओं का प्रदर्शन करता है।

पृष्ठभूमि

GPT-3 का विकास मशीन लर्निंग में एक व्यापक क्रांति का हिस्सा था, जो बेहतर एल्गोरिदम, अधिक शक्तिशाली कंप्यूटर और बढ़े हुए डिजिटलीकृत डेटा द्वारा संचालित था। 2017 में पेश किया गया ट्रांसफॉर्मर आर्किटेक्चर, प्राकृतिक भाषा प्रसंस्करण (NLP) प्रणालियों के लिए एक प्रमुख आधार बन गया। OpenAI शोधकर्ताओं ने 11 जून, 2018 को एक पेपर प्रकाशित किया, जिसमें पहला जनरेटिव प्री-ट्रेंड ट्रांसफॉर्मर (GPT-1) पेश किया गया, जो एक प्रकार का जनरेटिव बड़ा भाषा मॉडल है जो बड़े टेक्स्ट कॉर्पस पर पूर्व-प्रशिक्षित होता है और विशिष्ट कार्यों के लिए फाइन-ट्यून किया जाता है। GPT-2, फरवरी 2019 में जारी, GPT-1 को 1.5 बिलियन पैरामीटर के साथ बढ़ाया गया और 8 मिलियन वेब पेजों पर प्रशिक्षित किया गया। फरवरी 2020 में, Microsoft ने 17 बिलियन पैरामीटर के साथ ट्यूरिंग नेचुरल लैंग्वेज जनरेशन (T-NLG) पेश किया, जो उस समय का सबसे बड़ा भाषा मॉडल था।

प्रशिक्षण और क्षमताएँ

28 मई, 2020 को, 31 OpenAI इंजीनियरों और शोधकर्ताओं द्वारा एक arXiv प्रीप्रिंट ने GPT-3 का वर्णन किया, जो तीसरी पीढ़ी का अत्याधुनिक भाषा मॉडल है। GPT-3 की क्षमता GPT-2 से दो से अधिक परिमाण के क्रम से बढ़ाई गई थी, जिससे यह उस समय का सबसे बड़ा गैर-स्पार्स भाषा मॉडल बन गया। इसकी सटीकता को इसकी बढ़ी हुई क्षमता और पैरामीटरों की संख्या के लिए जिम्मेदार ठहराया जाता है, जो Microsoft के ट्यूरिंग NLG से दस गुना बड़ा है। Lambdalabs ने एक काल्पनिक प्रशिक्षण लागत का अनुमान लगाया, लगभग $4.6 मिलियन और एकल GPU पर 355 वर्ष, समानांतर GPU का उपयोग करके वास्तविक समय कम होता है।

प्री-ट्रेनिंग डेटासेट में 60% फ़िल्टर किया गया कॉमन क्रॉल (410 बिलियन बाइट-पेयर-एन्कोडेड टोकन), 22% WebText2 (19 बिलियन टोकन), 8% Books1 (12 बिलियन टोकन), 8% Books2 (55 बिलियन टोकन), और 3% विकिपीडिया (3 बिलियन टोकन) शामिल थे। फ़ज़ी डिडुप्लिकेशन के लिए Apache Spark के MinHashLSH का उपयोग किया गया। GPT-3 को सैकड़ों अरबों शब्दों पर प्रशिक्षित किया गया था और यह CSS, JSX और Python में कोड कर सकता था।

चूंकि प्रशिक्षण डेटा सर्वव्यापी था, GPT-3 को विभिन्न कार्यों के लिए आगे प्रशिक्षण की आवश्यकता नहीं थी। हालांकि, यह कभी-कभी अपने प्रशिक्षण डेटा की नकल करने के कारण विषाक्त भाषा उत्पन्न करता था। वाशिंगटन विश्वविद्यालय के एक अध्ययन में पाया गया कि GPT-3 की विषाक्तता GPT-2 और CTRL के बराबर थी। OpenAI ने विषाक्त आउटपुट को सीमित करने के लिए रणनीतियाँ लागू कीं, जिसके परिणामस्वरूप GPT-1 से कम विषाक्तता लेकिन CTRL Wiki से अधिक थी।

11 जून, 2020 को, OpenAI ने अपने GPT-3 API तक पहुंच की घोषणा की, जो किसी भी अंग्रेजी भाषा के कार्य के लिए टेक्स्ट-इन, टेक्स्ट-आउट इंटरफ़ेस के साथ एक मशीन लर्निंग टूलसेट है। शुरुआती उपयोगकर्ताओं ने इसे सुसंगत टेक्स्ट लिखने में "डरावना रूप से अच्छा" पाया। एक प्रयोग में, 80 अमेरिकी विषयों ने छोटे लेखों को मानव या GPT-3-लिखित के रूप में आंका, केवल 52% समय सही ढंग से पहचाना, जो यादृच्छिक से थोड़ा बेहतर था। 18 नवंबर, 2021 को, OpenAI ने सामग्री मॉडरेशन टूल के साथ API एक्सेस को प्रतिबंधित कर दिया। 27 जनवरी, 2022 को, InstructGPT मॉडल डिफ़ॉल्ट बन गए, जो कम निर्मित तथ्यों और कम विषाक्तता के साथ बेहतर संरेखित सामग्री उत्पन्न करते हैं।

GPT-3 की मानव-लिखित लेखों से अप्रभेद्य समाचार लेख उत्पन्न करने की क्षमता में लाभकारी और हानिकारक दोनों अनुप्रयोगों की क्षमता है, जिसमें गलत सूचना, स्पैम, फ़िशिंग और कानूनी प्रक्रियाओं का दुरुपयोग शामिल है, जैसा कि 28 मई, 2020 के पेपर में विस्तृत है।

वाणिज्यिक लाइसेंसिंग

22 सितंबर, 2020 को, Microsoft ने घोषणा की कि उसने GPT-3 को विशेष रूप से लाइसेंस दिया है। जबकि अन्य लोग अभी भी सार्वजनिक API का उपयोग कर सकते थे, केवल Microsoft के पास अंतर्निहित मॉडल तक पहुंच थी। यह विशेष लाइसेंसिंग OpenAI के साथ Microsoft की व्यापक साझेदारी का हिस्सा थी, जिसमें निवेश और Azure सेवाओं में एकीकरण शामिल था।

प्रभाव और विरासत

GPT-3 ने कृत्रिम बुद्धिमत्ता के क्षेत्र को महत्वपूर्ण रूप से प्रभावित किया, ट्रांसफॉर्मर मॉडल को स्केल करने की शक्ति का प्रदर्शन किया। इसकी फ्यू-शॉट सीखने की क्षमताओं ने कार्य-विशिष्ट फाइन-ट्यूनिंग की आवश्यकता को कम कर दिया, जिससे InstructGPT और बाद में GPT-4 जैसे बाद के मॉडल प्रेरित हुए। रिलीज़ ने बड़े भाषा मॉडल के नैतिक निहितार्थों के बारे में चर्चाएँ भी शुरू कीं, जिसमें पूर्वाग्रह, गलत सूचना और पहुंच नियंत्रण शामिल हैं।

GPT-3 का आर्किटेक्चर और प्रशिक्षण दृष्टिकोण बाद के बड़े भाषा मॉडलों के लिए एक बेंचमार्क बन गया, जिसमें Anthropic और Google DeepMind के मॉडल शामिल हैं। API और Microsoft लाइसेंसिंग के माध्यम से इसकी वाणिज्यिक सफलता ने AI अनुसंधान के लिए एक व्यवसाय मॉडल स्थापित किया, जिसने व्यापक जनरेटिव AI परिदृश्य को प्रभावित किया।

तकनीकी विवरण

GPT-3 मल्टी-हेड अटेंशन और पोजीशनल एन्कोडिंग के साथ एक ट्रांसफॉर्मर आर्किटेक्चर का उपयोग करता है। यह एन्कोडर-डिकोडर मॉडल के विपरीत, डिकोडर-ओनली डिज़ाइन का उपयोग करता है, और लेयर नॉर्मलाइज़ेशन और रेज़िड्यूअल नेटवर्क जैसी तकनीकों का उपयोग करता है। प्रशिक्षण में Adam जैसे ऑप्टिमाइज़र और लर्निंग रेट शेड्यूल के साथ ग्रेडिएंट डिसेंट शामिल था। मॉडल के पैरामीटर 16-बिट परिशुद्धता के साथ संग्रहीत होते हैं, जिससे मेमोरी आवश्यकताएँ कम हो जाती हैं।

GPT-3 की 2,048 टोकन की संदर्भ विंडो इनपुट की लंबाई को सीमित करती है जिसे यह संसाधित कर सकता है, लेकिन यह कई पैराग्राफों में सुसंगत टेक्स्ट उत्पन्न कर सकता है। इसकी फ्यू-शॉट लर्निंग प्रॉम्प्टिंग के माध्यम से प्राप्त की जाती है, जहाँ उदाहरण इनपुट में प्रदान किए जाते हैं, बिना मॉडल वेट अपडेट किए। यह क्षमता एक प्रमुख नवाचार थी, जिसने फाइन-ट्यूनिंग के बिना व्यापक प्रयोज्यता को सक्षम किया।

स्वागत और चिंताएँ

GPT-3 ने अपने प्रभावशाली टेक्स्ट जनरेशन के लिए व्यापक ध्यान आकर्षित किया, लेकिन संभावित दुरुपयोग के बारे में भी चिंताएँ उठाईं। शोधकर्ताओं ने नकली समाचार, स्पैम और फ़िशिंग सामग्री उत्पन्न करने जैसे जोखिमों पर प्रकाश डाला। OpenAI के शुरुआती प्रतिबंधित एक्सेस और बाद के सामग्री मॉडरेशन टूल का उद्देश्य इन जोखिमों को कम करना था। सुधारों के बावजूद, विषाक्त भाषा उत्पन्न करने की मॉडल की प्रवृत्ति एक चिंता बनी रही, जिससे AI सुरक्षा और संरेखण में चल रहे अनुसंधान हुए।

Microsoft को विशेष लाइसेंसिंग विवादास्पद थी, क्योंकि इसने अन्य शोधकर्ताओं और कंपनियों के लिए अंतर्निहित मॉडल तक पहुंच सीमित कर दी थी। हालांकि, सार्वजनिक API ने व्यापक प्रयोग की अनुमति दी, जिससे भाषा मॉडल अनुप्रयोगों के तेजी से विकास में योगदान मिला।

GPT-3 की रिलीज़ ने कृत्रिम बुद्धिमत्ता में एक मील का पत्थर चिह्नित किया, बड़े पैमाने पर ट्रांसफॉर्मर मॉडल की क्षमता का प्रदर्शन किया और मशीन लर्निंग और डीप लर्निंग के भविष्य को आकार दिया। इसका प्रभाव बाद के मॉडलों और बढ़ते जनरेटिव AI क्षेत्र में देखा जाता है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:artificial-intelligence·machine-learning·language-model·openai
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास