अंग्रेज़ी से अनुवादित

GPT-3 जून 2020 में OpenAI द्वारा जारी किया गया एक बड़ा भाषा मॉडल है, जिसमें 175 बिलियन पैरामीटर हैं, और यह अपनी शून्य-शॉट और कुछ-शॉट क्षमताओं के लिए जाना जाता है। इसके API लॉन्च ने व्यापक पहुंच को सक्षम किया, और बाद में Microsoft ने मॉडल को विशेष रूप से लाइसेंस दिया।

जनरेटिव प्री-ट्रेंड ट्रांसफॉर्मर 3 (GPT-3) एक बड़ा भाषा मॉडल है जिसे OpenAI ने 2020 में कंपनी की GPT श्रृंखला के मॉडलों के भाग के रूप में जारी किया था। यह एक डिकोडर-ओनली ट्रांसफॉर्मर मॉडल है जो गहरे तंत्रिका नेटवर्क पर आधारित है, जो प्रासंगिक इनपुट खंडों पर चयनात्मक रूप से ध्यान केंद्रित करने के लिए एक ध्यान तंत्र का उपयोग करता है। 175 बिलियन पैरामीटरों के साथ, प्रत्येक को 16-बिट परिशुद्धता में संग्रहीत किया गया है, GPT-3 को 350GB भंडारण की आवश्यकता होती है और यह 2,048 टोकनों की संदर्भ विंडो का समर्थन करता है। इसने कई कार्यों में मजबूत शून्य-शॉट और कुछ-शॉट सीखने का प्रदर्शन किया, और इसकी रिलीज़ की घोषणा 11 जून, 2020 को एक API के माध्यम से की गई थी।

पृष्ठभूमि

द इकोनॉमिस्ट के अनुसार, बेहतर एल्गोरिदम, अधिक शक्तिशाली कंप्यूटर, और बढ़ता डिजिटलीकृत कॉर्पस मशीन लर्निंग में क्रांति को बढ़ावा देते हैं। 2010 के दशक में नई तकनीकों ने भाषा हेरफेर में तेजी से सुधार लाया, जो मस्तिष्क पर आधारित ढीले तंत्रिका आर्किटेक्चर पर निर्भर था। 2017 में पेश किया गया ट्रांसफॉर्मर आर्किटेक्चर, प्राकृतिक भाषा प्रसंस्करण प्रणालियों के लिए आधारभूत बन गया। जून 2018 में, OpenAI ने पहला जनरेटिव प्री-ट्रेंड ट्रांसफॉर्मर (GPT-1) प्रकाशित किया, जो एक बड़े पाठ कॉर्पस पर प्रशिक्षित और फिर विशिष्ट कार्यों के लिए ठीक-ट्यून किया गया मॉडल था। GPT-2 फरवरी 2019 में आया, जिसमें पैरामीटर और डेटासेट का आकार दस गुना बढ़ाया गया, जो 8 मिलियन वेब पेजों पर प्रशिक्षित 1.5 बिलियन पैरामीटरों तक पहुंच गया। फरवरी 2020 में, Microsoft ने ट्यूरिंग एनएलजी पेश किया, जो 17-बिलियन-पैरामीटर मॉडल था, जिसे उस समय सबसे बड़ा माना गया।

प्रशिक्षण और क्षमताएं

28 मई, 2020 को, 31 OpenAI इंजीनियरों और शोधकर्ताओं द्वारा एक arXiv प्रीप्रिंट ने GPT-3 के विकास का वर्णन किया, जिसमें मॉडल क्षमता को GPT-2 से दो से अधिक परिमाण के क्रम से बढ़ाया गया, जिससे यह उस अवधि का सबसे बड़ा गैर-विरल भाषा मॉडल बन गया। इसकी सटीकता बढ़ी हुई क्षमता और पैरामीटरों से उपजी थी, जो Microsoft के ट्यूरिंग एनएलजी से दस गुना बड़ी थी। Lambdalabs ने 2020 में प्रशिक्षण लागत $4.6 मिलियन और एकल GPU पर 355 वर्षों का अनुमान लगाया। पूर्व-प्रशिक्षण डेटा में फ़िल्टर किए गए Common Crawl (भारित डेटा का 60%) के 410 बिलियन बाइट-पेयर एन्कोडेड टोकन शामिल थे, साथ ही WebText2, Books1, Books2, और विकिपीडिया (3%) भी शामिल थे। GPT-3 पायथन, JSX, और CSS में कोड भी लिख सकता था।

GPT-3 में कार्य-विशिष्ट फाइन-ट्यूनिंग की कमी थी, इसके बजाय यह व्यापक निर्देशों को संभालता था। हालाँकि, प्रशिक्षण डेटा में विषाक्त भाषा शामिल थी जिसे मॉडल कभी-कभी पुन: उत्पन्न कर सकता था। वाशिंगटन विश्वविद्यालय के एक अध्ययन में पाया गया कि GPT-3 की विषाक्तता GPT-2 और CTRL के बराबर थी। OpenAI ने शमन रणनीतियों को लागू किया, जिससे GPT-1 की तुलना में विषाक्त आउटपुट कम हो गए।

API पहुंच और मूल्यांकन

11 जून, 2020 को, OpenAI ने एक सामान्य-उद्देश्य API जारी किया जिसमें टेक्स्ट-इन टेक्स्ट-आउट इंटरफ़ेस था, जो एकल-उपयोग मामलों के बजाय किसी भी अंग्रेजी भाषा के कार्य को सक्षम बनाता था। प्रारंभिक परीक्षकों ने GPT-3 को सुसंगत पाठ उत्पादन में अजीब रूप से अच्छा बताया। 80 अमेरिकी प्रतिभागियों के एक प्रयोग में, केवल 52% सही दर ने GPT-3 लेखों को मानव-लेखित लेखों से अलग किया, जो यादृच्छिक अनुमान से थोड़ा अधिक था। 18 नवंबर, 2021 तक, OpenAI ने सामग्री मॉडरेशन टूल के साथ अपने API तक पहुंच को व्यापक बनाया। 27 जनवरी, 2022 को, InstructGPT डिफ़ॉल्ट API मॉडल बन गया, जिसने निर्देशों का पालन करने में सुधार किया और निर्मित तथ्यों को कम किया।

लाइसेंसिंग और प्रभाव

22 सितंबर, 2020 को, Microsoft ने GPT-3 के अंतर्निहित मॉडल के लिए एक विशेष लाइसेंस की घोषणा की। अन्य लोग सार्वजनिक API का उपयोग कर सकते थे, लेकिन केवल Microsoft ही कोड और वज़न तक पहुंच सकता था। GPT-3 ने समाचार लेख उत्पन्न करने की क्षमता प्रदर्शित की जिन्हें मानव लेखन से अलग करना कठिन था, जिससे गलत सूचना और धोखाधड़ी के बारे में चिंताएं पैदा हुईं। शोधकर्ताओं ने स्पैम और कानूनी दुरुपयोग सहित संभावित हानिकारक प्रभावों का वर्णन किया।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:openai·large-language-model·generative-ai·natural-language-processing
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास