अंग्रेज़ी से अनुवादित

GPT-1, जून 2018 में OpenAI द्वारा पेश किया गया, पहला जनरेटिव प्री-ट्रेंड ट्रांसफॉर्मर था, जो ट्रांसफॉर्मर आर्किटेक्चर और अलेबल टेक्स्ट पर प्री-ट्रेनिंग का उपयोग करने वाला एक बड़ा भाषा मॉडल था, जो प्राकृतिक भाषा प्रसंस्करण में एक सफलता का प्रतीक था।

GPT-1, जिसे OpenAI ने 11 जून 2018 को जारी किया, पहला जनरेटिव प्री-ट्रेंड ट्रांसफॉर्मर (GPT) था, जो Transformer (architecture) आर्किटेक्चर पर आधारित बड़े भाषा मॉडल का एक प्रकार है। इसने एक अर्ध-पर्यवेक्षित दृष्टिकोण पेश किया जिसने अलेबल्ड टेक्स्ट पर जनरेटिव प्री-ट्रेनिंग को विशिष्ट भाषा कार्यों के लिए विभेदक फाइन-ट्यूनिंग के साथ जोड़ा, जिससे प्राकृतिक भाषा प्रसंस्करण और कृत्रिम बुद्धिमत्ता के क्षेत्र में महत्वपूर्ण प्रगति हुई।

पृष्ठभूमि

2010 के दशक के दौरान, बेहतर मशीन लर्निंग एल्गोरिदम, अधिक शक्तिशाली कंप्यूटर, और बढ़े हुए डिजिटलीकृत डेटा द्वारा संचालित एक एआई उछाल ने एआई में तेजी से प्रगति को सक्षम किया। जनरेटिव प्री-ट्रेनिंग, स्व-पर्यवेक्षित शिक्षण का एक रूप, मशीन लर्निंग में लंबे समय से स्थापित था: एक मॉडल को पहले एक बड़े अलेबल्ड डेटासेट पर डेटा उत्पन्न करना सीखने के लिए प्रशिक्षित किया जाता है, फिर लेबल किए गए डेटा के साथ एक विशिष्ट कार्य के लिए अनुकूलित किया जाता है। ट्रांसफॉर्मर आर्किटेक्चर, जिसे Google शोधकर्ताओं ने 2017 के पेपर "Attention Is All You Need" में पेश किया, ने पुराने आवर्ती तंत्रिका नेटवर्क के प्रदर्शन मुद्दों को हल किया, जिसमें एक ध्यान तंत्र का उपयोग करके पूरे अनुक्रमों को एक साथ संसाधित किया गया, जिससे बहुत बड़े और अधिक परिष्कृत मॉडल की अनुमति मिली।

इतिहास

11 जून 2018 को, OpenAI ने पेपर "Improving Language Understanding by Generative Pre-Training" प्रकाशित किया, जिसमें GPT-1 पेश किया गया। यह केवल डिकोडर भाग का उपयोग करने वाला एक ट्रांसफॉर्मर-आधारित मॉडल था, जिसे BookCorpus पर प्री-ट्रेंड किया गया था, जो एक विविध टेक्स्ट कॉर्पस है, ताकि अगले टोकन की भविष्यवाणी की जा सके, इसके बाद विशिष्ट कार्यों के लिए विभेदक फाइन-ट्यूनिंग की गई। यह अर्ध-पर्यवेक्षित दृष्टिकोण एक सफलता थी, क्योंकि पिछले सर्वश्रेष्ठ प्रदर्शन करने वाले तंत्रिका मॉडल मैन्युअल रूप से लेबल किए गए डेटा से महंगी पर्यवेक्षित शिक्षा पर निर्भर थे। 14 फरवरी 2019 को, OpenAI ने GPT-2 जारी किया, जो 1.5 बिलियन पैरामीटर और 8 मिलियन वेब पेजों के 40-गीगाबाइट डेटासेट के साथ एक सीधा स्केल-अप था, जिसे शुरू में दुरुपयोग की चिंताओं के कारण चरणबद्ध किया गया था। 10 फरवरी 2020 को, Microsoft ने 17 बिलियन पैरामीटर के साथ Turing Natural Language Generation पेश किया, जिसमें दावा किया गया कि यह उस समय का सबसे बड़ा भाषा मॉडल था। 28 मई 2020 को, OpenAI ने 175 बिलियन पैरामीटर के साथ GPT-3 जारी किया, जिसने फ्यू-शॉट और जीरो-शॉट लर्निंग को आगे बढ़ाया। GPT-3 के बाद, OpenAI ने InstructGPT बनाने के लिए मानव प्रतिक्रिया से सुदृढीकरण सीखने का उपयोग किया, जिससे ChatGPT बना, जो 30 नवंबर 2022 को GPT-3.5 और बाद में GPT-4 (14 मार्च 2023 को जारी) पर आधारित लॉन्च किया गया। ChatGPT की लोकप्रियता ने Google के PaLM और Gemini, Meta AI के Llama, और अन्य जैसे प्रतिस्पर्धियों को प्रेरित किया।

फाउंडेशन मॉडल

एक फाउंडेशन मॉडल एक एआई मॉडल है जिसे बड़े पैमाने पर व्यापक डेटा पर प्रशिक्षित किया जाता है, जो कई डाउनस्ट्रीम कार्यों के लिए अनुकूलनीय होता है। मौलिक GPTs टेक्स्ट से परे मोडैलिटी का उपयोग कर सकते हैं, जैसे छवियां और ऑडियो। कुछ जनरेटिव ट्रांसफॉर्मर-आधारित मॉडल टेक्स्ट-से-इमेज तकनीकों के लिए उपयोग किए जाते हैं, जिनमें डिफ्यूजन और समानांतर डिकोडिंग शामिल हैं, जो छवि-प्रसंस्करण प्रणालियों को विकसित करने के लिए दृश्य फाउंडेशन मॉडल के रूप में कार्य करते हैं।

कुशल ट्रांसफॉर्मर आर्किटेक्चर

ट्रांसफॉर्मर मॉडल की कम्प्यूटेशनल और मेमोरी आवश्यकताएं आकार और इनपुट लंबाई के साथ काफी बढ़ जाती हैं, क्योंकि मानक स्व-ध्यान में द्विघात जटिलता होती है। शोधकर्ताओं ने लागत कम करने और लंबे संदर्भ विंडो का समर्थन करने के लिए स्पार्स अटेंशन तंत्र और मेमोरी-कुशल आर्किटेक्चर जैसे दक्षता सुधार प्रस्तावित किए। BigBird, Reformer, और FlashAttention जैसे मॉडल संरचित ध्यान पैटर्न या अनुकूलित गणना प्रदर्शित करते हैं, जिससे बड़े भाषा मॉडल लंबे अनुक्रमों को कुशलता से संसाधित कर सकते हैं।

प्रभाव

GPT-1 की शुरूआत ने बाद के GPT मॉडल के लिए नींव स्थापित की और जनरेटिव एआई के व्यापक विकास को प्रभावित किया। इसके अर्ध-पर्यवेक्षित दृष्टिकोण ने लेबल किए गए डेटा पर निर्भरता कम की, जिससे विशाल अलेबल्ड कॉर्पोरा पर प्रशिक्षण सक्षम हुआ। GPT-1 और इसके उत्तराधिकारियों की सफलता ने विभिन्न अनुप्रयोगों में ट्रांसफॉर्मर-आधारित मॉडल के व्यापक रूप से अपनाने का नेतृत्व किया, चैटबॉट से लेकर सामग्री निर्माण तक, और मॉडल स्केलिंग, संरेखण और दक्षता में अनुसंधान को प्रेरित किया।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:artificial-intelligence·machine-learning·natural-language-processing·openai
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास