अंग्रेज़ी से अनुवादित

Jurassic-1 बड़े भाषा मॉडलों का एक परिवार है, जिसे AI21 Labs द्वारा विकसित किया गया था और 2021 में जारी किया गया था। यह अपनी ऑटोरेग्रेसिव ट्रांसफॉर्मर वास्तुकला और प्राकृतिक भाषा प्रसंस्करण कार्यों में उच्च प्रदर्शन के लिए जाना जाता है।

Jurassic-1 बड़े भाषा मॉडल (LLMs) का एक परिवार है जिसे इज़राइली कृत्रिम बुद्धिमत्ता कंपनी AI21 Labs द्वारा विकसित किया गया है। अगस्त 2021 में जारी, यह पहले व्यावसायिक रूप से उपलब्ध LLMs में से एक था जो OpenAI के GPT-3 के पैमाने को टक्कर देता था, जिसमें सबसे बड़े संस्करण, Jurassic-1 Jumbo, में 178 बिलियन पैरामीटर थे। मॉडल को प्राकृतिक भाषा प्रसंस्करण कार्यों की एक विस्तृत श्रृंखला के लिए डिज़ाइन किया गया है, जिसमें टेक्स्ट जनरेशन, सारांशीकरण, प्रश्न उत्तर, और कोड जनरेशन शामिल हैं, और एक व्यावसायिक API के माध्यम से सुलभ हैं।

Jurassic-1 Transformer (architecture) आर्किटेक्चर पर बनाया गया है, विशेष रूप से एक ऑटोरेग्रेसिव डिकोडर-ओनली मॉडल, जो GPT-3 के समान है। इसे सार्वजनिक रूप से उपलब्ध टेक्स्ट और कोड के एक बड़े कोष पर प्रशिक्षित किया गया था, जिसमें उच्च-गुणवत्ता फ़िल्टरिंग और डीडुप्लीकेशन पर ध्यान केंद्रित किया गया था। मॉडल परिवार में दो मुख्य संस्करण शामिल हैं: Jurassic-1 Jumbo (178B पैरामीटर) और Jurassic-1 Large (7.5B पैरामीटर), दोनों एक ही आर्किटेक्चर साझा करते हैं लेकिन पैमाने में भिन्न हैं। मॉडल 250,000 टोकन की शब्दावली के साथ एक टोकनाइज़र का उपयोग करते हैं, जो GPT-3 की 50,000-टोकन शब्दावली से बड़ा है, जिससे टेक्स्ट का अधिक कुशल एन्कोडिंग संभव होता है।

आर्किटेक्चर और प्रशिक्षण

Jurassic-1 मॉडल मल्टी-हेड अटेंशन और फीड-फॉरवर्ड परतों के साथ एक मानक डिकोडर-ओनली Transformer (architecture) का उपयोग करते हैं। वे Layer Normalization और अवशिष्ट कनेक्शन संरचना का उपयोग करते हैं, जो अन्य बड़े पैमाने के LLMs के समान कॉन्फ़िगरेशन के साथ है। प्रशिक्षण प्रक्रिया में Adam अनुकूलन, Gradient Clipping, और वार्मअप और कोसाइन क्षय के साथ सीखने की दर अनुसूची का संयोजन शामिल था। मॉडल को लगभग 300 बिलियन टोकन के डेटासेट पर प्रशिक्षित किया गया था, जो वेब पेजों, पुस्तकों और अन्य सार्वजनिक टेक्स्ट से प्राप्त किया गया था, जिसमें अंग्रेजी में एक महत्वपूर्ण हिस्सा शामिल था लेकिन अन्य भाषाओं को भी शामिल किया गया था।

AI21 Labs ने निम्न-गुणवत्ता या डुप्लिकेट सामग्री को हटाने के लिए एक कस्टम डेटा फ़िल्टरिंग पाइपलाइन के उपयोग पर जोर दिया। प्रशिक्षण NVIDIA GPUs के एक क्लस्टर पर किया गया था, हालांकि विशिष्ट हार्डवेयर विवरण पूरी तरह से खुलासा नहीं किया गया था। कंपनी ने निर्देशों का पालन करने और प्रश्न उत्तर और तर्क जैसे कार्यों को करने की मॉडल की क्षमता में सुधार करने के लिए "संरचित प्रॉम्प्टिंग" नामक एक तकनीक भी पेश की।

क्षमताएं और प्रदर्शन

Jurassic-1 ने विभिन्न बेंचमार्कों पर मजबूत प्रदर्शन का प्रदर्शन किया, जिसमें SuperGLUE और अन्य NLP कार्य शामिल हैं, अक्सर समान मूल्यांकनों पर GPT-3 के परिणामों से मेल खाते या उससे अधिक होते हैं। मॉडल की बड़ी शब्दावली और प्रशिक्षण डेटा ने इसे दुर्लभ शब्दों और बहुभाषी टेक्स्ट को अधिक प्रभावी ढंग से संभालने की अनुमति दी। मानक टेक्स्ट जनरेशन के अलावा, Jurassic-1 नामित इकाई पहचान, भावना विश्लेषण, और टेक्स्ट वर्गीकरण जैसे कार्यों को बिना फाइन-ट्यूनिंग के, कुछ-शॉट सीखने का उपयोग करके कर सकता था।

मॉडल ने "ज़ीरो-शॉट" तर्क नामक एक सुविधा का भी समर्थन किया, जहां यह पूर्व उदाहरणों के बिना सवालों के जवाब दे सकता था या समस्याओं को हल कर सकता था। AI21 Labs ने एक सार्वजनिक प्लेग्राउंड और API जारी किया, जिससे डेवलपर्स को Jurassic-1 को अनुप्रयोगों में एकीकृत करने की अनुमति मिली। API ने तापमान नियंत्रण, टॉप-पी सैंपलिंग, और अन्य जनरेशन मापदंडों के विकल्प प्रदान किए।

समकालीनों के साथ तुलना

अपनी रिलीज़ के समय, Jurassic-1 को OpenAI के GPT-3 के प्रत्यक्ष प्रतियोगी के रूप में स्थान दिया गया था, जिसे 2020 में जारी किया गया था। जबकि GPT-3 में 175 बिलियन पैरामीटर थे, Jurassic-1 Jumbo में 178 बिलियन थे, जिससे यह थोड़ा बड़ा था। हालांकि, Jurassic-1 के टोकनाइज़र ने एक बड़ी शब्दावली का उपयोग किया, जिससे किसी दिए गए टेक्स्ट के लिए आवश्यक टोकन की संख्या कम हो गई, संभावित रूप से अनुमान गति और लागत में सुधार हुआ। AI21 Labs ने 2,048 टोकन की अधिकतम अनुक्रम लंबाई के साथ, लंबे संदर्भों को संभालने की मॉडल की क्षमता पर भी प्रकाश डाला, जो GPT-3 के समान है।

Anthropic के बाद के मॉडल या Google DeepMind के प्रयासों के विपरीत, Jurassic-1 लॉन्च के समय मानव प्रतिक्रिया से सुदृढीकरण सीखने (RLHF) पर केंद्रित नहीं था, बल्कि पर्यवेक्षित सीखने और कुछ-शॉट प्रॉम्प्टिंग पर था। इसने इसे दृष्टिकोण में मूल GPT-3 के समान बना दिया।

प्रभाव और विरासत

Jurassic-1 OpenAI के अलावा किसी अन्य कंपनी के पहले प्रमुख LLMs में से एक था, जिसने जनरेटिव AI स्थान में AI21 Labs को एक महत्वपूर्ण खिलाड़ी के रूप में स्थापित करने में मदद की। इसका उपयोग विभिन्न व्यावसायिक अनुप्रयोगों में किया गया था, जिसमें लेखन सहायता, ग्राहक सेवा चैटबॉट, और सामग्री निर्माण शामिल हैं। मॉडल की रिलीज़ ने मॉडल आकार बढ़ाने और बड़े भाषा मॉडल को एक सेवा के रूप में विकसित करने की व्यापक प्रवृत्ति में भी योगदान दिया।

AI21 Labs के बाद के मॉडल, जैसे कि Jurassic-2, ने Jurassic-1 से सीखे गए आर्किटेक्चर और पाठों पर निर्माण किया, जिसमें प्रशिक्षण डेटा और संरेखण में सुधार शामिल थे। कंपनी ने कुछ समय के लिए अपने API के माध्यम से Jurassic-1 की पेशकश जारी रखी, हालांकि इसे अंततः नए मॉडलों के पक्ष में हटा दिया गया। Jurassic-1 कृत्रिम बुद्धिमत्ता अनुसंधान के इतिहास में एक उल्लेखनीय मील का पत्थर बना हुआ है, जो दर्शाता है कि प्रतिस्पर्धी LLMs सबसे बड़ी तकनीकी कंपनियों के बाहर विकसित किए जा सकते हैं।

स्वागत और आलोचना

Jurassic-1 को इसके प्रदर्शन और पहुंच के लिए सकारात्मक समीक्षा मिली, कई डेवलपर्स ने API की उपयोग में आसानी और सुसंगत और संदर्भ-प्रासंगिक टेक्स्ट उत्पन्न करने की मॉडल की क्षमता की प्रशंसा की। हालांकि, अन्य LLMs की तरह, इसे अपने प्रशिक्षण डेटा में संभावित पूर्वाग्रहों और इतने बड़े मॉडलों को प्रशिक्षित करने के पर्यावरणीय प्रभाव के बारे में आलोचना का सामना करना पड़ा। AI21 Labs ने इन चिंताओं को स्वीकार किया और जिम्मेदार उपयोग पर दस्तावेज़ीकरण प्रकाशित किया, लेकिन मॉडल के वजन को सार्वजनिक रूप से जारी नहीं किया, जिससे स्वतंत्र अनुसंधान सीमित हो गया।

कुछ शोधकर्ताओं ने कहा कि कुछ तर्क कार्यों पर Jurassic-1 का प्रदर्शन छोटे मॉडलों की तुलना में काफी बेहतर नहीं था, जो अकेले पैमाने की सीमाओं को उजागर करता है। इन आलोचनाओं के बावजूद, मॉडल की रिलीज़ ने LLM बाजार में प्रतिस्पर्धा को बढ़ावा देने में मदद की, जिससे क्षेत्र में तेजी से प्रगति हुई।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:large-language-model·artificial-intelligence·natural-language-processing·ai21-labs
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास