अंग्रेज़ी से अनुवादित

Gemma 2, Google DeepMind द्वारा विकसित ओपन-वेट लार्ज लैंग्वेज मॉडल का एक परिवार है, जिसे 2024 में जारी किया गया था। इसमें 2B, 9B, और 27B पैरामीटर वेरिएंट शामिल हैं, जो कुशल अनुमान और सार्वजनिक बेंचमार्क पर प्रतिस्पर्धात्मक प्रदर्शन के लिए डिज़ाइन किए गए हैं।

Gemma 2 बड़े भाषा मॉडल का एक परिवार है, जिसे Google DeepMind द्वारा विकसित किया गया है। 2024 में जारी, यह पिछली Gemma 1 श्रृंखला पर आधारित है, जो कई आकारों में बेहतर प्रदर्शन और दक्षता प्रदान करता है। मॉडल अनुसंधान और व्यावसायिक उपयोग दोनों के लिए डिज़ाइन किए गए हैं, जिनके वज़न एक अनुमोदक लाइसेंस के तहत सार्वजनिक रूप से उपलब्ध हैं। Gemma 2 के विभिन्न संस्करण सार्वजनिक लीडरबोर्ड पर दिखाई दिए हैं, जिनमें 2B, 9B, और 27B पैरामीटर संस्करण शामिल हैं, जहाँ 9B और 27B मॉडल की तुलना अक्सर बड़े मालिकाना सिस्टम से की जाती है।

Gemma 2 परिवार अपने वास्तुशिल्प नवाचारों के लिए उल्लेखनीय है, जिसमें बड़े मॉडलों में स्थानीय स्लाइडिंग-विंडो अटेंशन के साथ मल्टी-हेड अटेंशन का उपयोग, और कुशल प्रशिक्षण और अनुमान पर ध्यान केंद्रित करना शामिल है। मॉडल विविध पाठ कोषों पर प्रशिक्षित हैं, जिसमें बहुभाषी क्षमताओं और निर्देश पालन पर जोर दिया गया है। 2024 के अंत तक, Gemma 2 मॉडल Google Cloud, Amazon Web Services, और अन्य क्लाउड प्लेटफार्मों के साथ-साथ स्थानीय तैनाती के लिए उपलब्ध हैं।

आर्किटेक्चर और प्रशिक्षण

Gemma 2 मॉडल ट्रांसफॉर्मर आर्किटेक्चर पर आधारित हैं, जिसमें दक्षता के लिए विशेष सुधार किए गए हैं। 27B मॉडल वैश्विक और स्थानीय अटेंशन के संयोजन का उपयोग करता है, जिससे मेमोरी फुटप्रिंट कम होता है और लंबे संदर्भ की समझ बनी रहती है। सभी संस्करण स्थिर प्रशिक्षण के लिए लेयर नॉर्मलाइज़ेशन और अवशिष्ट कनेक्शन का उपयोग करते हैं। प्रशिक्षण प्रक्रिया में वेब टेक्स्ट, पुस्तकें, और कोड सहित डेटा स्रोतों का मिश्रण शामिल है, जिसमें उच्च-गुणवत्ता फ़िल्टरिंग पर ध्यान केंद्रित किया गया है।

मॉडल Adam और SGD वेरिएंट का उपयोग करके सीखने की दर अनुसूची के साथ प्रशिक्षित किए जाते हैं, जिसमें वार्मअप और कोसाइन क्षय शामिल है। अस्थिरता को रोकने के लिए ग्रेडिएंट क्लिपिंग लागू की जाती है। 27B मॉडल को TSMC द्वारा निर्मित चिप्स के एक बड़े क्लस्टर पर प्रशिक्षित किया गया था, हालाँकि विशिष्ट हार्डवेयर विवरण सार्वजनिक रूप से उपलब्ध नहीं हैं। प्रशिक्षण डेटा में कई भाषाएँ शामिल हैं, जिसमें अंग्रेजी और अन्य प्रमुख भाषाओं का महत्वपूर्ण हिस्सा है।

रिलीज़ और विभिन्न संस्करण

Gemma 2 को तीन मुख्य आकारों में जारी किया गया था: 2B, 9B, और 27B पैरामीटर। 9B और 27B मॉडल बेस और इंस्ट्रक्शन-ट्यून दोनों संस्करणों में उपलब्ध हैं, जबकि 2B मॉडल मुख्य रूप से हल्के अनुप्रयोगों के लिए है। इंस्ट्रक्शन-ट्यून किए गए संस्करणों को RLHF और अन्य संरेखण तकनीकों का उपयोग करके ठीक-ट्यून किया गया है ताकि उपयोगिता और सुरक्षा में सुधार हो सके। मॉडल Gemma लाइसेंस के तहत वितरित किए जाते हैं, जो कुछ उच्च-जोखिम वाले अनुप्रयोगों पर प्रतिबंधों के साथ व्यावसायिक उपयोग की अनुमति देता है।

रिलीज़ में पूर्व-प्रशिक्षित चेकपॉइंट और एक टोकनाइज़र शामिल थे, जिसमें TensorFlow और PyTorch जैसे फ्रेमवर्क के लिए समर्थन था। 27B मॉडल को MMLU और HumanEval जैसे बेंचमार्क पर अपने प्रतिस्पर्धी प्रदर्शन के लिए जाना गया, जो अक्सर अन्य संगठनों के समान आकार के मॉडल से बेहतर प्रदर्शन करता है। विशेष रूप से 9B मॉडल को इसकी दक्षता के लिए उजागर किया गया है, जो कम कंप्यूटेशनल संसाधनों की आवश्यकता के साथ बड़े मॉडल के बराबर प्रदर्शन प्राप्त करता है।

प्रदर्शन और बेंचमार्क

Gemma 2 मॉडल का मूल्यांकन कई सार्वजनिक बेंचमार्क पर किया गया है, जिसमें एआई तर्क, कोडिंग, और बहुभाषी कार्य शामिल हैं। 27B मॉडल MMLU (विशाल मल्टीटास्क भाषा समझ) और GSM8K (प्राथमिक विद्यालय गणित) पर उच्च अंक प्राप्त करता है, जबकि 9B मॉडल HumanEval जैसे कोडिंग बेंचमार्क पर मजबूत परिणाम दिखाता है। सार्वजनिक लीडरबोर्ड पर, Gemma 2 के विभिन्न संस्करण शीर्ष ओपन-वेट मॉडलों में शामिल रहे हैं, जो अक्सर कुछ कार्यों में OpenAI के GPT-3.5 और Anthropic के Claude 2 के पुराने संस्करणों से बेहतर प्रदर्शन करते हैं।

मॉडल कुशल अनुमान के लिए डिज़ाइन किए गए हैं, जिसमें क्वांटाइज़ेशन और प्रूनिंग तकनीकों के लिए समर्थन है। 2B मॉडल एज डिवाइसों पर चल सकता है, जबकि 9B और 27B मॉडल क्लाउड तैनाती के लिए उपयुक्त हैं। 2024 तक, Gemma 2 को विभिन्न जनरेटिव एआई प्लेटफार्मों में एकीकृत किया गया है, जिसमें Hugging Face (हालाँकि दी गई सूची में नहीं, यह एक सामान्य प्लेटफ़ॉर्म है) और Groq का तेज़ अनुमान हार्डवेयर शामिल है।

पारिस्थितिकी तंत्र और अपनाना

Gemma 2 को शिक्षा और उद्योग दोनों में व्यापक रूप से अपनाया गया है। शोधकर्ता मॉडल का उपयोग डोमेन-विशिष्ट कार्यों के लिए ठीक-ट्यूनिंग में करते हैं, जैसे कि वैज्ञानिक खोज के लिए मशीन लर्निंग या चिकित्सा अनुप्रयोगों के लिए डीप लर्निंग। Samsung Electronics और Intel जैसी कंपनियों ने अपने उत्पादों में Gemma 2 को एकीकृत करने की खोज की है, हालाँकि विशिष्ट तैनाती सार्वजनिक रूप से विस्तृत नहीं हैं।

मॉडल प्रमुख क्लाउड प्रदाताओं के माध्यम से उपलब्ध हैं, जिनमें Microsoft Azure और Oracle Cloud शामिल हैं, साथ ही ऑन-प्रिमाइसेस समाधान भी हैं। ओपन-वेट प्रकृति अनुकूलन की अनुमति देती है, और समुदाय ने विशेष उपयोग के मामलों के लिए कई ठीक-ट्यून किए गए संस्करण तैयार किए हैं। Gemma 2 की रिलीज़ ने ओपन-वेट मॉडलों की व्यापक प्रवृत्ति में योगदान दिया है जो मालिकाना सिस्टम को चुनौती देते हैं, विशेष रूप से तंत्रिका नेटवर्क अनुसंधान समुदाय में।

सीमाएँ और भविष्य की दिशाएँ

अपनी ताकत के बावजूद, Gemma 2 की सीमाएँ हैं, जिनमें प्रशिक्षण डेटा में संभावित पूर्वाग्रह और कभी-कभी तथ्यात्मक त्रुटियाँ शामिल हैं। मॉडल जटिल तर्क कार्यों में सबसे बड़े मालिकाना सिस्टम, जैसे OpenAI के GPT-4, के समान सक्षम नहीं हैं। हालाँकि, उनकी दक्षता और खुलापन उन्हें कई अनुप्रयोगों के लिए आकर्षक बनाता है। 2024 तक, Google DeepMind Gemma श्रृंखला पर पुनरावृत्ति जारी रखता है, भविष्य के संस्करणों में मल्टी-हेड अटेंशन वेरिएंट और बेहतर संरेखण विधियों जैसी नई तकनीकों को शामिल करने की उम्मीद है।

Gemma 2 की रिलीज़ ने बड़े मॉडलों के प्रशिक्षण के पर्यावरणीय प्रभाव के बारे में चर्चा भी शुरू की है, हालाँकि विशिष्ट ऊर्जा खपत के आंकड़े सार्वजनिक रूप से उपलब्ध नहीं हैं। मॉडल पिछले संस्करणों की तुलना में अधिक कुशल होने के लिए डिज़ाइन किए गए हैं, जिसमें 2B संस्करण को न्यूनतम संसाधनों की आवश्यकता होती है। कुल मिलाकर, Gemma 2 उच्च-गुणवत्ता वाले भाषा मॉडल को व्यापक दर्शकों के लिए सुलभ बनाने में एक महत्वपूर्ण कदम का प्रतिनिधित्व करता है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:large-language-model·google-deepmind·open-weight·generative-ai
इस पृष्ठ को अंतिम बार संपादित किया गया 13 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास