जेम्मा बड़े भाषा मॉडल की एक श्रृंखला है जो गूगल डीपमाइंड द्वारा विकसित की गई है। यह जेमिनी मॉडल श्रृंखला के समान तकनीकों पर आधारित है, और इसे गूगल के 'एआई को सभी के लिए सहायक बनाने' के मिशन का समर्थन करने के लिए डिज़ाइन किया गया है। पहला संस्करण फरवरी 2024 में जारी किया गया था, उसके बाद जून 2024 में जेम्मा 2, मार्च 2025 में जेम्मा 3, और अप्रैल 2026 में ओपन-वेट्स जेम्मा 4 जारी किया गया। जेम्मा के विभिन्न रूप भी विकसित किए गए हैं, जैसे विज़न-भाषा मॉडल पालीजेम्मा और चिकित्सा परामर्श विषयों के लिए मॉडल मेडजेम्मा।
इतिहास
फरवरी 2024 में, गूगल ने जेम्मा का अनावरण किया, जो स्रोत-उपलब्ध एलएलएम का एक संग्रह है जो जेमिनी के हल्के संस्करण के रूप में कार्य करता है। प्रारंभिक रिलीज़ दो आकारों में आई: तंत्रिका नेटवर्क जिनमें क्रमशः दो और सात अरब पैरामीटर थे। कई प्रकाशनों ने इसे मेटा जैसे प्रतिस्पर्धियों द्वारा अपने एआई मॉडल के स्रोत कोड जारी करने की प्रतिक्रिया के रूप में देखा, और गूगल की अपने एआई स्रोत कोड को निजी रखने की लंबे समय से चली आ रही प्रथा से बदलाव के रूप में देखा।
जेम्मा 2 27 जून, 2024 को जारी किया गया था, और जेम्मा 3 12 मार्च, 2025 को जारी किया गया था। 2 अप्रैल, 2026 को, गूगल ने जेम्मा 4 को मुफ्त और ओपन-सोर्स अपाचे 2.0 लाइसेंस के तहत जारी किया।
अवलोकन
जेमिनी मॉडल श्रृंखला के समान तकनीकों पर आधारित, जेम्मा को गूगल द्वारा 'एआई को सभी के लिए सहायक बनाने' के अपने मिशन का समर्थन करने में मदद करने के रूप में वर्णित किया गया है। गूगल विशिष्ट उपयोग मामलों के लिए अनुकूलित आधिकारिक जेम्मा संस्करण प्रदान करता है, जैसे चिकित्सा विश्लेषण के लिए मेडजेम्मा।
अपनी रिलीज़ के बाद से, जेम्मा मॉडल के 150 मिलियन से अधिक डाउनलोड हुए हैं, जिनमें हगिंग फेस पर 70,000 विविधताएं उपलब्ध हैं।
जेम्मा 3 को 1, 4, 12, और 27 अरब पैरामीटर आकारों में 140 से अधिक भाषाओं के समर्थन के साथ पेश किया गया था। बहुविध मॉडल के रूप में, वे टेक्स्ट और छवि इनपुट दोनों का समर्थन करते हैं। गूगल जेम्मा 3एन भी प्रदान करता है - स्मार्टफोन, लैपटॉप और टैबलेट जैसे उपभोक्ता उपकरणों पर निष्पादन के लिए अनुकूलित छोटे मॉडल।
मॉडल की नवीनतम पीढ़ी जेम्मा 4 है, जो 2 अप्रैल, 2026 को जारी हुई। यह चार आकारों में उपलब्ध है: प्रभावी 2बी (ई2बी), प्रभावी 4बी (ई4बी), 26बी मिक्स्चर ऑफ एक्सपर्ट्स (एमओई), और 31बी डेंस। जेम्मा 4 सभी मॉडलों में छवियों और वीडियो सहित बहुविध इनपुट का समर्थन करता है, जिसमें ई2बी और ई4बी मॉडल पर मूल ऑडियो इनपुट शामिल है। जेम्मा 4 के 31बी डेंस संस्करण ने एरीना के टेक्स्ट लीडरबोर्ड पर तीसरा स्थान हासिल किया, और 26बी संस्करण छठे स्थान पर पहुंचा। जेम्मा 4 12बी 3 जून, 2026 को जारी किया गया था और इसमें एक एकीकृत बहुविध वास्तुकला है जो एनकोडर के बिना छवियों और ऑडियो को संसाधित करती है।
वास्तुकला
जेम्मा 3 एक डिकोडर-ओनली ट्रांसफार्मर वास्तुकला पर आधारित है जिसमें समूहित-क्वेरी ध्यान (जीक्यूए) और सिगएलआईपी विज़न एनकोडर है। प्रत्येक मॉडल की संदर्भ लंबाई 128K है, जेम्मा 3 1बी के अपवाद के साथ, जिसकी संदर्भ लंबाई 32K है।
क्वांटाइजेशन-जागरूक प्रशिक्षण (क्यूएटी) का उपयोग करके ठीक-ट्यून किए गए क्वांटाइज्ड संस्करण भी उपलब्ध हैं, जो सटीकता और परिशुद्धता पर कुछ नकारात्मक प्रभाव के साथ काफी मेमोरी उपयोग में सुधार प्रदान करते हैं।
विविधताएं
गूगल विशिष्ट उद्देश्यों, जैसे चिकित्सा विश्लेषण या प्रोग्रामिंग के लिए डिज़ाइन किए गए जेम्मा मॉडल के आधिकारिक संस्करण विकसित करता है। इनमें शामिल हैं:
- कोडजेम्मा (2बी और 7बी): कोडजेम्मा मॉडल का एक समूह है जो कोड पूर्णता के साथ-साथ सामान्य कोडिंग उपयोग के लिए डिज़ाइन किया गया है। यह पायथन, जावा, सी++ और अधिक सहित कई प्रोग्रामिंग भाषाओं का समर्थन करता है।
- डॉल्फिनजेम्मा (लगभग 400M): जॉर्जिया टेक और वाइल्ड डॉल्फिन प्रोजेक्ट के शोधकर्ताओं के साथ सहयोग में विकसित, डॉल्फिनजेम्मा का उद्देश्य ऑडियो विश्लेषण के माध्यम से डॉल्फिन संचार को बेहतर ढंग से समझना है। हालांकि, कोई मॉडल या डेटा सार्वजनिक रूप से जारी नहीं किया गया है।
- मेडजेम्मा (4बी और 27बी): जेम्मा 3 पर भी आधारित, मेडजेम्मा को छवि विश्लेषण जैसे चिकित्सा अनुप्रयोगों के लिए डिज़ाइन किया गया है। हालांकि, गूगल यह भी नोट करता है कि मेडजेम्मा 'अभी तक नैदानिक ग्रेड नहीं है'। भारत के गुड़गांव में टैप हेल्थ के डेवलपर्स ने एआई-सहायता प्राप्त मधुमेह प्रबंधन अनुप्रयोगों को बढ़ाने के लिए मेडजेम्मा का उपयोग किया है।
- पालीजेम्मा (3बी, 10बी और 28बी, क्रमशः 2बी, 9बी और 27बी के साथ जेम्मा 2 पर आधारित): मशीन विज़न और छवि विश्लेषण के लिए।
- शील्डजेम्मा 2 (4बी): जेम्मा 3 परिवार पर आधारित, शील्डजेम्मा को हिंसक, खतरनाक और यौन रूप से स्पष्ट छवियों की पहचान करने और फ़िल्टर करने के लिए डिज़ाइन किया गया है।
- ट्रांसलेटजेम्मा (4बी, 12बी और 27बी): मशीन अनुवाद के लिए।
नोट: ओपन-वेट मॉडल की संदर्भ लंबाई को अनुमान के समय पुनः स्केल किया जा सकता है। जेम्मा 1, जेम्मा 2, पालीजेम्मा और पालीजेम्मा 2 के साथ, लागत संदर्भ विंडो आकार के सापेक्ष केवी-कैश आकार में रैखिक वृद्धि है। जेम्मा 3 के साथ, स्थानीय और वैश्विक ध्यान के अलगाव के कारण एक बेहतर विकास वक्र है। रिकरंटजेम्मा के साथ, 2,048 टोकन के बाद मेमोरी उपयोग अपरिवर्तित रहता है।
यह भी देखें
- बड़े भाषा मॉडलों की सूची
- ओपन-सोर्स कृत्रिम बुद्धिमत्ता सॉफ्टवेयर की सूचियाँ
संदर्भ
बाहरी लिंक
- आधिकारिक वेबसाइट