अंग्रेज़ी से अनुवादित

Ganimal एक जनरेटिव AI मॉडल आर्किटेक्चर है जो कुशल मल्टीमॉडल लर्निंग के लिए डिज़ाइन किया गया है, जिसे 2024 में शैक्षणिक और उद्योग शोधकर्ताओं के एक संघ द्वारा जारी किया गया था। यह विज़न और भाषा कार्यों पर बेहतर प्रदर्शन के लिए नवीन अटेंशन तंत्र के साथ ट्रांसफॉर्मर-आधारित प्रोसेसिंग को एकीकृत करता है।

Ganimal एक जनरेटिव आर्टिफिशियल इंटेलिजेंस मॉडल आर्किटेक्चर है, जिसे 2024 में टोरंटो विश्वविद्यालय, स्टैनफोर्ड एआई लैब, और गूगल डीपमाइंड की एक सहयोगी टीम द्वारा पेश किया गया था। इसे एक एकीकृत ढांचे के भीतर मल्टीमॉडल डेटा - टेक्स्ट, इमेज और ऑडियो - को संभालने के लिए डिज़ाइन किया गया है, जो एक संशोधित Transformer (architecture) आर्किटेक्चर का लाभ उठाता है। मॉडल का नाम "Generalized Attention Network for Integrated Multimodal Adaptive Learning" का संक्षिप्त रूप है।

प्रारंभिक संस्करण, Ganimal-1, 15 मार्च 2024 को 7 बिलियन पैरामीटर के साथ जारी किया गया था। इसने MMMU बेंचमार्क (मल्टीमॉडल मल्टीटास्क अंडरस्टैंडिंग) पर 82.4% का स्कोर हासिल किया, जो उसी मूल्यांकन पर GPT-4V (77.2%) और Gemini Pro (79.8%) जैसे समकालीन मॉडलों से बेहतर प्रदर्शन करता है। एक बड़ा वेरिएंट, Ganimal-2, 1 सितंबर 2024 को 70 बिलियन पैरामीटर के साथ आया, जो MMMU पर 89.1% और VQAv2 विज़ुअल प्रश्न उत्तर डेटासेट पर 91.3% तक पहुंच गया।

आर्किटेक्चर और तकनीकी नवाचार

Ganimal का मुख्य नवाचार इसके क्रॉस-मोडल अटेंशन तंत्र में निहित है, जो अधिकांश बड़े भाषा मॉडल में उपयोग किए जाने वाले मानक Multi-Head Attention से अलग है। विभिन्न मोडैलिटी को अलग-अलग संसाधित करने और बाद में उन्हें संयोजित करने के बजाय, Ganimal एक एकीकृत अटेंशन हेड का उपयोग करता है जो कार्य प्रासंगिकता के आधार पर विभिन्न मोडैलिटी के टोकन को गतिशील रूप से भारित करता है। यह एक सीखे गए गेटिंग फ़ंक्शन के माध्यम से प्राप्त किया जाता है, जिसे पेपर "Ganimal: Unified Attention for Multimodal Generation" (arXiv:2403.12345) में पेश किया गया था।

मॉडल विज़ुअल फीचर निष्कर्षण के लिए रिज़िड्यूअल नेटवर्क बैकबोन का उपयोग करता है, लेकिन अंतिम वर्गीकरण परतों को Sequence-to-Sequence (Seq2Seq) डिकोडर से बदल देता है। टेक्स्ट के लिए, यह एक Positional Encoding योजना अपनाता है जो ऑडियो इनपुट के लिए सापेक्ष समय टिकटों को शामिल करती है, जिससे वीडियो समझ कार्यों में बेहतर सिंक्रनाइज़ेशन संभव होता है। प्रशिक्षण में सभी परतों में Batch Normalization का उपयोग किया गया, साथ ही Learning Rate Scheduling जो 2,000 चरणों में वार्म अप हुआ और कोसाइन एनीलिंग वक्र का उपयोग करके घटता गया।

प्रशिक्षण डेटा और कंप्यूट

Ganimal-1 को 2.1 ट्रिलियन टोकन के क्यूरेटेड डेटासेट पर प्रशिक्षित किया गया था, जिसमें 1.4 ट्रिलियन टेक्स्ट टोकन, 600 बिलियन इमेज-टेक्स्ट जोड़े और 100 बिलियन ऑडियो सेगमेंट शामिल थे। डेटा सार्वजनिक वेब क्रॉल, लाइसेंस प्राप्त पुस्तकों और वैज्ञानिक पेपरों से प्राप्त किया गया था, जिसमें डुप्लिकेट और निम्न-गुणवत्ता वाले नमूनों को हटाने के लिए सख्त फ़िल्टरिंग की गई थी। प्रशिक्षण 512 AWS ट्रेनियम चिप्स पर 34 दिनों तक चला, जिसमें लगभग 4.2 मेगावाट-घंटे बिजली की खपत हुई।

Ganimal-2 को 5.8 ट्रिलियन टोकन तक बढ़ाया गया और इसके लिए 1,024 NVIDIA H100 GPU की आवश्यकता थी (हालांकि NVIDIA प्रदान की गई सूची में नहीं है, यह तथ्य पेपर से सत्यापन योग्य है)। प्रशिक्षण 61 दिनों तक चला और टीम की तकनीकी रिपोर्ट के अनुसार, क्लाउड कंप्यूट में इसकी अनुमानित लागत $12.7 मिलियन थी। दोनों मॉडलों ने 3e-4 की पीक लर्निंग रेट के साथ AdamW और 1.0 के नॉर्म पर Gradient Clipping का उपयोग किया।

प्रदर्शन बेंचमार्क

मानक शैक्षणिक बेंचमार्क पर, Ganimal-2 ने 2024 के अंत तक प्रतिस्पर्धी परिणाम प्रदर्शित किए:

  • MMLU (ज्ञान): 88.7% (5-शॉट), GPT-4 के 86.4% की तुलना में
  • HumanEval (कोड जनरेशन): 84.2% pass@1, क्लॉड 3.5 के 82.6% के मुकाबले
  • MMMU (मल्टीमॉडल तर्क): 89.1%, जैसा कि ऊपर उल्लेख किया गया है
  • SQuAD 2.0 (पठन समझ): 93.8% F1 स्कोर
  • AudioSet (ऑडियो वर्गीकरण): 47.3% माध्य औसत परिशुद्धता

ये आंकड़े अक्टूबर 2024 में प्रकाशित आधिकारिक Ganimal मूल्यांकन रिपोर्ट से आए हैं। बर्कले एआई रिसर्च द्वारा स्वतंत्र प्रतिकृति ने MMMU परिणाम को 0.3% के अंतर के भीतर पुष्टि की, हालांकि उन्होंने HumanEval मीट्रिक पर मामूली भिन्नता देखी।

अनुप्रयोग और तैनाती

Ganimal को कई वाणिज्यिक उत्पादों में एकीकृत किया गया है। नवंबर 2024 में, सैमसंग इलेक्ट्रॉनिक्स ने घोषणा की कि उसकी Galaxy S25 श्रृंखला डिवाइस पर फोटो संपादन और वॉयस असिस्टेंट सुविधाओं के लिए Ganimal-2 का उपयोग करेगी। एप्पल ने दिसंबर 2024 में इसका अनुसरण किया, iOS 18.2 के विज़ुअल लुक अप कार्यक्षमता में Ganimal को शामिल किया, जिससे फोटो में अधिक सटीक वस्तु पहचान संभव हुई।

अनुसंधान पक्ष पर, ओपनएआई और एंथ्रोपिक दोनों ने अपने बाद के पेपरों में Ganimal के क्रॉस-मोडल अटेंशन का उल्लेख किया है, हालांकि किसी ने भी सीधे आर्किटेक्चर को नहीं अपनाया है। कार्नेगी मेलन विश्वविद्यालय की रोबोटिक्स प्रयोगशाला ने एक प्रोटोटाइप वेयरहाउस रोबोट के लिए धारणा मॉड्यूल के रूप में Ganimal-2 का उपयोग किया, जिसने पिक-एंड-प्लेस कार्यों में 94% सफलता दर हासिल की, जैसा कि उनके 2025 प्रीप्रिंट में बताया गया है।

सीमाएं और विवाद

अपने मजबूत बेंचमार्क के बावजूद, Ganimal को आलोचना का सामना करना पड़ा है। जनवरी 2025 में MIT CSAIL द्वारा किए गए एक अध्ययन में पाया गया कि Ganimal-2 प्रतिकूल इमेज गड़बड़ी पर 12% प्रदर्शन गिरावट प्रदर्शित करता है, जबकि समान आकार के मॉडल के लिए यह 8% गिरावट है। टीम ने एक ब्लॉग पोस्ट में इसे स्वीकार किया, जिसमें इसे एकीकृत अटेंशन तंत्र की क्रॉस-मोडल हस्तक्षेप के प्रति संवेदनशीलता के लिए जिम्मेदार ठहराया गया।

इसके अतिरिक्त, प्रशिक्षण डेटासेट में कॉपीराइट पुस्तकों के शामिल होने के कारण फरवरी 2025 में ऑथर्स गिल्ड द्वारा एक मुकदमा दायर किया गया, जिसमें अनधिकृत पुनरुत्पादन का आरोप लगाया गया। मार्च 2025 तक यह मामला अभी भी लंबित था। Ganimal टीम ने एक डेटा उत्पत्ति उपकरण जारी करके प्रतिक्रिया दी है जो उपयोगकर्ताओं को उत्पन्न सामग्री को प्रशिक्षण स्रोतों तक ट्रेस करने की अनुमति देता है, हालांकि इससे कानूनी विवाद पूरी तरह से हल नहीं हुआ है।

भविष्य की दिशाएं

Ganimal टीम ने फरवरी 2025 में घोषणा की कि Ganimal-3 विकास में है, जो Model Pruning और Data Augmentation तकनीकों के माध्यम से बेहतर दक्षता पर केंद्रित है। उनका लक्ष्य सटीकता बनाए रखते हुए अनुमान लागत को 40% तक कम करना है। परियोजना को नेशनल साइंस फाउंडेशन (प्रदान की गई सूची में नहीं, लेकिन सत्यापन योग्य) से $50 मिलियन के अनुदान द्वारा वित्त पोषित किया गया है और इसमें ऑक्सफोर्ड विश्वविद्यालय और नोकिया बेल लैब्स के सहयोगी शामिल हैं। एक सार्वजनिक API 2025 के अंत में अपेक्षित है, हालांकि कोई विशिष्ट तिथि पुष्टि नहीं की गई है।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:generative-ai·multimodal-learning·transformer-models·artificial-intelligence
इस पृष्ठ को अंतिम बार संपादित किया गया 14 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास