अंग्रेज़ी से अनुवादित

Gato 1.2B एक 1.2 अरब पैरामीटर वाला ट्रांसफॉर्मर-आधारित तंत्रिका नेटवर्क है, जिसे Google DeepMind द्वारा पाठ, छवियों और नियंत्रण में मल्टीमॉडल कार्यों के लिए विकसित किया गया है।

Gato 1.2B गूगल डीपमाइंड द्वारा विकसित 1.2 अरब मापदंडों वाला एक तंत्रिका नेटवर्क मॉडल है। यह एक ट्रांसफॉर्मर-आधारित भाषा मॉडल है जिसे टेक्स्ट निर्माण, छवि कैप्शनिंग, और रोबोटिक नियंत्रण सहित कई कार्यों को संभालने के लिए डिज़ाइन किया गया है, जिसमें वज़न का एक ही सेट उपयोग होता है। यह मॉडल 2022 में डीपमाइंड के एक सामान्य-उद्देश्यीय एजेंट बनाने के प्रयास के हिस्से के रूप में पेश किया गया था जो विभिन्न वातावरणों में सीख और कार्य कर सके।

Gato 1.2B की वास्तुकला एनकोडर-डिकोडर डिज़ाइन का पालन करती है, हालांकि यह मुख्य रूप से एक अनुक्रम-से-अनुक्रम मॉडल के रूप में कार्य करता है। यह इनपुट को टोकन अनुक्रमों के रूप में संसाधित करता है, जहां टेक्स्ट, छवियाँ, और क्रियाएँ अलग-अलग टोकन में परिवर्तित होती हैं। यह एकीकृत प्रतिनिधित्व मॉडल को कार्य-विशिष्ट संशोधनों के बिना विधाओं के बीच स्विच करने की अनुमति देता है। मॉडल चर-लंबाई इनपुट को संभालने के लिए मल्टी-हेड अटेंशन तंत्र और स्थितीय एन्कोडिंग का उपयोग करता है।

प्रशिक्षण और डेटा

Gato 1.2B को पुस्तकों और वेब पेजों के टेक्स्ट, सार्वजनिक डेटासेट की छवियों, और सिम्युलेटेड तथा वास्तविक दुनिया के रोबोटिक वातावरणों से प्रदर्शन डेटा सहित एक विविध डेटासेट पर प्रशिक्षित किया गया था। प्रशिक्षण में टेक्स्ट और छवि टोकन के लिए क्रॉस-एंट्रॉपी लॉस और क्रिया टोकन के लिए एक अलग लॉस का उपयोग किया गया। मॉडल को एडम ऑप्टिमाइज़र और एक सीखने की दर अनुसूची के साथ अनुकूलित किया गया था जिसमें वार्मअप और कोसाइन क्षय शामिल था। प्रशिक्षण गूगल क्लाउड TPU पर किया गया था, जिसमें लगभग 1.1e21 FLOPs का कुल कंप्यूट बजट था।

क्षमताएँ और प्रदर्शन

Gato 1.2B 600 से अधिक कार्यों में दक्षता प्रदर्शित करता है, जिसमें एटारी गेम खेलना, कैप्शन उत्पन्न करना, प्रश्नों के उत्तर देना, और रोबोटिक बांह को नियंत्रित करना शामिल है। मूल्यांकन में, इसने एटारी सुइट पर 50% का औसत स्कोर प्राप्त किया, जो पिछले सामान्यवादी मॉडलों से बेहतर था लेकिन विशेषज्ञ एजेंटों से कम था। रोबोटिक नियंत्रण के लिए, मॉडल का परीक्षण ब्लॉकों को ढेर करने और वस्तुओं को रखने जैसे वास्तविक दुनिया के कार्यों पर किया गया, जिसमें कुछ मामलों में विशेषज्ञ नीतियों के बराबर सफलता दर प्राप्त हुई। विभिन्न कार्यों में सामान्यीकरण करने की मॉडल की क्षमता को इसके बड़े पैमाने पर प्रीट्रेनिंग और साझा टोकन शब्दावली के लिए जिम्मेदार ठहराया गया है।

अन्य मॉडलों से तुलना

Gato 1.2B की तुलना अक्सर ओपनएआई के GPT-3 और एंथ्रोपिक के क्लॉड जैसे अन्य सामान्यवादी मॉडलों से की जाती है, लेकिन यह मल्टीमॉडल और एम्बॉडेड कार्यों पर अपने ध्यान में भिन्न है। शुद्ध भाषा मॉडल के विपरीत, Gato दृश्य और क्रिया डेटा को एकीकृत करता है, जो इसे कृत्रिम सामान्य बुद्धिमत्ता की ओर एक कदम बनाता है। इसका पैरामीटर गिनती कई समकालीन मॉडलों, जैसे GPT-3 के 175 अरब मापदंडों, से छोटी है, लेकिन यह अपने विशेष प्रशिक्षण के कारण कार्यों की एक संकीर्ण सीमा पर प्रतिस्पर्धात्मक प्रदर्शन प्राप्त करता है।

सीमाएँ और भविष्य की दिशाएँ

अपनी बहुमुखी प्रतिभा के बावजूद, Gato 1.2B की सीमाएँ हैं। यह लंबी-क्षितिज वाले कार्यों में संघर्ष करता है और छवियों और क्रियाओं के सावधानीपूर्वक टोकनाइज़ेशन की आवश्यकता होती है। इसका प्रदर्शन अपने प्रशिक्षण वितरण से बाहर के कार्यों पर घट जाता है। डीपमाइंड के शोधकर्ताओं ने मॉडल को बड़ा करने और सामान्यीकरण में सुधार के लिए अधिक विविध डेटा शामिल करने की खोज की है। यह मॉडल सुरक्षा और नियंत्रण के बारे में भी प्रश्न उठाता है, क्योंकि इसका उपयोग लाभकारी और हानिकारक दोनों अनुप्रयोगों के लिए किया जा सकता है। भविष्य के कार्यों में इसकी क्षमताओं को बढ़ाने के लिए मानव प्रतिक्रिया से सुदृढीकरण सीखना और पाठ्यक्रम सीखना को एकीकृत करना शामिल है।

स्वागत और प्रभाव

Gato 1.2B को मशीन लर्निंग समुदाय में कई डोमेन के लिए एकल एजेंट के महत्वाकांक्षी लक्ष्य के लिए अच्छी तरह से प्राप्त किया गया था। इसने सामान्य-उद्देश्यीय AI के मार्ग और मल्टीमॉडल प्रशिक्षण के महत्व के बारे में चर्चाएँ शुरू कीं। मॉडल के कोड और वज़न पूरी तरह से ओपन-सोर्स नहीं थे, लेकिन इसकी वास्तुकला और प्रशिक्षण विवरण एक तकनीकी रिपोर्ट में प्रकाशित किए गए थे। इसने सामान्यवादी एजेंटों पर बाद के शोध को प्रभावित किया है, जिसमें RT-2 और SIMA जैसे डीपमाइंड के बाद के मॉडल शामिल हैं।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:neural-network·transformer·multimodal-ai·deepmind
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास