Gato 1.2B गूगल डीपमाइंड द्वारा विकसित 1.2 अरब मापदंडों वाला एक तंत्रिका नेटवर्क मॉडल है। यह एक ट्रांसफॉर्मर-आधारित भाषा मॉडल है जिसे टेक्स्ट निर्माण, छवि कैप्शनिंग, और रोबोटिक नियंत्रण सहित कई कार्यों को संभालने के लिए डिज़ाइन किया गया है, जिसमें वज़न का एक ही सेट उपयोग होता है। यह मॉडल 2022 में डीपमाइंड के एक सामान्य-उद्देश्यीय एजेंट बनाने के प्रयास के हिस्से के रूप में पेश किया गया था जो विभिन्न वातावरणों में सीख और कार्य कर सके।
Gato 1.2B की वास्तुकला एनकोडर-डिकोडर डिज़ाइन का पालन करती है, हालांकि यह मुख्य रूप से एक अनुक्रम-से-अनुक्रम मॉडल के रूप में कार्य करता है। यह इनपुट को टोकन अनुक्रमों के रूप में संसाधित करता है, जहां टेक्स्ट, छवियाँ, और क्रियाएँ अलग-अलग टोकन में परिवर्तित होती हैं। यह एकीकृत प्रतिनिधित्व मॉडल को कार्य-विशिष्ट संशोधनों के बिना विधाओं के बीच स्विच करने की अनुमति देता है। मॉडल चर-लंबाई इनपुट को संभालने के लिए मल्टी-हेड अटेंशन तंत्र और स्थितीय एन्कोडिंग का उपयोग करता है।
प्रशिक्षण और डेटा
Gato 1.2B को पुस्तकों और वेब पेजों के टेक्स्ट, सार्वजनिक डेटासेट की छवियों, और सिम्युलेटेड तथा वास्तविक दुनिया के रोबोटिक वातावरणों से प्रदर्शन डेटा सहित एक विविध डेटासेट पर प्रशिक्षित किया गया था। प्रशिक्षण में टेक्स्ट और छवि टोकन के लिए क्रॉस-एंट्रॉपी लॉस और क्रिया टोकन के लिए एक अलग लॉस का उपयोग किया गया। मॉडल को एडम ऑप्टिमाइज़र और एक सीखने की दर अनुसूची के साथ अनुकूलित किया गया था जिसमें वार्मअप और कोसाइन क्षय शामिल था। प्रशिक्षण गूगल क्लाउड TPU पर किया गया था, जिसमें लगभग 1.1e21 FLOPs का कुल कंप्यूट बजट था।
क्षमताएँ और प्रदर्शन
Gato 1.2B 600 से अधिक कार्यों में दक्षता प्रदर्शित करता है, जिसमें एटारी गेम खेलना, कैप्शन उत्पन्न करना, प्रश्नों के उत्तर देना, और रोबोटिक बांह को नियंत्रित करना शामिल है। मूल्यांकन में, इसने एटारी सुइट पर 50% का औसत स्कोर प्राप्त किया, जो पिछले सामान्यवादी मॉडलों से बेहतर था लेकिन विशेषज्ञ एजेंटों से कम था। रोबोटिक नियंत्रण के लिए, मॉडल का परीक्षण ब्लॉकों को ढेर करने और वस्तुओं को रखने जैसे वास्तविक दुनिया के कार्यों पर किया गया, जिसमें कुछ मामलों में विशेषज्ञ नीतियों के बराबर सफलता दर प्राप्त हुई। विभिन्न कार्यों में सामान्यीकरण करने की मॉडल की क्षमता को इसके बड़े पैमाने पर प्रीट्रेनिंग और साझा टोकन शब्दावली के लिए जिम्मेदार ठहराया गया है।
अन्य मॉडलों से तुलना
Gato 1.2B की तुलना अक्सर ओपनएआई के GPT-3 और एंथ्रोपिक के क्लॉड जैसे अन्य सामान्यवादी मॉडलों से की जाती है, लेकिन यह मल्टीमॉडल और एम्बॉडेड कार्यों पर अपने ध्यान में भिन्न है। शुद्ध भाषा मॉडल के विपरीत, Gato दृश्य और क्रिया डेटा को एकीकृत करता है, जो इसे कृत्रिम सामान्य बुद्धिमत्ता की ओर एक कदम बनाता है। इसका पैरामीटर गिनती कई समकालीन मॉडलों, जैसे GPT-3 के 175 अरब मापदंडों, से छोटी है, लेकिन यह अपने विशेष प्रशिक्षण के कारण कार्यों की एक संकीर्ण सीमा पर प्रतिस्पर्धात्मक प्रदर्शन प्राप्त करता है।
सीमाएँ और भविष्य की दिशाएँ
अपनी बहुमुखी प्रतिभा के बावजूद, Gato 1.2B की सीमाएँ हैं। यह लंबी-क्षितिज वाले कार्यों में संघर्ष करता है और छवियों और क्रियाओं के सावधानीपूर्वक टोकनाइज़ेशन की आवश्यकता होती है। इसका प्रदर्शन अपने प्रशिक्षण वितरण से बाहर के कार्यों पर घट जाता है। डीपमाइंड के शोधकर्ताओं ने मॉडल को बड़ा करने और सामान्यीकरण में सुधार के लिए अधिक विविध डेटा शामिल करने की खोज की है। यह मॉडल सुरक्षा और नियंत्रण के बारे में भी प्रश्न उठाता है, क्योंकि इसका उपयोग लाभकारी और हानिकारक दोनों अनुप्रयोगों के लिए किया जा सकता है। भविष्य के कार्यों में इसकी क्षमताओं को बढ़ाने के लिए मानव प्रतिक्रिया से सुदृढीकरण सीखना और पाठ्यक्रम सीखना को एकीकृत करना शामिल है।
स्वागत और प्रभाव
Gato 1.2B को मशीन लर्निंग समुदाय में कई डोमेन के लिए एकल एजेंट के महत्वाकांक्षी लक्ष्य के लिए अच्छी तरह से प्राप्त किया गया था। इसने सामान्य-उद्देश्यीय AI के मार्ग और मल्टीमॉडल प्रशिक्षण के महत्व के बारे में चर्चाएँ शुरू कीं। मॉडल के कोड और वज़न पूरी तरह से ओपन-सोर्स नहीं थे, लेकिन इसकी वास्तुकला और प्रशिक्षण विवरण एक तकनीकी रिपोर्ट में प्रकाशित किए गए थे। इसने सामान्यवादी एजेंटों पर बाद के शोध को प्रभावित किया है, जिसमें RT-2 और SIMA जैसे डीपमाइंड के बाद के मॉडल शामिल हैं।