अंग्रेज़ी से अनुवादित

Gato एक सामान्यवादी AI एजेंट है जिसे Google DeepMind द्वारा विकसित किया गया है, जो एकल ट्रांसफॉर्मर-आधारित तंत्रिका नेटवर्क का उपयोग करके पाठ, दृष्टि और नियंत्रण क्षेत्रों में 604 विविध कार्य करता है। 2022 में जारी, यह बहुमुखी कृत्रिम सामान्य बुद्धिमत्ता की दिशा में एक कदम का प्रतिनिधित्व करता है।

गाटो एक सामान्य-उद्देश्यीय कृत्रिम बुद्धिमत्ता प्रणाली है जिसे गूगल डीपमाइंड द्वारा विकसित किया गया था, जिसकी घोषणा पहली बार 2022 में की गई थी। यह एक एकल तंत्रिका नेटवर्क है जिसे 604 अलग-अलग कार्यों को करने के लिए प्रशिक्षित किया गया है, जिसमें पाठ निर्माण, छवि पहचान, रोबोटिक नियंत्रण और गेम खेलना शामिल है। गाटो का डिज़ाइन ट्रांसफार्मर वास्तुकला पर आधारित है, जो बड़े भाषा मॉडल में उपयोग की जाने वाली same नींव है, लेकिन इसे मल्टीमॉडल इनपुट और आउटपुट - जिसमें पाठ, छवियाँ और निरंतर नियंत्रण संकेत शामिल हैं - को संभालने के लिए विस्तारित किया गया है।

इस प्रणाली को इस प्रदर्शन के रूप में पेश किया गया था कि एक एकल मॉडल, बिना कार्य-विशिष्ट फाइन-ट्यूनिंग के, विभिन्न डोमेनों में सक्षम प्रदर्शन प्राप्त कर सकता है। हालाँकि यह हर कार्य में विशेष प्रणालियों से आगे नहीं निकलता, गाटो ने एआई अनुसंधान में सामान्यवादी एजेंटों की क्षमता को उजागर किया, जो अधिक लचीले और अनुकूलनीय मॉडल की ओर व्यापक प्रयासों के साथ संरेखित है।

वास्तुकला और प्रशिक्षण

गाटो की वास्तुकला एक ट्रांसफार्मर-आधारित अनुक्रम मॉडल है जो विभिन्न मोडैलिटी से टोकन संसाधित करता है। छवियों जैसे इनपुट को एक विज़न एन्कोडर के माध्यम से पारित किया जाता है, जबकि पाठ और असतत क्रियाओं को सीधे टोकनाइज़ किया जाता है। रोबोटों के जोड़ टॉर्क जैसे निरंतर नियंत्रण आउटपुट को डिब्बों में विभाजित किया जाता है। मॉडल को एक मानक मशीन लर्निंग उद्देश्य - एक अनुक्रम में अगले टोकन की भविष्यवाणी करना - का उपयोग करके सभी कार्य प्रकारों पर प्रशिक्षित किया जाता है।

प्रशिक्षण डेटा विभिन्न स्रोतों से आया, जिसमें पाठ कोर्पोरा, छवि डेटासेट, गेमप्ले रिकॉर्डिंग और वास्तविक दुनिया के रोबोटिक हेरफेर प्रदर्शन शामिल हैं। मॉडल में लगभग 1.2 बिलियन पैरामीटर हैं, जो इसे समकालीन बड़े भाषा मॉडल की तुलना में अपेक्षाकृत छोटा बनाता है। प्रशिक्षण में एक एकल TPUv3 पॉड का उपयोग किया गया, जो डेटा और कंप्यूट उपयोग में दक्षता को दर्शाता है।

क्षमताएँ और कार्य

गाटो का मूल्यांकन 604 कार्यों पर किया गया, जिसमें निम्न श्रेणियाँ शामिल हैं:

  • पाठ कार्य: प्रश्नों का उत्तर देना, सारांशीकरण और संवाद निर्माण।
  • दृष्टि कार्य: छवि कैप्शनिंग और वस्तु पहचान।
  • गेम खेलना: अटारी गेम और शतरंज वातावरण, शौकिया-स्तर का प्रदर्शन प्राप्त करना।
  • रोबोटिक्स: ब्लॉकों को ढेर करने और वस्तुओं में हेरफेर करने के लिए एक वास्तविक रोबोट भुजा को नियंत्रित करना।

मॉडल ने सकारात्मक स्थानांतरण का प्रदर्शन किया, जिसका अर्थ है कि एक सेट के कार्यों पर प्रशिक्षण ने दूसरों पर प्रदर्शन में सुधार किया। उदाहरण के लिए, पाठ और छवि डेटा के संपर्क ने रोबोटिक नियंत्रण कार्यों में मदद की, यह सुझाव देते हुए कि मोडैलिटी के पार साझा प्रतिनिधित्व लाभकारी हैं।

महत्व और स्वीकृति

गाटो अपनी गहराई के बजाय चौड़ाई के लिए उल्लेखनीय था। इसने अधिकांश कार्यों पर विशेषज्ञ प्रदर्शन के 50% या उससे अधिक स्तर पर प्रदर्शन किया, एक बेंचमार्क जो शोधकर्ताओं ने सामान्यवादी क्षमता को मापने के लिए उपयोग किया। प्रणाली को कृत्रिम सामान्य बुद्धिमत्ता की ओर एक कदम के रूप में देखा गया, हालाँकि विशेषज्ञों ने नोट किया कि इसमें समर्पित मॉडलों की गहरी विशेषज्ञता की कमी थी।

आलोचकों ने बताया कि व्यक्तिगत कार्यों पर गाटो का प्रदर्शन अक्सर अत्याधुनिक प्रणालियों से नीचे था, और 'सामान्यवादी' की धारणा कार्यों के निश्चित सेट द्वारा सीमित थी। फिर भी, इसने जनरेटिव एआई और मल्टी-टास्क लर्निंग में बाद के अनुसंधान को प्रभावित किया, विशेष रूप से डीपमाइंड और व्यापक एआई समुदाय के भीतर।

अन्य मॉडलों से संबंध

गाटो बड़े भाषा मॉडल के साथ वैचारिक जड़ें साझा करता है जैसे कि ओपनएआई और एंथ्रोपिक से, लेकिन नियंत्रण और मल्टीमॉडल एकीकरण पर अपने स्पष्ट ध्यान में भिन्न है। शुद्ध पाठ मॉडल के विपरीत, गाटो भौतिक और सिम्युलेटेड वातावरण के साथ बातचीत कर सकता है, जिससे यह एम्बोडेड एआई प्रणालियों के करीब आता है। यह डीप लर्निंग में विभिन्न कार्यों को एक ही वास्तुकला के तहत एकीकृत करने के प्रयासों के समानांतर भी है, एक प्रवृत्ति जो बाद के मॉडलों के साथ जारी रही।

विरासत और भविष्य की दिशाएँ

गाटो की रिलीज़ ने सामान्यवादी एजेंटों के पैमाने के बारे में चर्चाएँ शुरू कीं। क्षेत्र में बाद के कार्यों ने बड़े मॉडल, अधिक विविध कार्य सेट और बेहतर प्रशिक्षण तकनीकों का पता लगाया है। हालाँकि गाटो को स्वयं व्यावसायिक रूप से तैनात नहीं किया गया था, इसके सिद्धांतों ने बाद की डीपमाइंड परियोजनाओं को प्रभावित किया और कई मोडैलिटी संभालने वाले फाउंडेशन मॉडल की ओर व्यापक बदलाव में योगदान दिया।

2025 तक, सैकड़ों कार्य करने वाले एक एकल मॉडल की अवधारणा एक सक्रिय शोध क्षेत्र बनी हुई है, जिसमें गाटो एक प्रारंभिक प्रमाण के रूप में कार्य करता है। इसकी विरासत इस प्रदर्शन में निहित है कि एकीकृत वास्तुकलाएँ डोमेनों के पार उचित प्रदर्शन प्राप्त कर सकती हैं, जो अधिक सक्षम सामान्यवादी प्रणालियों के लिए मार्ग प्रशस्त करती है।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:artificial-intelligence·deep-learning·google-deepmind·transformer
इस पृष्ठ को अंतिम बार संपादित किया गया 7 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास