अंग्रेज़ी से अनुवादित

Gemini, Google DeepMind का मल्टीमॉडल बड़े भाषा मॉडलों का परिवार है, जिसकी घोषणा 6 दिसंबर, 2023 को की गई थी, और यह LaMDA और PaLM 2 का उत्तराधिकारी है। यह Gemini चैटबॉट को शक्ति प्रदान करता है और इसमें Pro, Flash, और Nano जैसे मॉडल शामिल हैं।

जेमिनी, गूगल डीपमाइंड (Google DeepMind) द्वारा विकसित मल्टीमॉडल लार्ज लैंग्वेज मॉडल (एलएलएम) का एक परिवार है, जो गूगल की एक सहायक कंपनी है। यह गूगल के पहले के मॉडलों LaMDA और PaLM 2 के उत्तराधिकारी के रूप में कार्य करता है। जेमिनी परिवार में कई प्रकार शामिल हैं, जैसे जेमिनी प्रो, जेमिनी डीप थिंक, जेमिनी फ्लैश, और जेमिनी फ्लैश लाइट, और यह जेमिनी चैटबॉट को शक्ति प्रदान करता है। जेमिनी नाम जेमिनी राशि चिन्ह को संदर्भित करता है और गूगल ब्रेन और डीपमाइंड के विलय के साथ-साथ नासा के प्रोजेक्ट जेमिनी की ओर भी संकेत करता है। 6 दिसंबर, 2023 को घोषित, जेमिनी को एक साथ कई प्रकार के डेटा संसाधित करने के लिए डिज़ाइन किया गया था, जिसमें टेक्स्ट, चित्र, ऑडियो, वीडियो और कंप्यूटर कोड शामिल हैं, जो इसे कई टेक्स्ट-केवल पूर्ववर्तियों से अलग करता है।

जेमिनी का विकास जनरेटिव एआई के क्षेत्र में प्रतिस्पर्धा करने के गूगल के प्रयासों में एक महत्वपूर्ण कदम था, विशेष रूप से OpenAI के GPT-4 और अन्य बड़े भाषा मॉडलों के खिलाफ। गूगल ने जेमिनी को अपना "सबसे बड़ा और सबसे सक्षम एआई मॉडल" बताया, जिसकी क्षमताएं टेक्स्ट निर्माण से परे हैं, जिसमें छवि समझ और निर्माण, और रोबोटिक्स के साथ संभावित एकीकरण शामिल है। मॉडल को गूगल के टेन्सर प्रोसेसिंग यूनिट (टीपीयू) पर प्रशिक्षित किया गया था और शुरू में यह केवल अंग्रेजी में उपलब्ध था, जिसका चरणबद्ध रोलआउट गूगल उत्पादों और सेवाओं में किया गया था।

विकास

गूगल ने पहली बार 10 मई, 2023 को Google I/O मुख्य भाषण के दौरान जेमिनी की घोषणा की, जिसमें सीईओ सुंदर पिचाई ने इसे PaLM 2 के अधिक शक्तिशाली उत्तराधिकारी के रूप में वर्णित किया, जिसे उसी कार्यक्रम में अनावरण किया गया था। उस समय, जेमिनी अभी भी शुरुआती विकास में था, लेकिन यह पहले से ही अपने मल्टीमॉडल डिज़ाइन के लिए उल्लेखनीय था, जो इसे कई मौजूदा एलएलएम से अलग करता था जो मुख्य रूप से टेक्स्ट कॉर्पोरा पर निर्भर थे। मॉडल को डीपमाइंड और गूगल ब्रेन के बीच एक सहयोग के रूप में विकसित किया गया था, दो एआई अनुसंधान समूह जिन्हें अप्रैल 2023 में गूगल डीपमाइंड में विलय कर दिया गया था।

डीपमाइंड के सीईओ डेमिस हसाबिस ने वायर्ड के साथ एक साक्षात्कार में जेमिनी की क्षमता पर प्रकाश डाला, यह सुझाव देते हुए कि यह OpenAI के ChatGPT को पीछे छोड़ सकता है, जो GPT-4 पर चलता है। हसाबिस ने अल्फागो के साथ डीपमाइंड के अनुभव पर आकर्षित किया, वह कार्यक्रम जिसने 2016 में गो चैंपियन ली सेडोल को हराया था, और संकेत दिया कि जेमिनी अल्फागो की ताकत को अन्य गूगल-डीपमाइंड एलएलएम के साथ जोड़ देगा। अगस्त 2023 में, द इंफॉर्मेशन ने बताया कि गूगल का लक्ष्य 2023 के अंत तक जेमिनी लॉन्च करना था, जिसमें संवादात्मक टेक्स्ट क्षमताओं को एआई-संचालित छवि निर्माण के साथ एकीकृत करने की योजना थी, जिससे प्रासंगिक छवि निर्माण और व्यापक उपयोग के मामले सक्षम हो सकें।

गूगल के सह-संस्थापक सर्गेई ब्रिन को जेमिनी के विकास में सहायता के लिए सेवानिवृत्ति से बाहर लाया गया था, जो गूगल ब्रेन और डीपमाइंड के सैकड़ों इंजीनियरों के साथ काम कर रहे थे। ब्रिन को बाद में परियोजना के "मुख्य योगदानकर्ता" के रूप में श्रेय दिया गया। चूंकि जेमिनी को YouTube वीडियो के ट्रांसक्रिप्ट पर प्रशिक्षित किया गया था, इसलिए गूगल ने संभावित कॉपीराइट सामग्री को फ़िल्टर करने के लिए वकीलों को शामिल किया। विकास प्रक्रिया में व्यापक सुरक्षा परीक्षण भी शामिल था, क्योंकि गूगल ने कहा था कि जिम्मेदार तैनाती सुनिश्चित करने के लिए जेमिनी को 2024 तक व्यापक रूप से जारी नहीं किया जाएगा।

जेमिनी के आसन्न लॉन्च के जवाब में, OpenAI ने GPT-4 में मल्टीमॉडल सुविधाओं को एकीकृत करने पर अपना काम तेज कर दिया। सितंबर 2023 तक, कई कंपनियों को जेमिनी के शुरुआती संस्करण तक शुरुआती पहुंच दी गई थी, जिसे गूगल ने अपनी Google Cloud Vertex AI सेवा के माध्यम से पेश करने की योजना बनाई थी। मॉडल को कोडिंग सहायक स्थान में माइक्रोसॉफ्ट के GitHub Copilot के साथ प्रतिस्पर्धा करने के लिए भी तैनात किया गया था।

लॉन्च

6 दिसंबर, 2023 को, सुंदर पिचाई और डेमिस हसाबिस ने एक आभासी संवाददाता सम्मेलन में "जेमिनी 1.0" की घोषणा की। प्रारंभिक रिलीज़ में तीन मॉडल शामिल थे: जेमिनी अल्ट्रा, "अत्यधिक जटिल कार्यों" के लिए डिज़ाइन किया गया; जेमिनी प्रो, "विभिन्न प्रकार के कार्यों" के लिए; और जेमिनी नैनो, "ऑन-डिवाइस कार्यों" के लिए। लॉन्च के समय, जेमिनी प्रो और नैनो को क्रमशः बार्ड (गूगल का चैटबॉट) और पिक्सेल 8 प्रो स्मार्टफोन में एकीकृत किया गया था। जेमिनी अल्ट्रा को "बार्ड एडवांस्ड" को शक्ति देने और 2024 की शुरुआत में डेवलपर्स के लिए उपलब्ध होने की योजना थी। गूगल ने जेमिनी को खोज, विज्ञापन, क्रोम, Google Workspace पर डुएट एआई और अल्फाकोड 2 में शामिल करने की भी योजना बनाई।

जेमिनी शुरू में केवल अंग्रेजी में उपलब्ध था। गूगल ने इसे अपना "सबसे बड़ा और सबसे सक्षम एआई मॉडल" बताया, जिसे मानव व्यवहार का अनुकरण करने के लिए डिज़ाइन किया गया था। कंपनी ने जोर दिया कि "व्यापक सुरक्षा परीक्षण" की आवश्यकता के कारण जेमिनी अगले वर्ष तक व्यापक रूप से उपलब्ध नहीं होगा। जेमिनी को गूगल के टीपीयू पर प्रशिक्षित और संचालित किया गया था, और यह नाम डीपमाइंड-गूगल ब्रेन विलय के साथ-साथ नासा के प्रोजेक्ट जेमिनी को संदर्भित करता था।

जेमिनी अल्ट्रा ने कथित तौर पर कई उद्योग बेंचमार्क पर GPT-4, एंथ्रोपिक के क्लॉड 2, इन्फ्लेक्शन एआई के इन्फ्लेक्शन-2, मेटा के LLaMA 2, और xAI के ग्रॉक 1 सहित कई प्रतिस्पर्धी मॉडलों को पीछे छोड़ दिया। जेमिनी प्रो को GPT-3.5 से बेहतर प्रदर्शन करने के लिए कहा गया था। विशेष रूप से, जेमिनी अल्ट्रा पहला भाषा मॉडल था जिसने 57-विषय वाले मैसिव मल्टीटास्क लैंग्वेज अंडरस्टैंडिंग (एमएमएलयू) परीक्षण में मानव विशेषज्ञों को पीछे छोड़ दिया, जिसमें 90% का स्कोर हासिल किया। जेमिनी प्रो को 13 दिसंबर, 2023 को एआई स्टूडियो और वर्टेक्स एआई पर गूगल क्लाउड ग्राहकों के लिए उपलब्ध कराया गया था, और जेमिनी नैनो को बाद में एंड्रॉइड डेवलपर्स के लिए उपलब्ध कराया गया था।

हसाबिस ने यह भी खुलासा किया कि डीपमाइंड यह पता लगा रहा था कि दुनिया के साथ भौतिक बातचीत को सक्षम करने के लिए जेमिनी को रोबोटिक्स के साथ कैसे जोड़ा जा सकता है। अक्टूबर 2023 में राष्ट्रपति जो बिडेन द्वारा हस्ताक्षरित अमेरिकी कार्यकारी आदेश के अनुरूप, गूगल ने कहा कि वह जेमिनी अल्ट्रा के परीक्षण परिणाम अमेरिकी संघीय सरकार के साथ साझा करेगा। इसी तरह, गूगल ने नवंबर 2023 में ब्लेचली पार्क में एआई सेफ्टी समिट के सिद्धांतों के साथ संरेखित करने के लिए यूके सरकार के साथ बातचीत की।

जून 2025 में, गूगल ने जेमिनी सीएलआई पेश किया, जो एक ओपन-सोर्स एआई एजेंट है जो जेमिनी की क्षमताओं को टर्मिनल तक लाता है, जो व्यक्तिगत डेवलपर्स के लिए उदार मुफ्त उपयोग सीमा के साथ कोडिंग, स्वचालन और समस्या-समाधान सुविधाएं प्रदान करता है।

अपडेट

जनवरी 2024 में, गूगल ने जेमिनी नैनो और जेमिनी प्रो को गैलेक्सी S24 स्मार्टफोन लाइनअप में एकीकृत करने के लिए सैमसंग के साथ साझेदारी की। अगले महीने, बार्ड और डुएट एआई को जेमिनी ब्रांड के तहत एकीकृत किया गया, और "जेमिनी एडवांस्ड विद अल्ट्रा 1.0" को Google One सदस्यता सेवा के एक नए "एआई प्रीमियम" स्तर के माध्यम से जारी किया गया। जेमिनी प्रो को भी वैश्विक लॉन्च मिला।

फरवरी 2024 में, गूगल ने जेमिनी 1.5 लॉन्च किया, जिसे 1.0 अल्ट्रा से अधिक शक्तिशाली और सक्षम बताया गया। परिवर्तनों में एक नया आर्किटेक्चर, एक मिश्रण-ऑफ-एक्सपर्ट्स दृष्टिकोण, और एक बड़ा एक-मिलियन-टोकन संदर्भ विंडो शामिल था। उसी महीने, गूगल ने जेम्मा की शुरुआत की, जो जेमिनी मॉडल की एक छोटी, मुफ्त और ओपन-सोर्स श्रृंखला है। कई प्रकाशनों ने इसे मेटा और अन्य लोगों के अपने एआई मॉडल को ओपन-सोर्स करने की प्रतिक्रिया के रूप में वर्णित किया, और गूगल के अपने एआई को मालिकाना रखने के पिछले अभ्यास से उलट के रूप में।

गूगल ने 14 मई, 2024 को Google I/O मुख्य भाषण में एक अतिरिक्त मॉडल, जेमिनी 1.5 फ्लैश की घोषणा की। उसी कार्यक्रम में, गूगल ने अपने "बिल्ट-इन एआई" आर्किटेक्चर के माध्यम से जेमिनी नैनो के डेस्कटॉप-अनुकूलित बिल्ड को सीधे Google Chrome ब्राउज़र में एकीकृत करने की योजना की घोषणा की, जो प्रयोगात्मक एपीआई जैसे प्रॉम्प्ट एपीआई ("window.ai") के माध्यम से वेब डेवलपर्स को स्थानीय प्रसंस्करण क्षमताओं को उजागर करता है।

दो अद्यतन जेमिनी मॉडल, जेमिनी-1.5-प्रो-002 और जेमिनी-1.5-फ्लैश-002, 24 सितंबर, 2024 को जारी किए गए थे।

11 दिसंबर, 2024 को, गूगल ने नए जेमिनी 2.0 फ्लैश प्रयोगात्मक मॉडल की घोषणा की। सुविधाओं में वास्तविक समय ऑडियो और वीडियो इंटरैक्शन के लिए एक मल्टीमॉडल लाइव एपीआई, देशी छवि और नियंत्रणीय टेक्स्ट-टू-स्पीच पीढ़ी (वॉटरमार्किंग के साथ), और एकीकृत Google खोज शामिल हैं। इसने तर्क और कोडिंग क्षमताओं में सुधार भी पेश किया।

आर्किटेक्चर और प्रशिक्षण

जेमिनी एक Transformer (architecture) आर्किटेक्चर पर बनाया गया है, जो कई आधुनिक Large language model की नींव है। मॉडल बाद के संस्करणों में एक मिश्रण-ऑफ-एक्सपर्ट्स दृष्टिकोण का उपयोग करता है, जिससे प्रत्येक कार्य के लिए केवल प्रासंगिक उप-नेटवर्क को सक्रिय करके कुशलता से स्केल करने की अनुमति मिलती है। प्रशिक्षण में विशाल डेटासेट शामिल थे, जिनमें टेक्स्ट, चित्र, ऑडियो, वीडियो और कोड शामिल थे, जो विभिन्न रिपॉजिटरी से प्राप्त किए गए थे, जिनमें YouTube ट्रांसक्रिप्ट शामिल थे, जिन्हें कॉपीराइट अनुपालन के लिए सावधानीपूर्वक फ़िल्टरिंग की आवश्यकता थी।

मॉडल को गूगल के टीपीयू पर प्रशिक्षित किया गया था, जो कस्टम Artificial intelligence त्वरक हैं। इस बुनियादी ढांचे ने जेमिनी को बड़े पैमाने पर प्रशिक्षण रन संभालने में सक्षम बनाया, जो एमएमएलयू जैसे बेंचमार्क पर इसके प्रदर्शन में योगदान देता है। मल्टीमॉडल प्रशिक्षण दृष्टिकोण जेमिनी को विभिन्न तौर-तरीकों में सामग्री संसाधित करने और उत्पन्न करने की अनुमति देता है, जिससे यह टेक्स्ट निर्माण से लेकर छवि समझ तक अनुप्रयोगों के लिए बहुमुखी बन जाता है।

क्षमताएं और प्रदर्शन

जेमिनी की क्षमताएं कई डोमेन में फैली हुई हैं। यह जटिल तर्क कार्य कर सकता है, कोड उत्पन्न कर सकता है, छवियों को समझ और उत्पन्न कर सकता है, और ऑडियो और वीडियो संसाधित कर सकता है। उद्योग बेंचमार्क पर मॉडल का प्रदर्शन एक प्रमुख विक्रय बिंदु रहा है। एमएमएलयू पर जेमिनी अल्ट्रा का 90% स्कोर, जहां इसने मानव विशेषज्ञों को पीछे छोड़ दिया, एक उल्लेखनीय उपलब्धि थी, जो 57 विषयों में इसके व्यापक ज्ञान को उजागर करती है।

बेंचमार्क के अलावा, जेमिनी को विभिन्न गूगल उत्पादों, जैसे खोज, विज्ञापन और क्रोम में एकीकृत किया गया है, जिससे उनकी एआई-संचालित सुविधाओं में वृद्धि हुई है। लंबे संदर्भ विंडो को संभालने की मॉडल की क्षमता, जेमिनी 1.5 में एक मिलियन टोकन तक, इसे बड़े दस्तावेज़ या संपूर्ण कोडबेस संसाधित करने की अनुमति देती है, जिससे यह डेवलपर्स और शोधकर्ताओं के लिए उपयोगी हो जाता है।

एकीकरण और पारिस्थितिकी तंत्र

जेमिनी गूगल की क्लाउड सेवाओं, जिसमें Google Cloud और वर्टेक्स एआई शामिल हैं, में एकीकृत है, जिससे उद्यमों को इसकी क्षमताओं तक पहुंचने की अनुमति मिलती है। यह जेमिनी चैटबॉट को भी शक्ति प्रदान करता है, जिसे फरवरी 2024 में बार्ड से पुनः ब्रांड किया गया था। जेमिनी नैनो के माध्यम से एंड्रॉइड डिवाइसों पर मॉडल की उपलब्धता, ऑन-डिवाइस एआई प्रोसेसिंग को सक्षम बनाती है, जो गोपनीयता और विलंबता-संवेदनशील अनुप्रयोगों के लिए महत्वपूर्ण है।

गूगल ने जेमिनी को साझेदारी के माध्यम से भी उपलब्ध कराया है, जैसे कि गैलेक्सी S24 के लिए Samsung Electronics के साथ, और जेम्मा जैसे ओपन-सोर्स रिलीज़ के माध्यम से, जो छोटे, अधिक सुलभ मॉडल हैं। 2025 में पेश किया गया जेमिनी सीएलआई, डेवलपर्स के लिए एक कमांड-लाइन इंटरफ़ेस प्रदान करता है, जो इसके पारिस्थितिकी तंत्र का और विस्तार करता है।

स्वागत और प्रभाव

जेमिनी को इसकी मल्टीमॉडल क्षमताओं और मजबूत बेंचमार्क प्रदर्शन के लिए एआई समुदाय में अच्छी तरह से प्राप्त हुआ है। हालांकि, इसे सुरक्षा, कॉपीराइट मुद्दों और बड़े मॉडलों के प्रशिक्षण के पर्यावरणीय प्रभाव के संबंध में भी जांच का सामना करना पड़ा है। सरकारों के साथ परीक्षण परिणाम साझा करने के गूगल के निर्णय एआई विनियमन और सुरक्षा के बारे में व्यापक चिंताओं को दर्शाते हैं।

जेमिनी के लॉन्च ने एआई उद्योग में प्रतिस्पर्धा तेज कर दी, जिससे OpenAI और Anthropic जैसे प्रतिद्वंद्वियों को अपने स्वयं के विकास में तेजी लाने के लिए प्रेरित किया। गूगल के उत्पादों में जेमिनी के एकीकरण ने बाजार प्रभुत्व और एआई तैनाती के नैतिक निहितार्थों के बारे में भी सवाल उठाए हैं।

भविष्य की दिशाएं

गूगल जेमिनी पर पुनरावृत्ति जारी रखता है, जेमिनी 2.0 फ्लैश प्रयोगात्मक जैसे अपडेट वास्तविक समय इंटरैक्शन और मल्टीमॉडल पीढ़ी पर ध्यान केंद्रित करने का संकेत देते हैं। रोबोटिक्स एकीकरण की खोज भौतिक एआई प्रणालियों में संभावित अनुप्रयोगों का सुझाव देती है। 2025 तक, जेमिनी से तर्क, दक्षता और सुरक्षा में सुधार पर चल रहे शोध के साथ और विकसित होने की उम्मीद है।

जेमिनी का विकास Generative AI में व्यापक रुझानों के साथ भी संरेखित करता है, जहां मॉडल अधिक मल्टीमॉडल और जटिल कार्यों को संभालने में सक्षम हो रहे हैं। टीपीयू में गूगल का निवेश और कस्टम चिप्स के लिए Broadcom के साथ इसकी साझेदारी एआई बुनियादी ढांचे को आगे बढ़ाने की अपनी प्रतिबद्धता को रेखांकित करती है।

यह भी देखें

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:artificial-intelligence·large-language-models·google-deepmind·multimodal-ai
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास