Gemini, Google DeepMind (Google की सहायक कंपनी) द्वारा विकसित मल्टीमॉडल लार्ज लैंग्वेज मॉडल (LLM) का एक परिवार है। 6 दिसंबर, 2023 को घोषित, Gemini, Google के पहले के मॉडल LaMDA और PaLM 2 के उत्तराधिकारी के रूप में कार्य करता है। मॉडल परिवार में Gemini Pro, Gemini Deep Think, Gemini Flash और Gemini Flash Lite शामिल हैं, और यह Gemini चैटबॉट को शक्ति प्रदान करता है। यह नाम Gemini राशि से लिया गया है, जो परियोजना की दोहरी प्रकृति का प्रतीक है, जिसमें Google Brain और DeepMind का विलय हुआ था। Gemini को एक साथ कई डेटा प्रकारों को संसाधित करने के लिए डिज़ाइन किया गया है, जिसमें टेक्स्ट, चित्र, ऑडियो, वीडियो और कंप्यूटर कोड शामिल हैं, जो इसे कई टेक्स्ट-ओनली पूर्ववर्तियों से अलग करता है।
विकास पृष्ठभूमि
Google ने पहली बार 10 मई, 2023 को Google I/O मुख्य भाषण के दौरान Gemini की घोषणा की, इसे PaLM 2 के अधिक शक्तिशाली उत्तराधिकारी के रूप में स्थापित किया, जिसे उसी कार्यक्रम में अनावरण किया गया था। Google के CEO सुंदर पिचाई ने कहा कि Gemini अभी भी अपने विकास के शुरुआती चरणों में था। केवल टेक्स्ट कॉर्पोरा पर प्रशिक्षित विशिष्ट लार्ज लैंग्वेज मॉडल के विपरीत, Gemini को शुरू से ही मल्टीमॉडल होने के लिए डिज़ाइन किया गया था, जिससे यह विविध इनपुट प्रकारों को एक साथ संभाल सके। विकास DeepMind और Google Brain के बीच एक सहयोग था, जिन्हें एक ही इकाई, Google DeepMind में विलय कर दिया गया था।
Wired के साथ एक साक्षात्कार में, DeepMind के CEO डेमिस हसाबिस ने Gemini की उन्नत क्षमताओं की प्रशंसा की, यह सुझाव देते हुए कि यह OpenAI के ChatGPT को पीछे छोड़ देगा, जो GPT-4 पर चलता है। हसाबिस ने DeepMind के AlphaGo प्रोग्राम की ताकत पर प्रकाश डाला, जिसने 2016 में गो चैंपियन ली सेडोल को हराकर दुनिया भर में ध्यान आकर्षित किया, यह कहते हुए कि Gemini AlphaGo की शक्ति को अन्य Google-DeepMind LLM के साथ जोड़ देगा। यह महत्वाकांक्षा ChatGPT और अपने स्वयं के पहले के Bard चैटबॉट की बढ़ती लोकप्रियता के लिए Google की आक्रामक प्रतिक्रिया को दर्शाती है।
अगस्त 2023 में, The Information ने Gemini के लिए Google के रोडमैप को रेखांकित करते हुए एक रिपोर्ट प्रकाशित की, जिसमें 2023 के अंत का लक्षित लॉन्च तिथि का खुलासा किया गया। रिपोर्ट ने संकेत दिया कि Google वार्तालापीय टेक्स्ट क्षमताओं को कृत्रिम बुद्धिमत्ता-संचालित छवि निर्माण के साथ जोड़कर OpenAI और अन्य प्रतिस्पर्धियों को पीछे छोड़ने की उम्मीद करता है, जिससे प्रासंगिक चित्र और उपयोग के मामलों की एक व्यापक श्रृंखला की अनुमति मिलती है। Google के सह-संस्थापक सर्गेई ब्रिन को Google Brain और DeepMind के सैकड़ों इंजीनियरों के साथ विकास में सहायता करने के लिए सेवानिवृत्ति से वापस बुलाया गया था; बाद में उन्हें "मुख्य योगदानकर्ता" के रूप में श्रेय दिया गया। चूंकि Gemini को YouTube वीडियो के ट्रांसक्रिप्ट पर प्रशिक्षित किया गया था, इसलिए संभावित कॉपीराइट सामग्री को फ़िल्टर करने के लिए वकीलों को लाया गया था।
लॉन्च और प्रारंभिक मॉडल
6 दिसंबर, 2023 को, पिचाई और हसाबिस ने एक आभासी प्रेस कॉन्फ्रेंस में "Gemini 1.0" की घोषणा की। रिलीज़ में तीन मॉडल शामिल थे: Gemini Ultra, "अत्यधिक जटिल कार्यों" के लिए डिज़ाइन किया गया; Gemini Pro, "कार्यों की एक विस्तृत श्रृंखला" के लिए; और Gemini Nano, "ऑन-डिवाइस कार्यों" के लिए। लॉन्च के समय, Gemini Pro और Nano को क्रमशः Bard और Pixel 8 Pro स्मार्टफोन में एकीकृत किया गया था। Gemini Ultra को "Bard Advanced" को शक्ति देने और 2024 की शुरुआत में सॉफ्टवेयर डेवलपर्स के लिए उपलब्ध होने के लिए निर्धारित किया गया था। एकीकरण के लिए निर्धारित अन्य उत्पादों में Search, Ads, Chrome, Google Workspace पर Duet AI और AlphaCode 2 शामिल थे। प्रारंभिक रिलीज़ केवल अंग्रेजी में उपलब्ध थी।
Google ने Gemini को अपना "सबसे बड़ा और सबसे सक्षम AI मॉडल" बताया, जिसे मानव व्यवहार का अनुकरण करने के लिए डिज़ाइन किया गया है। कंपनी ने कहा कि "व्यापक सुरक्षा परीक्षण" की आवश्यकता के कारण Gemini को अगले वर्ष तक व्यापक रूप से उपलब्ध नहीं कराया जाएगा। Gemini को Google के Tensor Processing Units (TPU) पर प्रशिक्षित और संचालित किया गया था। यह नाम NASA के प्रोजेक्ट Gemini को भी संदर्भित करता है, जो DeepMind और Google Brain के विलय को दर्शाता है।
प्रदर्शन और बेंचमार्क
Gemini Ultra ने विभिन्न उद्योग बेंचमार्क पर GPT-4, Anthropic के Claude 2, Inflection AI के Inflection-2, Meta के LLaMA 2 और xAI के Grok 1 से बेहतर प्रदर्शन करने की सूचना दी थी। Gemini Pro को GPT-3.5 से बेहतर प्रदर्शन करने के लिए कहा गया था। विशेष रूप से, Gemini Ultra पहला भाषा मॉडल था जिसने 57-विषय Massive Multitask Language Understanding (MMLU) परीक्षण पर मानव विशेषज्ञों से बेहतर प्रदर्शन किया, 90% का स्कोर हासिल किया। इस बेंचमार्क परिणाम ने Gemini को Artificial intelligence और Large language model अनुसंधान के क्षेत्र में एक अग्रणी मॉडल के रूप में स्थापित किया।
Gemini Pro को 13 दिसंबर, 2023 को AI Studio और Vertex AI पर Google Cloud ग्राहकों के लिए उपलब्ध कराया गया था। Gemini Nano को बाद में Android डेवलपर्स के लिए उपलब्ध कराया गया। हसाबिस ने आगे खुलासा किया कि DeepMind यह पता लगा रहा था कि दुनिया के साथ शारीरिक रूप से बातचीत करने के लिए Gemini को रोबोटिक्स के साथ कैसे जोड़ा जा सकता है। अक्टूबर 2023 में अमेरिकी राष्ट्रपति जो बिडेन द्वारा हस्ताक्षरित एक कार्यकारी आदेश के अनुसार, Google ने कहा कि वह Gemini Ultra के परीक्षण परिणाम संघीय सरकार के साथ साझा करेगा। इसी तरह, कंपनी ने नवंबर 2023 में Bletchley Park में AI Safety Summit में निर्धारित सिद्धांतों का पालन करने के लिए यूनाइटेड किंगडम की सरकार के साथ चर्चा की।
Google उत्पादों के साथ एकीकरण
अपने लॉन्च के बाद, Gemini को Google के पारिस्थितिकी तंत्र में तेजी से एकीकृत किया गया। जनवरी 2024 में, Google ने Galaxy S24 स्मार्टफोन लाइनअप में Gemini Nano और Gemini Pro को एकीकृत करने के लिए Samsung के साथ साझेदारी की। अगले महीने, Bard और Duet AI को Gemini ब्रांड के तहत एकीकृत किया गया, जिसमें Google One सदस्यता सेवा के एक नए "AI Premium" स्तर के माध्यम से "Gemini Advanced with Ultra 1.0" जारी किया गया। Gemini Pro को भी वैश्विक लॉन्च मिला, जो अपनी प्रारंभिक अंग्रेजी-केवल उपलब्धता से विस्तारित हुआ।
फरवरी 2024 में, Google ने Gemini 1.5 लॉन्च किया, इसे 1.0 Ultra से अधिक शक्तिशाली और सक्षम बताया। परिवर्तनों में एक नया आर्किटेक्चर, एक मिश्रण-ऑफ-एक्सपर्ट्स दृष्टिकोण और एक बड़ा एक-मिलियन-टोकन संदर्भ विंडो शामिल था। उसी महीने, Google ने Gemma की शुरुआत की, जो Gemini मॉडल की एक छोटी, मुफ्त और ओपन-सोर्स रेंज है। कई प्रकाशनों ने इसे Meta और अन्य के अपने AI मॉडल को ओपन-सोर्स करने की प्रतिक्रिया के रूप में वर्णित किया, और Google के अपने AI को मालिकाना रखने के पिछले अभ्यास से एक उलटफेर के रूप में।
Google ने 14 मई को 2024 I/O मुख्य भाषण में एक अतिरिक्त मॉडल, Gemini 1.5 Flash की घोषणा की। उसी कार्यक्रम में, Google ने अपने "Built-in AI" आर्किटेक्चर के माध्यम से Gemini Nano के डेस्कटॉप-अनुकूलित बिल्ड को सीधे Google Chrome ब्राउज़र में एकीकृत करने की योजना की घोषणा की, जिससे वेब डेवलपर्स को Prompt API ("window.ai") जैसे प्रयोगात्मक API के माध्यम से स्थानीय प्रोसेसिंग क्षमताओं को उजागर किया जा सके।
बाद के अपडेट और मॉडल
दो अद्यतन Gemini मॉडल, Gemini-1.5-Pro-002 और Gemini-1.5-Flash-002, 24 सितंबर, 2024 को जारी किए गए थे। 11 दिसंबर, 2024 को, Google ने नया Gemini 2.0 Flash Experimental मॉडल घोषित किया। सुविधाओं में वास्तविक समय ऑडियो और वीडियो इंटरैक्शन के लिए एक Multimodal Live API, मूल छवि और नियंत्रणीय टेक्स्ट-टू-स्पीच पीढ़ी (वॉटरमार्किंग के साथ), और एकीकृत Google Search शामिल थे। यह पुनरावृत्ति मल्टीमॉडल AI क्षमताओं की सीमाओं को आगे बढ़ाती रही।
जून 2025 में, Google ने Gemini CLI पेश किया, एक ओपन-सोर्स AI एजेंट जो Gemini की क्षमताओं को सीधे टर्मिनल पर लाता है, जो उन्नत कोडिंग, स्वचालन और समस्या-समाधान सुविधाएँ प्रदान करता है, जिसमें व्यक्तिगत डेवलपर्स के लिए उदार मुफ्त उपयोग सीमाएँ हैं। इस कदम ने डेवलपर पहुंच और ओपन-सोर्स टूल के लिए Google की प्रतिबद्धता पर प्रकाश डाला।
प्रतिस्पर्धी स्थिति
Gemini की रिलीज़ Generative AI के प्रतिस्पर्धी परिदृश्य में एक महत्वपूर्ण घटना थी। Google ने Gemini को सीधे OpenAI, Anthropic और अन्य AI अनुसंधान संगठनों के मॉडल के खिलाफ स्थापित किया। मॉडल की मल्टीमॉडल क्षमताओं और मजबूत बेंचमार्क प्रदर्शन का उद्देश्य GPT-4 और अन्य प्रमुख LLM के प्रभुत्व को चुनौती देना था। Google का अपने विशाल उत्पाद पारिस्थितिकी तंत्र, जिसमें Search, Workspace और Android शामिल हैं, में Gemini का एकीकरण प्रतिस्पर्धियों पर एक वितरण लाभ प्रदान करता है।
Gemini के विकास में हार्डवेयर भागीदारों के साथ सहयोग भी शामिल था। Samsung के Galaxy S24 के साथ एकीकरण ने ऑन-डिवाइस AI के महत्व पर प्रकाश डाला, जबकि Google के TPU के उपयोग ने बड़े मॉडलों को प्रशिक्षित करने में विशेष हार्डवेयर की भूमिका को रेखांकित किया। प्रतिस्पर्धी गतिशीलता क्लाउड सेवाओं तक विस्तारित हुई, जिसमें Gemini Pro Google Cloud के Vertex AI पर उपलब्ध था, जो Amazon Web Services और Microsoft Azure की पेशकशों के साथ प्रतिस्पर्धा कर रहा था।
तकनीकी आर्किटेक्चर और अनुसंधान
Gemini का आर्किटेक्चर Deep learning और Transformer (architecture) मॉडल में प्रगति पर आधारित है। एक मल्टीमॉडल मॉडल के रूप में, यह विभिन्न मोडैलिटी में जानकारी को संसाधित करने और संबंधित करने के लिए Multi-Head Attention और Cross-Attention से तकनीकों को शामिल करता है। Gemini 1.5 में मिश्रण-ऑफ-एक्सपर्ट्स दृष्टिकोण अधिक कुशल स्केलिंग की अनुमति देता है, जो दिए गए कार्यों के लिए नेटवर्क के केवल प्रासंगिक हिस्सों को सक्रिय करता है। मॉडल के प्रशिक्षण में प्रदर्शन और संरेखण में सुधार के लिए Reinforcement Learning from AI Feedback (RLAIF) (AI फीडबैक से सुदृढीकरण सीखना) और Curriculum Learning जैसी तकनीकें शामिल होने की संभावना है।
Gemini के पीछे का अनुसंधान Machine learning के व्यापक क्षेत्र पर आधारित है, जिसमें MIT CSAIL, Stanford AI Lab और BAIR (Berkeley AI Research) जैसे संस्थानों के योगदान शामिल हैं। Google DeepMind की विरासत, जिसमें AlphaGo प्रोग्राम शामिल है, ने मॉडल के डिज़ाइन को सूचित किया, विशेष रूप से जटिल, बहु-चरणीय तर्क कार्यों को संभालने की इसकी क्षमता। विकास में डेमिस हसाबिस और AI समुदाय के अन्य प्रमुख व्यक्तियों जैसे शोधकर्ता भी शामिल थे।
सुरक्षा और शासन
Google ने Gemini के लिए सुरक्षा परीक्षण पर जोर दिया, व्यापक मूल्यांकन करने के लिए व्यापक उपलब्धता में देरी की। कंपनी ने AI पर अक्टूबर 2023 के कार्यकारी आदेश के बाद अमेरिकी संघीय सरकार के साथ परीक्षण परिणाम साझा करने की प्रतिबद्धता जताई। यूके सरकार के साथ चर्चा का उद्देश्य Bletchley Park में AI Safety Summit के सिद्धांतों के साथ संरेखित करना था। ये कदम Artificial intelligence की बढ़ती नियामक जांच और शक्तिशाली मॉडलों की जिम्मेदार तैनाती की आवश्यकता को दर्शाते हैं।
Pixel 8 Pro और Galaxy S24 जैसे उपभोक्ता उत्पादों में Gemini का एकीकरण गोपनीयता और ऑन-डिवाइस प्रोसेसिंग के बारे में सवाल उठाता है। Gemini Nano की स्थानीय प्रोसेसिंग क्षमताओं को डेटा ट्रांसमिशन को कम करने के लिए डिज़ाइन किया गया था, जो कुछ गोपनीयता चिंताओं को संबोधित करता है। हालांकि, मल्टीमॉडल AI की व्यापक तैनाती नैतिक उपयोग और संभावित सामाजिक प्रभावों के बारे में बहस को जारी रखती है।
भविष्य की दिशाएँ
2025 तक, Gemini नए मॉडल और सुविधाओं के साथ विकसित हो रहा है। Gemini CLI और ओपन-सोर्स Gemma मॉडल की शुरुआत AI क्षमताओं तक पहुंच को व्यापक बनाने की रणनीति का संकेत देती है। Google DeepMind में Google का चल रहा निवेश और Google Cloud के साथ इसका एकीकरण बताता है कि Gemini कंपनी की AI रणनीति का एक केंद्रीय स्तंभ बना रहेगा। भविष्य के विकास में तर्क में और सुधार, अधिक कुशल आर्किटेक्चर और रोबोटिक्स और भौतिक प्रणालियों के साथ गहरा एकीकरण शामिल हो सकता है, जैसा कि रोबोटिक्स के साथ Gemini के संयोजन पर हसाबिस की टिप्पणियों से संकेत मिलता है।
प्रतिस्पर्धी परिदृश्य गतिशील बना हुआ है, जिसमें OpenAI और Anthropic उन्नत मॉडल जारी करना जारी रखते हैं। Gemini की सफलता प्रदर्शन नेतृत्व बनाए रखने, मल्टीमॉडल क्षमताओं का विस्तार करने और AI के जटिल नियामक और नैतिक परिदृश्य को नेविगेट करने की इसकी क्षमता पर निर्भर करेगी। मॉडल का नाम, जो राशि चिन्ह की दोहरी प्रकृति को उजागर करता है, विविध AI क्षमताओं को एक एकल, शक्तिशाली प्रणाली में एकीकृत करने की परियोजना की महत्वाकांक्षा को उपयुक्त रूप से दर्शाता है।