Google Gemini 2.0 बहुविध (multimodal) बड़े भाषा मॉडलों का एक परिवार है, जिसे Google DeepMind द्वारा विकसित किया गया है। इसकी घोषणा 11 दिसंबर 2024 को Gemini 1.0 और 1.5 श्रृंखला के उत्तराधिकारी के रूप में की गई थी। पहला संस्करण, Gemini 2.0 Flash Experimental, ने मूल टूल उपयोग और बहुविध आउटपुट पेश किया, जिससे मॉडल बाहरी अनुप्रयोगों के साथ बातचीत कर सकता था और सीधे चित्र तथा ऑडियो उत्पन्न कर सकता था। इसे एक "एजेंटिक" (agentic) AI के रूप में स्थापित किया गया था, जिसे न्यूनतम मानवीय निगरानी के साथ बहु-चरणीय कार्य करने के लिए डिज़ाइन किया गया था, जो पहले के मॉडलों की विशुद्ध संवादात्मक क्षमताओं से एक बदलाव था।
यह लॉन्च Google की व्यापक AI रणनीति में एक महत्वपूर्ण कदम था, जिसने Gemini 2.0 को अपने पारिस्थितिकी तंत्र में एकीकृत किया, जिसमें Search, Chrome और डेवलपर टूल शामिल हैं। मॉडल को Google Cloud के Vertex AI और AI Studio प्लेटफार्मों के माध्यम से उपलब्ध कराया गया, जिसमें डेवलपर्स के लिए सार्वजनिक पूर्वावलोकन शामिल था। इस रिलीज़ ने अधिक स्वायत्त AI प्रणालियों की दौड़ में OpenAI और Anthropic के साथ प्रतिस्पर्धा को भी तेज किया।
विकास और संदर्भ
Gemini 2.0 को Google DeepMind द्वारा विकसित किया गया था, जो Google Brain और DeepMind का विलय है, जिसका नेतृत्व CEO डेमिस हसाबिस कर रहे हैं। यह परियोजना मूल Gemini मॉडलों की नींव पर आधारित थी, जिन्हें 6 दिसंबर 2023 को Ultra, Pro और Nano संस्करणों के साथ पेश किया गया था। 2.0 श्रृंखला का उद्देश्य पहले के मॉडलों की सीमाओं को दूर करना था, विशेष रूप से तर्क, टूल उपयोग और वास्तविक समय की बातचीत में।
रिपोर्टों के अनुसार, विकास में सैकड़ों इंजीनियर शामिल थे और प्रशिक्षण के लिए Google के स्वामित्व वाले Tensor Processing Units (TPUs) का उपयोग किया गया। मॉडल को विविध डेटा पर प्रशिक्षित किया गया था, जिसमें पाठ, चित्र, ऑडियो और वीडियो शामिल हैं, जो इसके पूर्ववर्तियों के बहुविध दृष्टिकोण के अनुरूप है। Google के सह-संस्थापक सर्गेई ब्रिन, जिन्हें Gemini विकास में सहायता के लिए वापस बुलाया गया था, को फिर से एक मुख्य योगदानकर्ता के रूप में श्रेय दिया गया।
यह घोषणा एजेंटिक AI की ओर व्यापक उद्योग प्रवृत्ति के बीच आई, जहाँ मॉडल स्वायत्त रूप से यात्रा बुकिंग, ईमेल प्रबंधन या कोडिंग जैसे कार्य कर सकते हैं। Google के जनरेटिव AI प्रयासों को OpenAI के GPT-4 और Anthropic के Claude के सीधे जवाब के रूप में देखा गया, जिन्होंने बाजार पर दबदबा बनाया था। हसाबिस ने जोर देकर कहा कि Gemini 2.0 उन्नत तर्क को वास्तविक दुनिया में कार्य करने की क्षमता के साथ जोड़ेगा, जिसे उन्होंने AI में एक "नई सीमा" बताया।
मुख्य विशेषताएँ
Gemini 2.0 Flash Experimental ने कई नई विशेषताएँ पेश कीं जो इसे पहले के मॉडलों से अलग करती हैं:
- मूल टूल उपयोग: मॉडल सीधे बाहरी टूल और APIs को कॉल कर सकता था, जैसे कि Google Search, वास्तविक समय की जानकारी प्राप्त करने और कार्यों को निष्पादित करने के लिए। इसने मानवीय हस्तक्षेप के बिना डेटाबेस क्वेरी करने, सॉफ्टवेयर नियंत्रित करने या वेब सेवाओं के साथ बातचीत करने जैसे कार्यों को सक्षम किया।
- बहुविध आउटपुट: पिछले मॉडलों के विपरीत जो मुख्य रूप से पाठ उत्पन्न करते थे, Gemini 2.0 मूल रूप से चित्र और ऑडियो उत्पन्न कर सकता था। इसमें दुरुपयोग को रोकने के लिए वॉटरमार्किंग के साथ एक नियंत्रणीय टेक्स्ट-टू-स्पीच सुविधा शामिल थी, और यह उपयोगकर्ता संकेतों के आधार पर सन्दर्भित चित्र उत्पन्न कर सकता था।
- बहुविध लाइव API: यह API वास्तविक समय के ऑडियो और वीडियो इंटरैक्शन की अनुमति देता था, जिससे अनुप्रयोग लाइव स्ट्रीम को संसाधित और प्रतिक्रिया दे सकते थे। इसे वर्चुअल असिस्टेंट, अनुवाद सेवाओं और इंटरैक्टिव शिक्षण टूल जैसे उपयोग मामलों के लिए डिज़ाइन किया गया था।
- एजेंटिक क्षमताएँ: मॉडल को बहु-चरणीय तर्क और योजना के लिए अनुकूलित किया गया था, जिससे यह जटिल कार्यों को उप-कार्यों में विभाजित कर उन्हें क्रमिक रूप से निष्पादित कर सकता था। यह पहले के मॉडलों से एक प्रमुख अंतर था जिन्हें चरण-दर-चरण संकेत की आवश्यकता होती थी।
- एकीकृत Google Search: Gemini 2.0 वेब से अद्यतित जानकारी तक पहुँच सकता था, जिससे प्रतिक्रियाओं में सटीकता और प्रासंगिकता में सुधार हुआ।
ये विशेषताएँ ट्रांसफार्मर आर्किटेक्चर पर आधारित थीं, जो अधिकांश आधुनिक बड़े भाषा मॉडलों की नींव है, लेकिन दक्षता और प्रदर्शन में सुधार के लिए ध्यान तंत्र और मिश्रण-विशेषज्ञ परतों में संवर्द्धन के साथ।
लॉन्च और उपलब्धता
Gemini 2.0 Flash Experimental की घोषणा 11 दिसंबर 2024 को एक ब्लॉग पोस्ट और एक आभासी प्रेस कार्यक्रम के माध्यम से की गई थी। यह शुरू में Google AI Studio और Vertex AI के माध्यम से डेवलपर्स के लिए उपलब्ध था, जिसमें Gemini ऐप के माध्यम से उपभोक्ताओं के लिए सार्वजनिक पूर्वावलोकन शामिल था। प्रयोगात्मक चरण के दौरान मॉडल को बिना किसी लागत के पेश किया गया था, जो प्रतिक्रिया एकत्र करने और तकनीक को परिष्कृत करने की रणनीति थी।
Google ने Gemini 2.0 को अपने उत्पादों में भी एकीकृत किया। Gemini चैटबॉट, जिसने फरवरी 2024 में Bard की जगह ली थी, को नए मॉडल का उपयोग करने के लिए अद्यतन किया गया। Chrome को Gemini Nano का एक संस्करण मिला, जो ऑन-डिवाइस वैरिएंट है, जिससे स्थानीय AI सुविधाएँ सक्षम हुईं। इसके अतिरिक्त, Google ने Search में Gemini 2.0 को शामिल करने की योजना की घोषणा की, जिससे मॉडल AI-संगठित खोज परिणाम उत्पन्न कर सके।
रिलीज़ के साथ Samsung के साथ एक साझेदारी भी हुई, जिससे Gemini 2.0 को उसके Galaxy उपकरणों में लाया गया, जो Galaxy S24 श्रृंखला में Gemini Nano और Pro के पहले के एकीकरण पर आधारित था। Google ने डेवलपर्स के लिए Android पर भी मॉडल उपलब्ध कराया, जिससे इसकी पहुँच का विस्तार हुआ।
प्रदर्शन और बेंचमार्क
Google ने दावा किया कि Gemini 2.0 Flash ने कई उद्योग बेंचमार्क पर पिछले मॉडलों से बेहतर प्रदर्शन किया, जिसमें Massive Multitask Language Understanding (MMLU) परीक्षण शामिल है, जहाँ इसने 90% से अधिक का स्कोर हासिल किया, जो मानव विशेषज्ञ प्रदर्शन से अधिक है। मॉडल ने तर्क कार्यों में भी सुधार दिखाया, जैसे कि Graduate-Level Google-Proof Q&A (GPQA) बेंचमार्क, और HumanEval द्वारा मापी गई कोड निर्माण में।
लॉन्च के समय स्वतंत्र मूल्यांकन सीमित थे, लेकिन शुरुआती समीक्षाओं ने मॉडल की गति और दक्षता पर ध्यान दिया, विशेष रूप से बहुविध इनपुट को संभालने में। Flash वैरिएंट को कम-विलंबता अनुप्रयोगों के लिए डिज़ाइन किया गया था, जिससे यह वास्तविक समय की बातचीत के लिए उपयुक्त था। Google ने संसाधन-सीमित वातावरण के लिए एक छोटा, अधिक कुशल संस्करण, Gemini 2.0 Flash Lite भी जारी किया।
इन प्रगतियों के बावजूद, कुछ विशेषज्ञों ने चेतावनी दी कि बेंचमार्क वास्तविक दुनिया के प्रदर्शन को पूरी तरह से नहीं दर्शा सकते हैं, विशेष रूप से एजेंटिक कार्यों में जिन्हें विश्वसनीय टूल उपयोग और त्रुटि पुनर्प्राप्ति की आवश्यकता होती है। चित्र और ऑडियो उत्पन्न करने की मॉडल की क्षमता ने दुरुपयोग के बारे में चिंताएँ भी उठाईं, हालाँकि Google ने जोखिमों को कम करने के लिए वॉटरमार्किंग और सुरक्षा फ़िल्टर लागू किए।
एजेंटिक AI और उद्योग प्रभाव
Gemini 2.0 का लॉन्च एजेंटिक AI की ओर व्यापक प्रवृत्ति का हिस्सा था, जहाँ मॉडल को केवल संकेतों का जवाब देने के बजाय स्वायत्त रूप से कार्य करने के लिए डिज़ाइन किया गया है। यह बदलाव Google के "एजेंटिक अनुभवों" पर जोर देने में स्पष्ट था, जैसे कि Project Mariner, एक शोध प्रोटोटाइप जो वेब ब्राउज़रों को नेविगेट करने और फॉर्म भरने या उत्पादों की तुलना करने जैसे कार्य करने के लिए Gemini 2.0 का उपयोग करता था।
उद्योग विश्लेषकों ने इस रिलीज़ को OpenAI के लिए एक सीधी चुनौती के रूप में देखा, जो समान एजेंटिक क्षमताओं पर काम कर रहा था, और Anthropic के लिए, जिसने अपने Claude मॉडलों में टूल उपयोग पेश किया था। प्रतिस्पर्धा तेज हो गई क्योंकि Microsoft और Amazon जैसी कंपनियों ने AI बुनियादी ढांचे में भारी निवेश किया, जिसमें AWS Trainium और Azure की AI सेवाएँ जैसे कस्टम चिप्स शामिल हैं।
Google के कदम का व्यापक AI पारिस्थितिकी तंत्र पर भी प्रभाव पड़ा। Gemini 2.0 को Google Cloud पर उपलब्ध कराकर, कंपनी ने खुद को AI-एक-सेवा बाजार में एक प्रमुख खिलाड़ी के रूप में स्थापित किया, जो OpenAI की पेशकशों और Anthropic के API के साथ प्रतिस्पर्धा कर रही थी। Google Search के साथ एकीकरण ने इसे एक अनूठा लाभ दिया, क्योंकि मॉडल वास्तविक समय के डेटा तक पहुँच सकता था, एक ऐसी सुविधा जो प्रतिस्पर्धियों के पास नहीं थी।
सुरक्षा और नैतिक विचार
Google ने Gemini 2.0 के विकास में सुरक्षा को प्राथमिकता देने पर जोर दिया। कंपनी ने कहा कि उसने रिलीज़ से पहले व्यापक परीक्षण किया, जिसमें रेड-टीमिंग अभ्यास और पूर्वाग्रह मूल्यांकन शामिल हैं। मॉडल में हानिकारक सामग्री निर्माण को रोकने के लिए सुरक्षा फ़िल्टर शामिल थे, और AI-जनित चित्रों और ऑडियो की वॉटरमार्किंग का उद्देश्य सिंथेटिक मीडिया की पहचान करने में मदद करना था।
अक्टूबर 2023 में अमेरिकी राष्ट्रपति जो बिडेन द्वारा हस्ताक्षरित एक कार्यकारी आदेश के अनुरूप, Google ने संघीय सरकार के साथ सुरक्षा परीक्षण परिणाम साझा किए। कंपनी ने वैश्विक मानकों के साथ संरेखित करने के लिए ब्लेचली पार्क में AI सुरक्षा शिखर सम्मेलन सहित अंतर्राष्ट्रीय निकायों के साथ भी जुड़ाव किया।
हालाँकि, Gemini 2.0 की एजेंटिक प्रकृति ने नए नैतिक प्रश्न उठाए। उपयोगकर्ताओं की ओर से कार्य करने की क्षमता, जैसे कि खरीदारी करना या संदेश भेजना, ने अनपेक्षित परिणामों के जोखिम पेश किए। Google ने इन चिंताओं को स्वीकार किया और कहा कि वह उपयोगकर्ता सहमति तंत्र और स्वायत्त कार्यों पर सीमाएँ सहित सुरक्षा उपाय लागू करेगा।
भविष्य के विकास
प्रयोगात्मक रिलीज़ के बाद, Google ने उपयोगकर्ता प्रतिक्रिया के आधार पर Gemini 2.0 पर पुनरावृत्ति करने की योजना बनाई। कंपनी ने एक अधिक शक्तिशाली संस्करण, Gemini 2.0 Pro का संकेत दिया, जिसके शुरुआती 2025 में जारी होने की उम्मीद थी, और Gemini परिवार का विकास जारी रखा, जिसमें ओपन-सोर्स Gemma मॉडल शामिल हैं।
जून 2025 में, Google ने Gemini CLI पेश किया, एक ओपन-सोर्स AI एजेंट जो Gemini क्षमताओं को टर्मिनल तक लाया, जिसमें उन्नत कोडिंग और स्वचालन सुविधाएँ शामिल थीं, जिसमें व्यक्तिगत डेवलपर्स के लिए उदार मुफ्त उपयोग सीमाएँ थीं। इस कदम ने उपभोक्ता अनुप्रयोगों से परे Gemini की पहुँच का विस्तार करने की Google की प्रतिबद्धता को रेखांकित किया।
Gemini 2.0 का लॉन्च कृत्रिम बुद्धिमत्ता के विकास में एक महत्वपूर्ण क्षण के रूप में देखा गया, जो संवादात्मक सहायकों से सक्रिय एजेंटों में संक्रमण का संकेत देता है जो डिजिटल दुनिया में काम कर सकते हैं। जैसे-जैसे तकनीक परिपक्व होती है, इसके उत्पादकता, रचनात्मकता और मानव-कंप्यूटर संपर्क पर गहरा प्रभाव पड़ने की संभावना है।