जेमिनी 3 मल्टीमॉडल लार्ज लैंग्वेज मॉडल (LLM) का एक परिवार है, जिसे Google DeepMind द्वारा विकसित किया गया है, और नवंबर 2025 में जेमिनी 2.0 के उत्तराधिकारी के रूप में घोषित किया गया था। यह स्वाभाविक रूप से मल्टीमॉडल है, जिसका अर्थ है कि यह पाठ, छवियों, वीडियो और ऑडियो को एक साथ शुरू से संसाधित करता है, न कि प्रत्येक मोडैलिटी के लिए अलग-अलग घटकों पर निर्भर रहता है। यह मॉडल जेमिनी चैटबॉट को शक्ति प्रदान करता है और इसका नाम जेमिनी राशि चिन्ह के नाम पर रखा गया है, जो दिसंबर 2023 में मूल जेमिनी 1.0 रिलीज़ के साथ स्थापित नामकरण परंपरा को जारी रखता है।
लॉन्च ने जेमिनी 3 को OpenAI और Anthropic के मॉडलों के लिए एक सीधा प्रतियोगी के रूप में स्थापित किया, जिसमें Google ने अपनी एकीकृत वास्तुकला को एक प्रमुख अंतर के रूप में जोर दिया। पहले के संस्करणों के विपरीत, जो सहायक मॉड्यूल के माध्यम से मल्टीमॉडल क्षमताओं को एकीकृत करते थे, जेमिनी 3 को सभी डेटा प्रकारों पर एंड-टू-एंड प्रशिक्षित किया गया था, जिससे यह एक ही पास में मोडैलिटी में तर्क कर सके। यह डिज़ाइन Google DeepMind के मौलिक कार्य पर आधारित है, जिसने 2023 में विकास में तेजी लाने के लिए DeepMind और Google Brain का विलय किया।
विकास पृष्ठभूमि
जेमिनी 3 का विकास मूल जेमिनी परियोजना से जुड़ा है, जिसकी घोषणा पहली बार 10 मई, 2023 को Google I/O में CEO सुंदर पिचाई द्वारा की गई थी। प्रारंभिक मॉडल, जेमिनी 1.0, 6 दिसंबर, 2023 को लॉन्च किया गया था, जिसमें तीन वेरिएंट थे: जटिल कार्यों के लिए Ultra, सामान्य उपयोग के लिए Pro, और ऑन-डिवाइस प्रोसेसिंग के लिए Nano। इसे Google के Tensor Processing Units (TPUs) पर प्रशिक्षित किया गया था और इसमें DeepMind के AlphaGo कार्यक्रम से सीखे गए पाठ शामिल थे, जिसने 2016 में गो चैंपियन ली सेडोल को हराया था।
बाद के पुनरावृत्तियों ने वास्तुकला को परिष्कृत किया। जेमिनी 1.5, फरवरी 2024 में जारी, ने मिश्रण-ऑफ-एक्सपर्ट्स दृष्टिकोण और एक मिलियन-टोकन संदर्भ विंडो पेश की। जेमिनी 2.0 फ्लैश एक्सपेरिमेंटल, 11 दिसंबर, 2024 को घोषित, ने वास्तविक समय ऑडियो और वीडियो इंटरैक्शन के लिए एक मल्टीमॉडल लाइव API जोड़ा। जेमिनी 3 इन प्रगति पर आधारित है, नवंबर 2025 की रिलीज़ के साथ मूल मल्टीमॉडलिटी को एक ऐड-ऑन के बजाय एक मुख्य विशेषता के रूप में केंद्रित किया गया है।
विकास टीम में Google Brain और DeepMind के सैकड़ों इंजीनियर शामिल थे, जिसमें सह-संस्थापक सेर्गेई ब्रिन ने पहले के संस्करणों की तरह एक मुख्य योगदानकर्ता के रूप में योगदान दिया। प्रशिक्षण डेटा में YouTube वीडियो के ट्रांसक्रिप्ट शामिल थे, जिसमें कानूनी टीमों ने संभावित कॉपीराइट सामग्री को फ़िल्टर किया, एक प्रथा जो जेमिनी 3 के लिए जारी रही।
मूल मल्टीमॉडल वास्तुकला
जेमिनी 3 की परिभाषित विशेषता इसका मूल मल्टीमॉडल डिज़ाइन है, जो एक एकीकृत ट्रांसफॉर्मर वास्तुकला के माध्यम से पाठ, छवियों, वीडियो और ऑडियो को संसाधित करता है। यह जेमिनी 1.0 जैसे पहले के मॉडलों के विपरीत है, जो अलग-अलग एनकोडर और डिकोडर के माध्यम से मोडैलिटी को संभालते थे। एकीकृत दृष्टिकोण मॉडल को मध्यवर्ती रूपांतरण चरणों के बिना मोडैलिटी में जानकारी को सहसंबंधित करने की अनुमति देता है, जिससे सिंक्रनाइज़ ऑडियो और दृश्य तर्क के साथ वीडियो समझ जैसे कार्यों में सुधार होता है।
वास्तुकला कई इनपुट स्ट्रीम को संभालने के लिए विस्तारित मल्टी-हेड अटेंशन तंत्र का लाभ उठाती है। अस्थायी और स्थानिक आयामों पर स्थितीय एन्कोडिंग लागू की जाती है, जिससे मॉडल वीडियो फ्रेम में वस्तुओं को ट्रैक कर सके और भाषण को संबंधित दृश्यों के साथ संरेखित कर सके। यह डिज़ाइन कई पूर्व LLM में उपयोग की जाने वाली एनकोडर-डिकोडर संरचना से एक प्रस्थान है, जो सभी मोडैलिटी को संयुक्त रूप से संसाधित करने वाले एकल ट्रांसफॉर्मर का पक्ष लेता है।
प्रशिक्षण में युग्मित मल्टीमॉडल उदाहरण उत्पन्न करने के लिए डेटा संवर्धन तकनीकों का उपयोग किया गया, जैसे ट्रांसक्राइब किए गए ऑडियो और छवि कैप्शन के साथ वीडियो क्लिप। मॉडल विविध डेटा प्रकारों में प्रशिक्षण को स्थिर करने के लिए लेयर नॉर्मलाइज़ेशन और अवशिष्ट कनेक्शन का उपयोग करता है। Google DeepMind ने बताया कि इस दृष्टिकोण ने प्रत्येक मोडैलिटी के लिए अलग-अलग फाइन-ट्यूनिंग चरणों की आवश्यकता को कम कर दिया।
मॉडल वेरिएंट और क्षमताएँ
जेमिनी 3 को विभिन्न उपयोग मामलों की सेवा के लिए कई कॉन्फ़िगरेशन में पेश किया गया है, जो पिछले संस्करणों के स्तरीकृत दृष्टिकोण को जारी रखता है। लाइनअप में जटिल तर्क कार्यों के लिए जेमिनी 3 Ultra, सामान्य अनुप्रयोगों के लिए जेमिनी 3 Pro, कम-विलंबता प्रतिक्रियाओं के लिए जेमिनी 3 Flash, और संसाधन-सीमित वातावरण के लिए जेमिनी 3 Flash Lite शामिल हैं। प्रत्येक वेरिएंट एक ही मूल मल्टीमॉडल कोर साझा करता है लेकिन पैरामीटर गिनती और गति बनाम सटीकता के लिए अनुकूलन में भिन्न होता है।
क्षमताओं में ऑडियो एकीकरण के साथ वास्तविक समय वीडियो विश्लेषण, पाठ्य विवरण से छवि निर्माण, और क्रॉस-मोडल खोज शामिल है - उदाहरण के लिए, बोले गए क्वेरी के आधार पर वीडियो में एक विशिष्ट क्षण ढूंढना। मॉडल नियंत्रणीय आउटपुट उत्पादन के लिए टॉप-पी सैंपलिंग और तापमान स्केलिंग का भी समर्थन करता है, और यह प्रामाणिकता सत्यापित करने के लिए वॉटरमार्किंग के साथ टेक्स्ट-टू-स्पीच उत्पन्न कर सकता है, जो जेमिनी 2.0 से विरासत में मिली एक विशेषता है।
डेवलपर्स के लिए, जेमिनी 3 Google Cloud के Vertex AI और AI Studio प्लेटफ़ॉर्म के माध्यम से सुलभ है, जिसमें स्ट्रीमिंग ऑडियो और वीडियो इनपुट का समर्थन करने वाले API हैं। मॉडल अद्यतित जानकारी पुनर्प्राप्ति के लिए Google खोज के साथ एकीकृत होता है, और यह वेब और मोबाइल इंटरफेस में जेमिनी चैटबॉट को शक्ति प्रदान करता है।
प्रदर्शन और बेंचमार्क
लॉन्च के समय, Google DeepMind ने बताया कि जेमिनी 3 Ultra ने कई उद्योग बेंचमार्क पर अपने पूर्ववर्ती और प्रतिस्पर्धी मॉडलों से बेहतर प्रदर्शन किया, हालांकि विशिष्ट स्कोर पूरी तरह से प्रकट नहीं किए गए थे। कंपनी ने मल्टीमॉडल तर्क कार्यों में सुधार का दावा किया, जैसे दृश्य प्रश्न उत्तर और वीडियो समझ, जहां मूल वास्तुकला उन मॉडलों पर एक लाभ प्रदान करती है जो मोडैलिटी को अलग से संसाधित करते हैं।
पिछले जेमिनी संस्करणों ने उच्च उम्मीदें स्थापित कीं: जेमिनी Ultra पहला LLM था जिसने 57-विषय मैसिव मल्टीटास्क लैंग्वेज अंडरस्टैंडिंग (MMLU) परीक्षण पर 90% स्कोर के साथ मानव विशेषज्ञ प्रदर्शन को पार किया। जेमिनी 3 इस विरासत पर आधारित है, लॉन्च की तारीख तक चल रहे स्वतंत्र सत्यापन के साथ, Video-MMLU और AudioQA जैसे मल्टीमॉडल बेंचमार्क पर मजबूत परिणामों का संकेत देने वाली प्रारंभिक रिपोर्टों के साथ।
मॉडल का प्रदर्शन TPUs पर इसके प्रशिक्षण और मल्टीमॉडल डेटा के लिए अनुकूलित बैच नॉर्मलाइज़ेशन तकनीकों के उपयोग के लिए जिम्मेदार है। Google DeepMind ने जोर दिया कि जेमिनी 3 की एकीकृत वास्तुकला मोडैलिटी-विशिष्ट घटकों के बीच त्रुटि प्रसार को कम करती है, जो पहले के मल्टीमॉडल सिस्टम में एक आम समस्या है।
एकीकरण और पारिस्थितिकी तंत्र
जेमिनी 3 Google के उत्पाद पारिस्थितिकी तंत्र में एकीकृत है, जिसमें खोज, Chrome और Google Workspace शामिल हैं, जो पहले के जेमिनी रिलीज़ के पैटर्न का अनुसरण करता है। मॉडल जेमिनी चैटबॉट को शक्ति प्रदान करता है, जिसे फरवरी 2024 में Bard से पुनः ब्रांड किया गया था। Android पर, जेमिनी 3 Nano ऑन-डिवाइस कार्यों के लिए अनुकूलित है, जो क्लाउड कनेक्टिविटी के बिना छवियों और ऑडियो की ऑफ़लाइन प्रोसेसिंग को सक्षम बनाता है।
हार्डवेयर साझेदारी में, Google ने जेमिनी 3 को गैलेक्सी S25 स्मार्टफोन लाइनअप में एकीकृत करने के लिए सैमसंग इलेक्ट्रॉनिक्स के साथ सहयोग किया, जिसकी घोषणा 2025 की शुरुआत में की गई थी। यह जनवरी 2024 की साझेदारी का अनुसरण करता है जिसने जेमिनी Nano और Pro को गैलेक्सी S24 में लाया। एकीकरण में वीडियो कॉल का वास्तविक समय अनुवाद और प्राकृतिक भाषा कमांड के साथ ऑन-डिवाइस फोटो संपादन जैसी सुविधाएँ शामिल हैं।
उद्यम उपयोगकर्ताओं के लिए, जेमिनी 3 Google Cloud के माध्यम से उपलब्ध है, जो AI-एज़-ए-सर्विस बाजार में अमेज़न वेब सर्विसेज और माइक्रोसॉफ्ट Azure के साथ प्रतिस्पर्धा करता है। Google ने जून 2025 में जेमिनी CLI भी पेश किया, एक ओपन-सोर्स AI एजेंट जो टर्मिनल में जेमिनी क्षमताओं को लाता है, जो व्यक्तिगत डेवलपर्स के लिए मुफ्त उपयोग सीमाओं के साथ कोडिंग, स्वचालन और समस्या-समाधान कार्यों का समर्थन करता है।
सुरक्षा और विनियमन
Google DeepMind ने मूल जेमिनी लॉन्च के बाद से कंपनी के बताए गए दृष्टिकोण के अनुरूप, जेमिनी 3 के लिए सुरक्षा परीक्षण पर जोर दिया। कंपनी ने अक्टूबर 2023 में राष्ट्रपति जो बिडेन द्वारा हस्ताक्षरित एक कार्यकारी आदेश के अनुरूप, परीक्षण परिणाम अमेरिकी संघीय सरकार के साथ साझा किए। नवंबर 2023 में ब्लेचले पार्क में AI सुरक्षा शिखर सम्मेलन में स्थापित सिद्धांतों के बाद, यूके सरकार के साथ चर्चा भी जारी रही।
सुरक्षा उपायों में दुरुपयोग को रोकने के लिए उत्पन्न छवियों और ऑडियो के लिए वॉटरमार्किंग शामिल है, जो जेमिनी 2.0 में पेश की गई और जेमिनी 3 में विस्तारित एक विशेषता है। मॉडल में हानिकारक आउटपुट को कम करने के लिए फ़िल्टर शामिल हैं, और Google ने कहा कि जेमिनी 3 को व्यापक तैनाती से पहले व्यापक मूल्यांकन से गुजरना होगा, जो जेमिनी 1.0 के सतर्क रोलआउट के समान है।
नवंबर 2025 के लॉन्च के अनुसार, जेमिनी 3 शुरू में अंग्रेजी में उपलब्ध था, जिसमें बहुभाषी विस्तार की योजना थी। Google ने संकेत दिया कि अतिरिक्त भाषाएं और क्षेत्रीय उपलब्धता नियामक अनुमोदन के अधीन, बाद के महीनों में शुरू हो जाएंगी।
प्रतिस्पर्धी परिदृश्य
जेमिनी 3 एक प्रतिस्पर्धी बाजार में प्रवेश करता है जिसमें OpenAI के GPT-4 और GPT-4o, Anthropic के Claude 3, और AI21 Labs और Inflection AI जैसी कंपनियों के अन्य मॉडल शामिल हैं। Google का मूल मल्टीमॉडल दृष्टिकोण GPT-4 में दृष्टि और ऑडियो के OpenAI के एकीकरण के लिए एक सीधी चुनौती है, जिसे 2023 में जेमिनी की प्रारंभिक घोषणा के जवाब में तेज किया गया था।
उद्योग विश्लेषकों ने कहा कि जेमिनी 3 की एकीकृत वास्तुकला मल्टीमॉडल AI के लिए एक नया मानक स्थापित कर सकती है, जो संभावित रूप से प्रतिस्पर्धियों के भविष्य के मॉडलों को प्रभावित करेगी। लॉन्च Google DeepMind और OpenAI के बीच चल रही प्रतिद्वंद्विता को भी उजागर करता है, दोनों कंपनियां कृत्रिम सामान्य बुद्धिमत्ता (AGI) प्राप्त करने की होड़ में हैं। TPUs में Google का निवेश और ब्रॉडकॉम जैसे चिप निर्माताओं के साथ साझेदारी एक हार्डवेयर लाभ प्रदान करती है, हालांकि OpenAI क्लाउड प्रदाताओं के माध्यम से NVIDIA GPU पर निर्भर करता है।
जेमिनी 3 की रिलीज़ से मीडिया, स्वास्थ्य सेवा और रोबोटिक्स जैसे उद्योगों में मल्टीमॉडल AI को अपनाने में तेजी आने की उम्मीद है, जहां दृश्य और श्रवण डेटा का एक साथ प्रसंस्करण महत्वपूर्ण है। Google DeepMind ने रोबोटिक्स के साथ भविष्य के एकीकरण का संकेत दिया है, जो भौतिक प्रणालियों के साथ जेमिनी के संयोजन के पहले के अन्वेषणों पर आधारित है।
भविष्य की दिशाएँ
Google DeepMind जेमिनी 3 पर पुनरावृत्ति जारी रखने की योजना बना रहा है, जिसमें दक्षता में सुधार और जेमिनी 1.5 की एक-मिलियन-टोकन क्षमता से परे संदर्भ विंडो का विस्तार करने के लिए अपडेट की उम्मीद है। कंपनी मॉडल प्रूनिंग और क्वांटाइज़ेशन के माध्यम से कम्प्यूटेशनल लागत को कम करने के तरीकों की भी खोज कर रही है, जिससे मॉडल छोटे डेवलपर्स के लिए अधिक सुलभ हो सके।
अनुसंधान दिशाओं में जेमिनी 3 को Waymo की स्वायत्त ड्राइविंग प्रणालियों और अन्य रोबोटिक्स अनुप्रयोगों के साथ एकीकृत करना शामिल है, जो वास्तविक समय निर्णय लेने के लिए इसकी मल्टीमॉडल समझ का लाभ उठाता है। इसके अतिरिक्त, Google वैज्ञानिक अनुसंधान में जेमिनी 3 के उपयोग की जांच कर रहा है, जैसे कई मोडैलिटी में प्रयोगात्मक डेटा का विश्लेषण करना।
लॉन्च के अनुसार, Google DeepMind ने जेमिनी 4 के लिए एक समयरेखा की घोषणा नहीं की है, लेकिन विकास की तीव्र गति - दिसंबर 2023 में जेमिनी 1.0 से नवंबर 2025 में जेमिनी 3 तक - चालू वार्षिक अपडेट का सुझाव देती है। मूल मल्टीमॉडलिटी के लिए कंपनी की प्रतिबद्धता जेमिनी 3 को भविष्य के AI सिस्टम के लिए एक आधारभूत मॉडल के रूप में स्थापित करती है जो कई इंद्रियों के माध्यम से दुनिया के साथ बातचीत करते हैं।