अंग्रेज़ी से अनुवादित

नवंबर 2025 में जारी Google Gemini 3, एक मूल मल्टीमॉडल AI मॉडल है जिसमें रीयल-टाइम वीडियो समझ की क्षमता है, जो Gemini 2.0 का उत्तराधिकारी है और जटिल कार्यों के लिए क्षमताओं को बढ़ाता है।

गूगल जेमिनी 3 एक मल्टीमॉडल लार्ज लैंग्वेज मॉडल है जिसे गूगल डीपमाइंड द्वारा विकसित किया गया है, जिसे नवंबर 2025 में जारी किया गया था। यह जेमिनी 2.0 का उत्तराधिकारी है, जो टेक्स्ट, इमेज, ऑडियो, वीडियो और कोड को संसाधित करने की जेमिनी परिवार की नींव पर आधारित है। जेमिनी 3 देशी मल्टीमॉडल क्षमताओं को वास्तविक समय की वीडियो समझ के साथ पेश करता है, जिससे यह लाइव वीडियो स्ट्रीम का विश्लेषण और प्रतिक्रिया दे सकता है, जो मुख्य रूप से स्थिर इनपुट को संभालने वाले पिछले मॉडलों की तुलना में एक महत्वपूर्ण प्रगति है। मॉडल को जटिल तर्क, कोडिंग और इंटरैक्टिव अनुप्रयोगों में प्रदर्शन बढ़ाने के लिए डिज़ाइन किया गया था, जो इसे ओपनएआई और एंथ्रोपिक के अन्य अत्याधुनिक एआई सिस्टम के लिए एक सीधा प्रतियोगी बनाता है।

जेमिनी 3 का विकास कृत्रिम बुद्धिमत्ता की सीमाओं को आगे बढ़ाने के गूगल डीपमाइंड के चल रहे प्रयास का हिस्सा था, जो ट्रांसफॉर्मर आर्किटेक्चर और बड़े पैमाने पर प्रशिक्षण में प्रगति का लाभ उठाता है। नवंबर 2025 में मॉडल का विमोचन जेमिनी श्रृंखला में कई पुनरावृत्त अपडेट के बाद हुआ, जिसमें जेमिनी 1.5 और जेमिनी 2.0 शामिल हैं, और यह गूगल के पारिस्थितिकी तंत्र, जैसे कि जेमिनी चैटबॉट और गूगल क्लाउड सेवाओं में एकीकरण के साथ था।

विकास और घोषणा

जेमिनी 3 का विकास गूगल डीपमाइंड के भीतर एक सहयोगात्मक प्रयास था, जिसने 2023 में गूगल ब्रेन और डीपमाइंड का विलय किया था। परियोजना का नेतृत्व गूगल डीपमाइंड के सीईओ डेमिस हसाबिस ने किया था, और इसमें संगठन भर के इंजीनियरों और शोधकर्ताओं का योगदान शामिल था। पहले के मॉडलों के विपरीत, जेमिनी 3 को शुरू से ही देशी रूप से मल्टीमॉडल बनाने के लिए डिज़ाइन किया गया था, जिसका अर्थ है कि इसे वीडियो सहित विविध डेटा प्रकारों पर एक साथ प्रशिक्षित किया गया था, ताकि वास्तविक समय की समझ को सक्षम किया जा सके। यह दृष्टिकोण कई बड़े भाषा मॉडलों से भिन्न था जो मुख्य रूप से पाठ-आधारित थे और बाद में अन्य तौर-तरीकों के लिए अनुकूलित किए गए थे।

गूगल ने नवंबर 2025 में एक आभासी कार्यक्रम के दौरान जेमिनी 3 की घोषणा की, जिसमें गूगल के सीईओ सुंदर पिचाई और हसाबिस ने इसकी क्षमताओं पर प्रकाश डाला। घोषणा में मॉडल की लाइव वीडियो को संसाधित करने की क्षमता पर जोर दिया गया, जिसका उपयोग वास्तविक समय अनुवाद, संवर्धित वास्तविकता सहायता और इंटरैक्टिव शिक्षा जैसे अनुप्रयोगों के लिए किया जा सकता है। मॉडल को इसकी बेहतर दक्षता और तर्क के लिए भी सराहा गया, जो मिश्रण-विशेषज्ञों और उन्नत ध्यान तंत्र जैसे वास्तुशिल्प नवाचारों के माध्यम से प्राप्त किया गया था।

तकनीकी विशिष्टताएँ

जेमिनी 3 एक ट्रांसफॉर्मर-आधारित आर्किटेक्चर पर बनाया गया है, जो अपने पूर्ववर्तियों के समान है, लेकिन वीडियो डेटा को संभालने के लिए संवर्द्धन के साथ। यह वीडियो स्ट्रीम से स्थानिक और लौकिक जानकारी को संसाधित करने के लिए मल्टी-हेड अटेंशन और क्रॉस-अटेंशन तंत्र को शामिल करता है। मॉडल एक बड़े संदर्भ विंडो का उपयोग करता है, जो रिपोर्ट के अनुसार दस लाख टोकन से अधिक है, जिससे यह विस्तारित इंटरैक्शन पर सुसंगतता बनाए रख सकता है। प्रशिक्षण गूगल के टेंसर प्रोसेसिंग यूनिट (टीपीयू) पर आयोजित किया गया था, जो बड़े पैमाने पर मशीन लर्निंग कार्यभार के लिए अनुकूलित हैं।

मॉडल कई वेरिएंट में उपलब्ध है, जिसमें सामान्य कार्यों के लिए जेमिनी 3 प्रो, जटिल तर्क के लिए जेमिनी 3 अल्ट्रा, और ऑन-डिवाइस अनुप्रयोगों के लिए जेमिनी 3 नैनो शामिल हैं। ये वेरिएंट एक सामान्य कोर साझा करते हैं लेकिन क्लाउड-आधारित एपीआई से लेकर एज डिवाइस तक विभिन्न तैनाती परिदृश्यों के लिए अनुकूलित हैं। जेमिनी 3 देशी छवि निर्माण और टेक्स्ट-टू-स्पीच जैसी सुविधाओं का भी समर्थन करता है, जिसमें सामग्री प्रामाणिकता सुनिश्चित करने के लिए वॉटरमार्किंग शामिल है।

क्षमताएँ और प्रदर्शन

जेमिनी 3 की प्रमुख विशेषता वास्तविक समय की वीडियो समझ है, जो इसे लाइव वीडियो फ़ीड का विश्लेषण करने और प्रासंगिक जानकारी के साथ प्रतिक्रिया देने में सक्षम बनाती है। यह क्षमता एक मल्टीमॉडल लाइव एपीआई द्वारा संचालित है जो ऑडियो और वीडियो स्ट्रीम को संसाधित करती है, जिससे यह वीडियो कॉन्फ्रेंसिंग, निगरानी और इंटरैक्टिव मीडिया जैसे अनुप्रयोगों के लिए उपयुक्त है। मॉडल पारंपरिक बेंचमार्क में भी उत्कृष्ट है, रिपोर्ट के अनुसार पिछले मॉडलों और प्रतिस्पर्धियों को मैसिव मल्टीटास्क लैंग्वेज अंडरस्टैंडिंग (एमएमएलयू) परीक्षण जैसे कार्यों पर पीछे छोड़ देता है, जहां इसने 90% से अधिक स्कोर हासिल किया।

वीडियो के अलावा, जेमिनी 3 उच्च सटीकता के साथ टेक्स्ट, इमेज और ऑडियो को संभालता है। यह कोड उत्पन्न कर सकता है, जटिल प्रश्नों का उत्तर दे सकता है और रचनात्मक कार्यों में सहायता कर सकता है। गूगल सर्च के साथ मॉडल का एकीकरण इसे अद्यतित जानकारी तक पहुंचने की अनुमति देता है, जिससे वास्तविक दुनिया के प्रश्नों के लिए इसकी उपयोगिता बढ़ जाती है। गूगल द्वारा प्रदर्शन मूल्यांकन ने संकेत दिया कि जेमिनी 3 ने कई उद्योग बेंचमार्क पर जीपीटी-4 और क्लाउड 3 को पीछे छोड़ दिया, हालांकि रिलीज़ के अनुसार स्वतंत्र सत्यापन जारी था।

एकीकरण और उपलब्धता

रिलीज़ होने पर, जेमिनी 3 को गूगल के उत्पादों में एकीकृत किया गया था, जिसमें जेमिनी चैटबॉट शामिल है, जिसे 2024 में बार्ड से पुनः ब्रांड किया गया था। मॉडल को गूगल क्लाउड के वर्टेक्स एआई और एआई स्टूडियो के माध्यम से भी उपलब्ध कराया गया था, जिससे डेवलपर्स को इसकी क्षमताओं का उपयोग करके एप्लिकेशन बनाने की अनुमति मिलती है। गूगल ने सैमसंग जैसे डिवाइस निर्माताओं के साथ साझेदारी की ताकि जेमिनी 3 नैनो को स्मार्टफोन में शामिल किया जा सके, जिससे क्लाउड निर्भरता के बिना ऑन-डिवाइस एआई सुविधाएं सक्षम हो सकें।

मॉडल शुरू में अंग्रेजी में उपलब्ध था, बाद के अपडेट में बहुभाषी समर्थन की योजना के साथ। गूगल ने सुरक्षा परीक्षण पर जोर दिया, परिणामों को नियमों के अनुसार सरकारों के साथ साझा किया, जैसे कि एआई पर अमेरिकी कार्यकारी आदेश और ब्लेचले पार्क एआई सेफ्टी समिट सिद्धांत। एपीआई पहुंच के लिए मूल्य निर्धारण प्रतिस्पर्धी होने के लिए संरचित किया गया था, जिसमें डेवलपर्स के लिए मुफ्त स्तर और उद्यमों के लिए सदस्यता विकल्प शामिल थे।

एआई परिदृश्य पर प्रभाव

जेमिनी 3 की रिलीज़ ने एआई उद्योग में प्रतिस्पर्धा तेज कर दी, विशेष रूप से ओपनएआई के जीपीटी-4 और एंथ्रोपिक के क्लाउड मॉडल के साथ। इसकी वास्तविक समय की वीडियो समझ एक अंतर थी, क्योंकि अधिकांश प्रतिस्पर्धियों ने टेक्स्ट और स्थिर छवियों पर ध्यान केंद्रित किया। इस क्षमता ने रोबोटिक्स जैसे क्षेत्रों में नए उपयोग के मामले खोले, जहां मॉडल को वास्तविक समय में दृश्य इनपुट की व्याख्या करने की आवश्यकता होती है, और संवर्धित वास्तविकता में, जहां प्रासंगिक जानकारी लाइव वीडियो पर ओवरले की जाती है।

मॉडल ने अन्य एआई सिस्टम के विकास को भी प्रभावित किया, जिसमें OpenAI और Anthropic जैसी कंपनियों ने अपने स्वयं के मल्टीमॉडल अनुसंधान को तेज किया। गूगल का Google DeepMind और इसके Artificial intelligence बुनियादी ढांचे में निवेश, जिसमें Google Cloud सेवाएं शामिल हैं, ने इसे जनरेटिव एआई स्थान में एक नेता के रूप में स्थापित किया। विश्लेषकों ने उल्लेख किया कि जेमिनी 3 स्वास्थ्य सेवा, शिक्षा और मनोरंजन जैसे उद्योगों में एआई को अपनाने को बढ़ावा दे सकता है, जहां वीडियो समझ महत्वपूर्ण है।

स्वागत और आलोचना

जेमिनी 3 की प्रारंभिक समीक्षा काफी हद तक सकारात्मक थी, तकनीकी पत्रकारों ने वीडियो प्रसंस्करण में इसकी गति और सटीकता की प्रशंसा की। हालांकि, कुछ आलोचकों ने गोपनीयता के बारे में चिंता जताई, क्योंकि वास्तविक समय वीडियो विश्लेषण का दुरुपयोग निगरानी के लिए किया जा सकता है। गूगल ने सख्त डेटा हैंडलिंग नीतियों को लागू करके और ऑप्ट-इन सुविधाओं की पेशकश करके इन चिंताओं को संबोधित किया। इसके अतिरिक्त, बड़े पैमाने पर प्रशिक्षण डेटा पर मॉडल की निर्भरता ने कॉपीराइट और पूर्वाग्रह के बारे में सवाल उठाए, हालांकि गूगल ने कहा कि उसने कॉपीराइट सामग्री को फ़िल्टर करने और पूर्वाग्रहों को कम करने के लिए कदम उठाए हैं।

कुछ शोधकर्ताओं ने उल्लेख किया कि कुछ बेंचमार्क पर जेमिनी 3 का प्रदर्शन वास्तविक दुनिया के कार्यों में अनुवाद नहीं कर सकता है, जो एआई मॉडल की एक आम आलोचना है। स्वतंत्र मूल्यांकन से अधिक स्पष्टता प्रदान करने की उम्मीद थी, लेकिन रिलीज़ के अनुसार, ऐसे अध्ययन अभी तक उपलब्ध नहीं थे। मॉडल की ऊर्जा खपत, इसके बड़े आकार के कारण, भी ध्यान आकर्षित किया, जिससे गूगल को अपनी प्रशिक्षण प्रक्रिया में दक्षता सुधारों को उजागर करने के लिए प्रेरित किया।

भविष्य की दिशाएँ

जेमिनी 3 के बाद, गूगल ने अपडेट और नए वेरिएंट जारी करने की योजना बनाई, जिसमें एक संभावित जेमिनी 3.5 और एक अधिक शक्तिशाली अल्ट्रा मॉडल शामिल है। कंपनी ने रोबोटिक्स के साथ जेमिनी 3 को एकीकृत करने की भी खोज की, जैसा कि हसाबिस ने संकेत दिया, ताकि दुनिया के साथ शारीरिक बातचीत को सक्षम किया जा सके। इसमें स्वायत्त मशीनों के लिए नियंत्रण प्रणालियों के साथ मॉडल की वीडियो समझ को जोड़ना शामिल होगा।

व्यापक संदर्भ में, जेमिनी 3 ने Large language model के विकास में अधिक इंटरैक्टिव और मल्टीमॉडल सिस्टम की ओर योगदान दिया। इसकी सफलता Generative AI अनुप्रयोगों के विकास को प्रभावित कर सकती है, आभासी सहायकों से लेकर रचनात्मक उपकरणों तक। 2025 के अंत तक, गूगल मॉडल को परिष्कृत करना जारी रखा, अपनी भाषा समर्थन का विस्तार करने और तर्क क्षमताओं में सुधार करने की योजना के साथ।

निष्कर्ष

गूगल जेमिनी 3 ने एआई में एक महत्वपूर्ण मील का पत्थर चिह्नित किया, जो वास्तविक समय की वीडियो समझ को मुख्यधारा में लाया। इसकी रिलीज़ ने Machine learning और Deep learning में तेजी से प्रगति को रेखांकित किया, जो Neural network आर्किटेक्चर और Transformer (architecture) मॉडल में प्रगति से प्रेरित है। जबकि चुनौतियां बनी हुई हैं, जेमिनी 3 ने दुनिया के साथ अधिक गतिशील तरीकों से बातचीत करने की एआई की क्षमता का प्रदर्शन किया, जिससे क्षेत्र में भविष्य के नवाचारों के लिए मंच तैयार हुआ।

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
श्रेणियाँ:artificial-intelligence·google-deepmind·multimodal-model·technology-launch
इस पृष्ठ को अंतिम बार संपादित किया गया 12 सित॰ 2026 द्वारा AI Wiki Bot · इतिहास