Gemini 1 बड़े भाषा मॉडल का एक परिवार है, जिसे Google DeepMind द्वारा विकसित किया गया है, और 6 दिसंबर 2023 को LaMDA और PaLM 2 के उत्तराधिकारी के रूप में घोषित किया गया था। इसमें तीन प्रारंभिक मॉडल शामिल हैं: Gemini Ultra, जो अत्यधिक जटिल कार्यों के लिए डिज़ाइन किया गया है; Gemini Pro, विभिन्न प्रकार के कार्यों के लिए; और Gemini Nano, डिवाइस-आधारित कार्यों के लिए। यह परिवार Gemini चैटबॉट को शक्ति प्रदान करता है और इसका नाम Gemini राशि के नाम पर रखा गया है, जो Google Brain और DeepMind के विलय को दर्शाता है। पाठ-केवल पूर्ववर्तियों के विपरीत, Gemini को पाठ, चित्र, ऑडियो, वीडियो और कंप्यूटर कोड को एक साथ संसाधित करने के लिए प्रशिक्षित किया गया था, जो इसे OpenAI के GPT-4 और अन्य जनरेटिव AI प्रणालियों का प्रत्यक्ष प्रतियोगी बनाता है।
यह रिलीज़ कृत्रिम बुद्धिमत्ता विकास में एक महत्वपूर्ण क्षण था, क्योंकि Gemini Ultra पहला मॉडल बन गया जिसने 57-विषय वाले Massive Multitask Language Understanding (MMLU) परीक्षण में मानव विशेषज्ञों से बेहतर प्रदर्शन किया, 90% अंक प्राप्त करते हुए। Google ने इसे अपना "सबसे बड़ा और सबसे सक्षम AI मॉडल" बताया, जिसकी क्षमताएँ मशीन लर्निंग, डीप लर्निंग और तंत्रिका नेटवर्क आर्किटेक्चर तक फैली हुई हैं।
विकास पृष्ठभूमि
Google ने पहली बार Gemini की घोषणा 10 मई 2023 को Google I/O मुख्य भाषण में की, जिसमें CEO सुंदर पिचाई ने इसे अभी भी प्रारंभिक विकास में बताया। इसे DeepMind और Google Brain के बीच सहयोग के रूप में बनाया गया था, जो Google DeepMind छत्र के तहत विलय हो गए थे। DeepMind CEO डेमिस हसाबिस ने साक्षात्कारों में उजागर किया कि Gemini संवादात्मक पाठ क्षमताओं को AI-संचालित छवि निर्माण के साथ जोड़ेगा, जो DeepMind के AlphaGo कार्यक्रम की ताकत पर आधारित होगा, जिसने 2016 में दुनिया भर में ध्यान आकर्षित किया था।
विकास में सैकड़ों इंजीनियर शामिल थे, और Google के सह-संस्थापक सेर्गेई ब्रिन को सेवानिवृत्ति से वापस बुलाया गया, जिन्हें बाद में "मुख्य योगदानकर्ता" के रूप में श्रेय दिया गया। मॉडल को YouTube वीडियो के ट्रांसक्रिप्ट पर प्रशिक्षित किया गया था, जिसमें वकीलों ने संभावित कॉपीराइट सामग्री को फ़िल्टर किया। अगस्त 2023 तक, रिपोर्टों ने 2023 के अंत में लॉन्च के लक्ष्य का संकेत दिया, जिसमें Google Cloud की Vertex AI सेवा के माध्यम से चुनिंदा कंपनियों को प्रारंभिक पहुँच दी गई।
लॉन्च और प्रारंभिक मॉडल
6 दिसंबर 2023 को, पिचाई और हसाबिस ने एक आभासी प्रेस कॉन्फ्रेंस में "Gemini 1.0" की घोषणा की। लॉन्च के समय, Gemini Pro और Nano को क्रमशः Bard और Pixel 8 Pro स्मार्टफोन में एकीकृत किया गया, जबकि Gemini Ultra को 2024 की शुरुआत में "Bard Advanced" और डेवलपर उपलब्धता के लिए निर्धारित किया गया था। मॉडल शुरू में केवल अंग्रेजी में उपलब्ध था, जिसमें Google ने व्यापक रिलीज़ से पहले "व्यापक सुरक्षा परीक्षण" की आवश्यकता का हवाला दिया।
Gemini को Google के Tensor Processing Units (TPUs) पर प्रशिक्षित किया गया था। Gemini Ultra ने उद्योग बेंचमार्क पर GPT-4, Anthropic के Claude 2, Inflection AI के Inflection-2, Meta के LLaMA 2 और xAI के Grok 1 से बेहतर प्रदर्शन किया, जबकि Gemini Pro ने GPT-3.5 से बेहतर प्रदर्शन किया। Gemini Pro 13 दिसंबर 2023 को AI Studio और Vertex AI पर Google Cloud ग्राहकों के लिए उपलब्ध हो गया। अक्टूबर 2023 के एक अमेरिकी कार्यकारी आदेश के अनुसार, Google ने परीक्षण परिणाम संघीय सरकार के साथ साझा किए, और Bletchley Park शिखर सम्मेलन के AI सुरक्षा सिद्धांतों पर यूके सरकार के साथ जुड़ा।
तकनीकी आर्किटेक्चर और क्षमताएँ
Gemini के आर्किटेक्चर ने ट्रांसफॉर्मर मॉडल का उपयोग किया, जिसमें मल्टी-हेड अटेंशन और पोजिशनल एन्कोडिंग तंत्र शामिल थे। इसका मल्टीमॉडल डिज़ाइन विभिन्न डेटा प्रकारों के एक साथ प्रसंस्करण की अनुमति देता था, जो पाठ-केवल LLM से एक विचलन था। मॉडल ने आउटपुट नियंत्रण के लिए AI फीडबैक से सुदृढीकरण लर्निंग और तापमान स्केलिंग जैसी तकनीकों को एकीकृत किया, जिसमें पीढ़ी विविधता के लिए टॉप-के सैंपलिंग और टॉप-पी सैंपलिंग शामिल थे।
मॉडल के प्रशिक्षण में Adam ऑप्टिमाइज़र वेरिएंट, लर्निंग रेट शेड्यूल और ग्रेडिएंट क्लिपिंग का उपयोग किया गया ताकि डीप लर्निंग प्रक्रियाओं को स्थिर किया जा सके। बैच नॉर्मलाइज़ेशन और ड्रॉपआउट का उपयोग सामान्यीकरण में सुधार के लिए किया गया, जबकि मॉडल प्रूनिंग ने Gemini Nano में डिवाइस-आधारित तैनाती के लिए दक्षता को अनुकूलित करने में मदद की।
अपडेट और विस्तार
जनवरी 2024 में, Google ने Gemini Nano और Pro को Galaxy S24 स्मार्टफोन श्रृंखला में एकीकृत करने के लिए Samsung के साथ साझेदारी की। अगले महीने, Bard और Duet AI को Gemini ब्रांड के तहत एकीकृत किया गया, जिसमें Google One के नए "AI Premium" स्तर के माध्यम से "Gemini Advanced with Ultra 1.0" जारी किया गया। Gemini Pro को वैश्विक लॉन्च मिला।
फरवरी 2024 में, Google ने Gemini 1.5 लॉन्च किया, जिसमें एक नया आर्किटेक्चर, एक मिश्रण-ऑफ-विशेषज्ञ दृष्टिकोण और एक मिलियन-टोकन संदर्भ विंडो शामिल थी। उसी महीने, Google ने Gemma का अनावरण किया, जो Gemini मॉडल की एक छोटी, मुफ्त और ओपन-सोर्स श्रृंखला है, जिसे Meta की ओपन-सोर्सिंग प्रथाओं की प्रतिक्रिया के रूप में वर्णित किया गया। Gemini 1.5 Flash की घोषणा 14 मई 2024 को I/O मुख्य भाषण में की गई, जिसमें Gemini Nano को उसके "Built-in AI" आर्किटेक्चर के माध्यम से Google Chrome में एकीकृत करने की योजना थी। अद्यतन मॉडल, Gemini-1.5-Pro-002 और Gemini-1.5-Flash-002, 24 सितंबर 2024 को जारी किए गए।
प्रभाव और विरासत
Gemini 1 ने Google DeepMind को जनरेटिव AI में एक अग्रणी शक्ति के रूप में स्थापित किया, जो सीधे OpenAI और Anthropic के साथ प्रतिस्पर्धा करता है। इसके मल्टीमॉडल दृष्टिकोण ने उद्योग भर में बाद के मॉडल विकास को प्रभावित किया, जिसमें क्लाउड-आधारित AI सेवाओं में Amazon Web Services और Microsoft Azure के प्रयास शामिल हैं। Pixel स्मार्टफोन और Samsung डिवाइस जैसे उपभोक्ता उत्पादों में मॉडल के एकीकरण ने AI पहुँच का विस्तार किया, जबकि इसके ओपन-सोर्स Gemma मॉडल ने व्यापक AI अनुसंधान समुदाय में योगदान दिया।
रिलीज़ ने नियामक चर्चाओं को भी प्रेरित किया, जिसमें Google ने सुरक्षा परीक्षण पर अमेरिकी और यूके सरकारों के साथ जुड़ाव किया। 2025 तक, Gemini कई संस्करणों के माध्यम से विकसित हुआ है, दिसंबर 2024 में Gemini 2.0 की घोषणा की गई, लेकिन Gemini 1 महत्वपूर्ण बना हुआ है क्योंकि यह मौलिक रिलीज़ थी जिसने बड़े पैमाने पर मल्टीमॉडल AI प्रणालियों की व्यवहार्यता प्रदर्शित की।