Gemini बड़े भाषा मॉडलों का प्रमुख परिवार है, जो Google DeepMind से है, और इसे 6 दिसंबर, 2023 को लॉन्च किया गया। इसने Google के पहले के PaLM-आधारित Bard चैटबॉट को कंपनी की प्राथमिक बड़े मॉडल श्रृंखला के रूप में बदल दिया, और इसे शुरू से ही स्वाभाविक रूप से मल्टीमॉडल होने के लिए डिज़ाइन किया गया था, जिसे पाठ, छवि, ऑडियो और वीडियो पर संयुक्त रूप से प्रशिक्षित किया गया था, बजाय इसके कि पाठ-केवल प्रीट्रेनिंग के बाद मोडैलिटी को जोड़ा जाए।
पृष्ठभूमि
Gemini का विकास 2023 में Google Brain और DeepMind के एकीकृत Google DeepMind संगठन में विलय के बाद हुआ, एक पुनर्गठन जिसे व्यापक रूप से पिछले वर्ष ChatGPT के लॉन्च के बाद प्रतिस्पर्धात्मक दबाव की प्रतिक्रिया के रूप में रिपोर्ट किया गया था, जिसे कभी-कभी आंतरिक रूप से Google की खोज और AI रणनीति के लिए "कोड रेड" क्षण के रूप में वर्णित किया गया था। Demis Hassabis ने संयुक्त संगठन का नेतृत्व किया, जबकि Sundar Pichai, Google के मुख्य कार्यकारी, ने सार्वजनिक रूप से Gemini के चारों ओर कंपनी की उत्पाद लाइनों के "AI-प्रथम" पुनर्अभिविन्यास का समर्थन किया।
मॉडल स्तर और रिलीज़
Gemini को विभिन्न उपयोग मामलों के लिए कई आकार के स्तरों में जारी किया गया है: Ultra सबसे मांग वाले कार्यों के लिए, Pro एक संतुलित सामान्य-उद्देश्य मॉडल के रूप में, Flash उच्च-मात्रा अनुप्रयोगों के लिए तेज़ और सस्ता विकल्प के रूप में, और Nano फोन और अन्य सीमित हार्डवेयर पर डिवाइस-आधारित उपयोग के लिए। क्रमिक संस्करणों (1.0, 1.5, 2.0, और उससे आगे) ने मॉडल के संदर्भ-विंडो का विस्तार किया, जिसमें 1.5 Pro विशेष रूप से लगभग एक मिलियन टोकन की सीमा में बहुत लंबे संदर्भ विंडो का समर्थन करता है, जो एक ही प्रॉम्प्ट में पूरे कोडबेस, लंबे दस्तावेज़ों, या पूर्ण वीडियो फ़ाइलों पर तर्क करने जैसे कार्यों को सक्षम बनाता है। बाद के संस्करणों में स्पष्ट तर्क मोड शामिल किए गए जो अतिरिक्त अनुमान-समय गणना आवंटित करते हैं, जो Gemini को तर्क मॉडलों की ओर व्यापक बदलाव के साथ संरेखित करता है, जिसे OpenAI के o1 जैसी प्रणालियों ने अग्रणी बनाया।
Gemini मॉडलों को काफी हद तक Google के स्वयं के टेंसर प्रोसेसिंग यूनिट का उपयोग करके प्रशिक्षित किया गया था, न कि केवल तीसरे पक्ष के GPU पर निर्भर रहकर, जो कस्टम AI एक्सेलेरेटर हार्डवेयर में Google के लंबे समय से निवेश को दर्शाता है।
एकीकरण और उत्पाद
Google ने Gemini को अपने उत्पाद पारिस्थितिकी तंत्र में व्यापक रूप से एकीकृत किया, जिसमें खोज (AI Overviews के माध्यम से), Workspace अनुप्रयोग, Android ऑपरेटिंग सिस्टम, और एक पुनर्ब्रांडेड उपभोक्ता सहायक ऐप शामिल हैं। Gemini परिवार पर निर्मित विशेष क्षमताओं में छवि निर्माण और संपादन उपकरण शामिल थे, विशेष रूप से वह मॉडल जो समुदाय के उपनाम नैनो बनाना से जाना गया, और Veo वीडियो निर्माण मॉडल, दोनों Google DeepMind के भीतर विकसित किए गए और अक्सर व्यापक Gemini उत्पाद सतह में एकीकृत किए गए। Gemini NotebookLM को भी शक्ति प्रदान करता है, एक शोध और नोट-लेने वाला सहायक जो अपनी AI-जनित "ऑडियो अवलोकन" पॉडकास्ट सुविधा के लिए विशेष ध्यान आकर्षित करता है।
स्वागत और प्रतिस्पर्धा
Gemini ने सीधे OpenAI के GPT श्रृंखला और Anthropic के Claude (AI model family) के साथ प्रतिस्पर्धा की है, जिसमें बेंचमार्क और समुदाय मूल्यांकन प्लेटफार्मों जैसे LMArena पर रिलीज़ के बीच सापेक्ष रैंकिंग बदलती रही है। मूल Gemini लॉन्च का प्रारंभिक स्वागत मिश्रित था, कुछ विपणन प्रदर्शनों की बाद में आलोचना की गई कि वे लाइव मॉडल क्षमताओं का पूरी तरह से प्रतिनिधित्व नहीं करते थे, जबकि बाद के संस्करणों, विशेष रूप से 2.0 और उसके बाद की रिलीज़, को व्यापक रूप से प्रतिद्वंद्वी प्रयोगशालाओं के साथ क्षमता अंतर को बंद करने या आगे बढ़ने का श्रेय दिया गया। Google की खोज और उपभोक्ता उत्पादों में Gemini का गहरा एकीकरण इसे उपयोगकर्ता पहुंच के हिसाब से सबसे व्यापक रूप से वितरित AI मॉडल परिवारों में से एक बनाता है, भले ही यह हमेशा कच्चे बेंचमार्क प्रदर्शन में अग्रणी न रहा हो, और इसका प्रक्षेपवक्र बारीकी से देखा गया है कि क्या Google अपने बुनियादी ढांचे और वितरण लाभों को निरंतर AI नेतृत्व में बदल सकता है।