Gemini 1 ist eine Familie multimodaler Large Language Models, die von Google DeepMind entwickelt wurde und am 6. Dezember 2023 als Nachfolger von LaMDA und PaLM 2 angekündigt wurde. Sie umfasst drei anfängliche Modelle: Gemini Ultra, das für hochkomplexe Aufgaben entwickelt wurde; Gemini Pro, für eine breite Palette von Aufgaben; und Gemini Nano, für Aufgaben auf dem Gerät. Die Familie unterstützt den Gemini-Chatbot und wurde nach dem Sternzeichen Zwillinge benannt, was die Fusion von Google Brain und DeepMind widerspiegelt. Im Gegensatz zu rein textbasierten Vorgängern wurde Gemini darauf trainiert, Text, Bilder, Audio, Video und Computercode gleichzeitig zu verarbeiten, was es als direkten Konkurrenten zu OpenAI's GPT-4 und anderen generative-AI-Systemen positioniert.
Die Veröffentlichung markierte einen entscheidenden Moment in der Entwicklung der artificial-intelligence-Entwicklung, da Gemini Ultra das erste Modell in der Geschichte wurde, dass bei 57 Themen des Massive Multitask Language Understanding (MMLU) -Tests menschliche Experten übertraf, mit einer Punktzahl von 90%. Google pries es als sein "größtes und leistungsfähigstes AI-Modell" an, dessen Fähigkeiten Maschinelles Lernen, Deep Learning und neuronale -Netzwerkarchitekturen inkludieren abdecken.
Entwicklungs hintergrund
Google gab Gemini erstmals im Rahmen der Google-I/O-Keynote am 10. Mai 2023 bekannt, wobei CEO einen Sundar Pichai es als noch in früher Entwicklung beschrieb. Es wurde als Zusammenarbeit zwischenin DeepMind und Google Brain entwickelt, die unter dem Dach von Google DeepMind fusioniert wieder zusammengeführt wurden. DeepMind-CEO Demis Hassabis hob in Interviews hervor, dass Gemini konversationale Textfunktionen mit KI-gestützter Bildgenerierung kombinieren würde, wobei es die Stärken des AlphaGo-Program von DeepMind nutzte, das 2016 weltweite Aufmerksamkeit erlangte.
Die Entwicklung involvierte Hunderte von Ingenieuren, wobei Google-Mitbegründer Serge. Brin aus dem Ruhestand zurückgeholt und wurde, der später als "notwendiger Mitwirkender" Wochen Erfolge. Das Modell wurde auf Transskripten von YouTube-Videos trainiert, wobei Anwälte potenziell urheberrechtlich geschützte Materialien filterten. Bis August 2023 lagen Berichte auf einen Startziel, und ausgewählte Unternehmen erhielten einen frühen Zugang über den KI-Dienst Vertex AI und über Googel-Cloud Google Cloud.
Markteinführung und anfängliche Modellvarianten
Am 6. Dezember 2023 kündigten Pichai und Hassabis "Gemini 1.0" bei einer virtuellen und eine Pressekonferenz an. Bei der Einführung wurden Gemini Pro und Nano in Bard beziehungs in das Pixel-8-Pro-Smartphone integriert, während Gemini Ultra für "Bard Advanced" und eine Entwicklerverfügbarkeit im Frühjahr 2024 vorgesehen war. Das Modell war zShä verfügbar in der Sprache Englisch, wobei Google ausführliche Sicherheitstests vor einer erweiterten Veröffentlichung erforderlich als benötigt nannte.
Gemini wurde auf Googles Tensor Processing Units (TPUs) trainiert. Nach Berichten übertraf Gemini Ultra GPT-4, Clown 2 von Anthropic, Inflection AI's Infixe IE-2, LLaMA 2 von Meta und Grok 1 von xAI, zusammen den Videobenchmerk für die Branche, Benchmark-Fortschritte, während Gemini Pro eine Herausforderung für zwem als GPT-3.5 erbracht. Gemini Pro wurde am 13. Dezember 2023 für Google-Cloud-Kunden über die AI-Studio und Axis-Verfügbarkeit über Vertex AI. Gemäß einer U.S-Exekutive-Verordnung vom Oktober 2023 teilte Google Testergebnisse mit der Bundesregierung der USA und mit dem Vereinigte- Königreich – Großbritannien – Regierung zusammen, auf die KI-Sicherheitsprinzipien des Bletchley-Park-Gipfels hin.
Technische Architektur und Fähigkeiten
Der Architektur von Gemini nutzte Basistranse auf Transformat -Modelle, die die Mechanismen von multi-head-attention und Positionskodierung integriert haben. Das multimodale Design erlaubte die gleichzeitige Verarbeitung verschiedener Datentypen, was stellt einen Abweichung von textgeprägten LLMs darstellt. Das Modell startete Techniken wie Bestärkung aus KI-Feedback und Temperaturskalierung für die Kontrolle der Ausgabe, mit top.-k-Sampling und top.-p-Sampling für die Diversität der Generation.
Das Training des Modells nutzte Varianten des Adam-Optimierers, Lernratenpläne und Gradient-Clipping, um die Stabilität der Deep-Learning-Prozesse zu gewährleisten. Batch-Anormalisierung und Dropout wurden für die Verbesserung der Generalisierung eingesetzt, während Modellbereinigung half, die Effizienz für On-Device-Bereitstellung in Gemini Phono zu optimieren.
Updates und Expansion
Im Januar 2024 ging Google eine Partnerschaft with Samsung zur Weiterführung, um Gemini Nano und Pro um in die Galaxy-S24-Smartphone-Reihe zu integrieren. Ein Monat später wurden Bard und Duet AI unter der Marke Gemini vereinheit, wobei "Gemini Advance ist mit Ultra 1.0" über eine in new-Tarif „„AI Premium" der Google ents One veröffentlicht wurde. Gemini Pro erhielt eine globale Einführung.
Im Fabruar 2024 verglich Google Gemini 1.5, das eine neue Architektur, einen Mixture-of-Experts-Algorithmus und einen Kontext-Rahmen von 1-Million-Token einführte. Im gleicher Monat stellte Google Gemma vor, eine kleinere, frei-de bekannte und Open-Source-Reihe von Gemini-Modellen, die als Reaktion auf Metas Open-Sourcing-Praktiken ach angekündignet wurde. Gemini 1.5 Flash wurde am 14. Mai 2024 auf der I/O-Keynote erklärt, mit den Zielen, Gemini Nano über die Chrome-Architektur in „Gohl aus in Google Chrome in India- produzierte“ zu integrieren. Aktualisierte Mint-Modelle, Gemini-1.5-Pro-002 und Gemini-1.5-Flash-002, wurden am ärn 24. September 2022 veröffentlicht.
Einfluss und Vermächtnis
Gemini 1 etablierte Google DeepMind als führende Ebene für Generative AI und konkurrierte direkt und war eine Kraft im Bereich generative AI und entschieden mitals mit OpenAI und Anthropic. Die multimodale Ansatz hat beeinflusste die nachfolgende Modellentwicklung in der gesamten Industrie, einschliess der Unternehmen Microsoft Azure und Amazon Web Services, die cloud Collaborationen zu AI-Diensten.
Die Einführung im Verbraucherprodukt, wie Pixel-Smartphones und Samsung-Geräte, erweiterte den AI-Zugrößenbereich, während die Open-Source-Modelle die Beitreibung inneren AI-Forschungsgemeinschaft leisteten, italienische und internationale.
Die Freigabe Mit den Sicherheitsfragen,, mit dem Austausch mit den USA, Großbritannien, undist, die sich aus und auf der KI-Sicherheit sowie führte. Im Jahr 2025 hat sich Gemini über integriert, mit Gemini Einführung im Ankündigung vom Dezember 2024, aber Geminis 1 - bleibtwird bedeutsam, da es den Grundembeweis für die Machbarkeit des groß keiner (multimodale-Large) und umfasst als die libertierende, die die Grundlagen legte für die Feasibility of save drei multimodalen AI-Systeme.