Der Start von Google Gemini Ultra im Februar 2024 markierte die öffentliche Veröffentlichung von Gemini Ultra 1.0, dem größten und leistungsfähigsten Modell in der Gemini-Familie multimodaler großer Sprachmodelle, die von Google DeepMind entwickelt wurden. Dieser Start folgte auf die erste Ankündigung von Gemini 1.0 am 6. Dezember 2023 und machte das Modell Verbrauchern über eine neue Abonnementstufe zugänglich, wodurch es als direkter Konkurrent zu anderen fortschrittlichen KI-Systemen wie OpenAIs GPT-4 positioniert wurde.
Gemini Ultra 1.0 wurde für hochkomplexe Aufgaben entwickelt und unterschied sich damit von den anderen Modellen der Gemini-Familie, wie Gemini Pro und Gemini Nano. Es wurde in Bard Advanced integriert, eine Premium-Version von Googles KI-Chatbot, und war auch über den Google-One-Abonnementdienst unter der Stufe „AI Premium" erhältlich. Der Start stellte einen bedeutenden Schritt in Googles Bemühungen dar, seine fortschrittlichste KI-Technologie zu kommerzialisieren und im sich schnell entwickelnden Markt für generative KI zu konkurrieren.
Hintergrund und Entwicklung
Die Entwicklung von Gemini begann als Zusammenarbeit zwischen Google Brain und DeepMind, die im April 2023 zu Google DeepMind fusionierten. Auf der Google-I/O-Keynote am 10. Mai 2023 angekündigt, wurde Gemini als Nachfolger von PaLM 2 positioniert, mit einem Fokus auf Multimodalität - die Fähigkeit, Text, Bilder, Audio, Video und Computercode gleichzeitig zu verarbeiten. Google-CEO Sundar Pichai und DeepMind-CEO Demis Hassabis leiteten das Projekt, wobei Mitbegründer Sergey Brin Berichten zufolge als „Kernbeiträger" mitwirkte.
Während der Entwicklung zielte Google darauf ab, bestehende Modelle wie GPT-4 und Anthropics Claude 2 zu übertreffen. Das Modell wurde auf Googles Tensor Processing Units (TPUs) trainiert und integrierte Techniken aus DeepMinds AlphaGo-Programm. Bis August 2023 deuteten Berichte darauf hin, dass Google einen Start Ende 2023 anstrebte, und ausgewählten Unternehmen wurde über Googles Cloud-Dienst Vertex AI früher Zugriff gewährt.
Ankündigung und erste Veröffentlichung
Am 6. Dezember 2023 kündigten Pichai und Hassabis Gemini 1.0 auf einer virtuellen Pressekonferenz an. Die Veröffentlichung umfasste drei Modelle: Gemini Ultra, entwickelt für „hochkomplexe Aufgaben"; Gemini Pro, für „eine breite Palette von Aufgaben"; und Gemini Nano, für „Aufgaben auf dem Gerät". Zum Start wurden Gemini Pro und Nano in Bard bzw. das Smartphone Pixel 8 Pro integriert, während Gemini Ultra für Anfang 2024 über Bard Advanced geplant war.
Gemini Ultra wurde als Googles „größtes und leistungsfähigstes KI-Modell" angepriesen und war das erste, das menschliche Experten beim 57-Fächer-Test Massive Multitask Language Understanding (MMLU) übertraf, mit einer Punktzahl von 90 %. Es übertraf auch GPT-4, Claude 2, Inflection-2, LLaMA 2 und Grok 1 bei verschiedenen Benchmarks. Aufgrund umfangreicher Sicherheitstestanforderungen wurde das Modell erst im folgenden Jahr breit verfügbar gemacht.
Der Start im Februar 2024
Im Februar 2024 startete Google Gemini Ultra 1.0 als Teil der Erfahrung „Gemini Advanced", verfügbar über die Abonnementstufe Google One AI Premium. Dieser Start sah auch die Vereinheitlichung von Bard und Duet AI unter der Marke Gemini, wobei Bard Advanced zu Gemini Advanced wurde. Das Modell wurde Nutzern auf Englisch zur Verfügung gestellt, mit einem Abonnementpreis, der es als Premium-Angebot positionierte.
Der Start wurde von einer globalen Einführung von Gemini Pro begleitet, die den Zugang zum Modell auf weitere Regionen ausweitete. Google begann auch, Gemini in andere Produkte zu integrieren, darunter Search, Ads, Chrome und Google Workspace, was eine breitere Strategie signalisierte, KI in sein Ökosystem einzubetten.
Technische Fähigkeiten und Architektur
Gemini Ultra 1.0 basierte auf einer Transformer-Architektur, ähnlich wie andere große Sprachmodelle, jedoch mit Verbesserungen für multimodale Verarbeitung. Es konnte Text, Bilder, Audio, Video und Code verarbeiten, was es vielseitig für Anwendungen von natürlichem Sprachverständnis bis zur Codegenerierung machte. Das Modell wurde auf einem massiven Datensatz trainiert, einschließlich Transkripten von YouTube-Videos, wobei Rechtsteams urheberrechtlich geschütztes Material filterten.
Ein bemerkenswertes Merkmal war seine Fähigkeit, kontextuelle Bilder zu generieren, eine Fähigkeit, die es von reinen Textmodellen unterschied. Dies wurde durch Integration mit KI-gestützter Bildgenerierung erreicht, die es dem Modell ermöglichte, visuelle Inhalte basierend auf Textaufforderungen zu erstellen. Das Modell zeigte auch starke Leistungen bei Denk- und Problemlösungsaufgaben, wobei es Techniken aus Deep Learning und neuronalen Netzen nutzte.
Integration und Partnerschaften
Nach dem Start ging Google eine Partnerschaft mit Samsung ein, um Gemini Nano und Pro in die Galaxy-S24-Smartphone-Reihe im Januar 2024 zu integrieren. Dies markierte einen bedeutenden Schritt, um fortschrittliche KI auf mobile Geräte zu bringen, mit Verarbeitung auf dem Gerät für Aufgaben wie Zusammenfassung und Übersetzung.
Im Unternehmensbereich wurde Gemini Ultra Entwicklern über Googles Cloud-Dienste Vertex AI und AI Studio zur Verfügung gestellt, sodass Unternehmen benutzerdefinierte Anwendungen erstellen konnten. Das Modell wurde auch in Googles Duet AI für Workspace integriert, wodurch Produktivitätstools mit KI-gestützter Unterstützung verbessert wurden.
Rezeption und Auswirkungen
Der Start von Gemini Ultra 1.0 stieß in der KI-Community auf erhebliche Aufmerksamkeit, da er einen wichtigen Meilenstein im Wettlauf um fortschrittliche KI-Fähigkeiten darstellte. Seine Leistung bei Benchmarks wie MMLU setzte einen neuen Standard, und seine multimodalen Funktionen wurden als Schritt in Richtung menschenähnlicherer KI angesehen.
Einige Kritiker merkten jedoch an, dass die Verfügbarkeit des Modells begrenzt war und der abonnementbasierte Zugang als Barriere für einige Nutzer angesehen wurde. Trotzdem festigte der Start Googles Position als führend in künstlicher Intelligenz, in direkter Konkurrenz zu OpenAI und anderen Akteuren.
Nachfolgende Entwicklungen
In den Monaten nach dem Start entwickelte Google die Gemini-Familie weiter. Im Februar 2024 führte das Unternehmen Gemini 1.5 ein, das eine Mixture-of-Experts-Architektur und einen größeren Kontextfenster von einer Million Token aufwies. Später im Jahr veröffentlichte Google aktualisierte Versionen, Gemini-1.5-Pro-002 und Gemini-1.5-Flash-002, und im Dezember 2024 kündigte es Gemini 2.0 Flash Experimental an.
Diese Updates zeigten Googles Engagement für schnelle Fortschritte in der KI, wobei jede Iteration Verbesserungen bei Leistung, Effizienz und Fähigkeiten brachte. Der Start von Gemini Ultra markierte somit den Beginn einer neuen Ära in Googles KI-Angeboten und bereitete die Bühne für zukünftige Innovationen auf diesem Gebiet.