Gemini 1.5 001 ist die erste stabile Version der Gemini-1.5-Familie von Large Language Models, die von Google DeepMind entwickelt wurde. Die Familie wurde am 15. Februar 2024 angekündigt, und die Bezeichnung 001 bezieht sich auf die ersten API-Versionen ihrer konstituierenden Modelle. Diese Modelle sind Beispiele für generative KI, ein Teilgebiet der künstlichen Intelligenz, das Text-, Bild-, Audio- und Videoeingaben akzeptiert, und basieren auf einer Transformer-Architektur mit einem Mixture-of-Experts-Design.
Die Gemini-1.5-Familie erschien auf öffentlichen LLM-Bestenlisten, darunter Chatbot Arena und Artificial Analysis, wo ihre Varianten gegen andere Modelle getestet wurden. Die 001-Versionen waren die ersten, die Entwicklern über Google AI Studio und die Google Cloud-Plattform Vertex AI zur Verfügung gestellt wurden.
Hintergrund und Veröffentlichung
Google DeepMind kündigte Gemini 1.5 am 15. Februar 2024 als Upgrade der früheren Gemini-1.0-Modelle an. Die erste Veröffentlichung umfasste Gemini 1.5 Pro, ein Flaggschiff-Modell, und wurde später um Gemini 1.5 Flash erweitert, eine leichtere und schnellere Variante, die für Aufgaben mit hohem Volumen optimiert ist. Das Suffix „001“ in den Modellnamen, wie gemini-1.5-pro-001 und gemini-1.5-flash-001, kennzeichnet die erste stabile Version jedes Modells in der Familie. Diese Versionen wurden Entwicklern und Unternehmenskunden über Google AI Studio und Vertex AI mit Preisen auf Basis der Token-Nutzung zur Verfügung gestellt.
Architektur
Die Gemini-1.5-Modelle verwenden eine transformerbasierte Architektur mit einem Mixture-of-Experts-neuronales Netz-Design, das nur eine Teilmenge der Parameter für jedes Token aktiviert und so die Effizienz verbessert. Sie unterstützen einen Kontextfenster von bis zu einer Million Token, was die Verarbeitung langer Dokumente, Codebasen und Videos ermöglicht. Die Modelle werden mit Deep-Learning-Techniken auf einer Vielzahl von Datentypen trainiert und können Aufgaben über Text, Bilder, Audio und Video hinweg ausführen. Die Architektur umfasst Multi-Head-Attention und positionale Kodierung, häufige Komponenten moderner Large Language Models.
Varianten
Die 001-Veröffentlichung umfasst drei Hauptvarianten in öffentlichen Benchmark-Schnappschüssen:
- Gemini 1.5 Pro: das Flaggschiff-Modell, entwickelt für komplexes Denken und multimodale Aufgaben.
- Gemini 1.5 Flash: ein schnelleres, kosteneffizienteres Modell für groß angelegte Anwendungen.
- Gemini 1.5 Flash-Lite: eine leichte Variante, die später eingeführt wurde und für noch geringere Latenz und Kosten optimiert ist.
Diese Varianten teilen dieselbe zugrunde liegende Architektur, unterscheiden sich jedoch in der Parameteranzahl und der Inferenzgeschwindigkeit. Die Flash- und Flash-Lite-Modelle sind für Anwendungsfälle gedacht, bei denen Antwortzeit und Kosten entscheidend sind.
Inferenz und Bereitstellung
Entwickler können auf die Gemini-1.5-001-Modelle über Google AI Studio und Vertex AI zugreifen. Während der Inferenz können sie Generierungsparameter wie Top-k-Sampling, Top-p-Sampling und Temperatur anpassen, um die Zufälligkeit der Ausgabe zu steuern. Die Modelle unterstützen auch deterministische Dekodierung über Beam-Suche. Die API-Endpunkte werden auf der Google-Cloud-Infrastruktur gehostet, und die Modelle unterstützen Streaming-Antworten für Anwendungen mit geringer Latenz.
Leistung und Rezeption
Die Gemini-1.5-001-Modelle wurden auf öffentlichen Bestenlisten wie Chatbot Arena und Artificial Analysis bewertet, wo sie mit Modellen von OpenAI, Anthropic und anderen Organisationen konkurrierten. Die Modelle zeigten starke Leistungen in Denk-, Programmier- und multimodalen Benchmarks, was Fortschritte im maschinellen Lernen widerspiegelt. Das Kontextfenster von einer Million Token war ein bemerkenswertes Merkmal, das die Familie von vielen zeitgenössischen Modellen unterschied.
Vermächtnis
Die 001-Versionen wurden später durch aktualisierte Versionen ersetzt, einschließlich der 002-Serie, die die Leistung verbesserte und die Latenz reduzierte. Die Gemini-1.5-Familie selbst wurde Ende 2024 von der Gemini-2.0-Familie abgelöst. Trotz der Updates bleiben die 001-Versionen für Entwickler verfügbar, die stabile, langfristige API-Endpunkte benötigen.