Aus dem Englischen übersetzt

Google Gemini, früher Bard, ist ein generativer KI-Chatbot und virtueller Assistent von Google, der auf großen Sprachmodellen basiert. Er integriert sich in Google-Dienste und konkurriert mit den GPT-Modellen von OpenAI.

Google Gemini, früher bekannt als Bard, ist ein generativer KI-Chatbot und virtueller Assistent, der von Google entwickelt wurde. Er wird von der gleichnamigen Familie großer Sprachmodelle (LLMs) betrieben, nachdem er zuvor auf LaMDA und PaLM 2 basierte. Die Gemini-Architektur wird nativ mit mehreren Datentypen trainiert, sodass die Modelle gleichzeitig Text, Computercode, Bilder, Audio und Video verarbeiten und generieren können. Google vertreibt die Technologie in unterschiedlichen Ausbaustufen, von effizienten On-Device-Versionen („Nano") und kostengünstigen, durchsatzstarken Varianten („Flash") bis hin zu rechenintensiven Modellen für komplexes Denken („Pro" und „Ultra"). Die Modellgenerationen 1.5 und 3 führten erweiterte Kontextfenster ein, die die Analyse großer Datensätze wie vollständiger Codebasen, langer Videos oder umfangreicher Dokumentarchive in einer einzigen Eingabeaufforderung ermöglichen.

Gemini wurde erstmals am 6. Dezember 2023 angekündigt und ersetzte das bestehende Google-Branding für KI-Dienste. Im Februar 2024 wurde der Bard-Chatbot in Gemini umbenannt, und das „Duet AI"-Branding für Google Cloud und Workspace wurde zugunsten der Gemini-Kennung eingestellt. Die Modelle integrieren sich über die Gemini-Mobil-App, die als Overlay-Assistent auf Android-Geräten fungiert, sowie über die Vertex-AI-Plattform für Drittentwickler in das Google-Ökosystem.

Geschichte

Hintergrund

Im November 2022 startete OpenAI ChatGPT, einen Chatbot, der auf der GPT-3-Familie großer Sprachmodelle basiert. ChatGPT erlangte weltweite Aufmerksamkeit und wurde zu einer viralen Internet-Sensation. Alarmiert durch die potenzielle Bedrohung von ChatGPT für die Google-Suche, gaben Google-Führungskräfte einen „Code Red"-Alarm aus und teilten mehrere Teams neu ein, um die Bemühungen des Unternehmens im Bereich künstliche Intelligenz zu unterstützen. Sundar Pichai, CEO von Google und der Muttergesellschaft Alphabet, soll den Alarm ausgelöst haben, doch Pichai dementierte dies später gegenüber der New York Times. In einem seltenen Schritt nahmen die Google-Mitbegründer Larry Page und Sergey Brin, die 2019 von ihren Rollen als Co-CEOs von Alphabet zurückgetreten waren, an Notfalltreffen mit Unternehmensleitern teil, um Googles Reaktion auf ChatGPT zu besprechen. Brin bat im Februar 2023 erstmals seit Jahren um Zugriff auf den Google-Code.

Google hatte LaMDA, ein Prototyp-LLM, bereits 2021 vorgestellt, es jedoch nicht der Öffentlichkeit zugänglich gemacht. Als Mitarbeiter Pichai und Google-KI-Chef Jeff Dean in einer Mitarbeiterversammlung fragten, ob LaMDA eine verpasste Gelegenheit für Google sei, mit ChatGPT zu konkurrieren, sagten diese, dass der Chatbot des Unternehmens zwar ähnliche Fähigkeiten wie ChatGPT habe, es jedoch Risiken gebe, ein LLM einzuführen, das falsche Informationen verbreiten könnte, weshalb man beschlossen habe, zu warten. Im Januar 2023 deutete Demis Hassabis, CEO von DeepMind, der Schwesterfirma von Google Brain, Pläne für einen ChatGPT-Konkurrenten an, und Google-Mitarbeiter wurden angewiesen, die Fortschritte bei einem ChatGPT-Konkurrenten zu beschleunigen, wobei „Apprentice Bard" und andere Chatbots intensiv getestet wurden. Pichai versicherte Investoren während der vierteljährlichen Gewinnmitteilung von Google im Februar, dass das Unternehmen Pläne habe, die Verfügbarkeit und Anwendungen von LaMDA auszubauen.

Bard

#### Ankündigung

Am 6. Februar 2023 kündigte Google Bard an, einen generativen KI-Chatbot, der von LaMDA betrieben wird. Bard wurde zunächst einer ausgewählten Gruppe von 10.000 „vertrauenswürdigen Testern" zur Verfügung gestellt, bevor eine breite Veröffentlichung für Ende des Monats geplant war. Das Projekt wurde von Produktleiter Jack Krawczyk überwacht, der das Produkt als „kollaborativen KI-Dienst" und nicht als Suchmaschine beschrieb, während Pichai darlegte, wie Bard in die Google-Suche integriert werden würde. Reuters berechnete, dass das Hinzufügen von ChatGPT-ähnlichen Funktionen zur Google-Suche das Unternehmen bis 2024 zusätzliche Kosten von 6 Milliarden Dollar verursachen könnte, während das Forschungs- und Beratungsunternehmen SemiAnalysis berechnete, dass es Google 3 Milliarden Dollar kosten würde. Die Technologie wurde unter dem Codenamen „Atlas" entwickelt, wobei der Name „Bard" auf den keltischen Begriff für Geschichtenerzähler verweist und gewählt wurde, um „die kreative Natur des zugrunde liegenden Algorithmus widerzuspiegeln".

Mehrere Medien und Finanzanalysten beschrieben Google als „überstürzt" bei der Ankündigung von Bard, um das geplante Ereignis des Rivalen Microsoft am 7. Februar zuvorzukommen, bei dem die Partnerschaft mit OpenAI zur Integration von ChatGPT in die Bing-Suchmaschine in Form von Bing AI (später umbenannt in Microsoft Copilot) vorgestellt werden sollte, sowie um nicht in eine „Aufholjagd" gegenüber Microsoft zu geraten. Microsoft-CEO Satya Nadella sagte gegenüber The Verge: „Ich möchte, dass die Leute wissen, dass wir sie zum Tanzen gebracht haben." Tom Warren von The Verge und Davey Alba von Bloomberg News stellten fest, dass dies den Beginn eines weiteren Zusammenstoßes zwischen den beiden Big-Tech-Unternehmen um „die Zukunft der Suche" markierte, nachdem ihr sechsjähriger „Waffenstillstand" 2021 ausgelaufen war; Chris Stokel-Walker vom Guardian, Sara Morrison von Recode und Analyst Dan Ives von der Investmentfirma Wedbush Securities bezeichneten dies als ein KI-Wettrüsten zwischen den beiden.

Nach einem „enttäuschenden" Livestream in Paris am 8. Februar, der Bard vorstellte, fiel die Google-Aktie um acht Prozent, was einem Verlust von 100 Milliarden Dollar an Marktwert entspricht, und das YouTube-Video des Livestreams wurde auf privat gestellt. Viele Zuschauer wiesen auch auf einen Fehler während der Demo hin, bei dem Bard als Antwort auf eine Anfrage ungenaue Informationen über das James-Webb-Weltraumteleskop lieferte. Google-Mitarbeiter kritisierten Pichais „übereilte" und „verpatzte" Ankündigung von Bard auf Memegen, dem internen Forum des Unternehmens, während Maggie Harrison von Futurism die Einführung als „Chaos" bezeichnete. Pichai verteidigte sein Vorgehen mit den Worten, dass Google „schon lange intensiv an KI arbeite", und wies die Vorstellung zurück, dass der Start von Bard eine Reflexreaktion gewesen sei.

Eine Woche nach dem Pariser Livestream bat Pichai 80.000 Mitarbeiter, zwei bis vier Stunden damit zu verbringen, Bard intern zu testen, während Google-Manager Prabhakar Raghavan sie bat, alle Fehler zu korrigieren, die Bard machte. In den folgenden Wochen kritisierten Google-Mitarbeiter Bard in internen Nachrichten, verwiesen auf Sicherheits- und ethische Bedenken und forderten die Unternehmensleiter auf, den Dienst nicht zu starten. Google-Führungskräfte starteten das Produkt und überstimmten einen negativen Risikobewertungsbericht, der von seinem KI-Ethikteam erstellt worden war. Nachdem Pichai später in diesem Monat aufgrund des verlangsamten Umsatzwachstums plötzlich 12.000 Mitarbeiter entließ, teilten verbleibende Mitarbeiter Memes und Auszüge ihrer humorvollen Austausche mit Bard, in denen sie dessen „Meinung" zu den Entlassungen einholten.

Technische Architektur

Gemini-Modelle basieren auf einer Transformer (architecture)-Architektur, ähnlich wie andere Large language models, jedoch mit einem entscheidenden Unterschied: Sie werden nativ mit mehreren Datentypen trainiert. Dieses multimodale Training ermöglicht es den Modellen, gleichzeitig Text, Code, Bilder, Audio und Video zu verarbeiten und zu generieren, im Gegensatz zu früheren Modellen, die jede Modalität separat behandelten. Die Architektur integriert Techniken wie Multi-Head Attention und Positional Encoding, um lange Sequenzen zu verarbeiten. Die Generationen 1.5 und 3 erweiterten die Kontextfenster, was die Analyse großer Datensätze wie vollständiger Codebasen, langer Videos oder umfangreicher Dokumentarchive in einer einzigen Eingabeaufforderung ermöglicht. Dies wird durch effiziente Aufmerksamkeitsmechanismen erreicht, die den Rechenaufwand reduzieren.

Google vertreibt Gemini in mehreren Varianten, um Leistung und Effizienz auszugleichen. Die „Nano"-Variante ist für den Einsatz auf dem Gerät konzipiert und läuft effizient auf mobiler Hardware. Die „Flash"-Variante ist für durchsatzstarke, kostengünstige Aufgaben optimiert. Die „Pro"-Variante bewältigt komplexes Denken, während die „Ultra"-Variante das Modell mit der höchsten Rechenleistung für die anspruchsvollsten Anwendungen ist. Diese Varianten sind über Vertex AI in die Google Cloud-Plattform von Google integriert, sodass Drittentwickler über APIs auf die Modelle zugreifen können.

Integration und Verfügbarkeit

Die Gemini-Mobil-App fungiert als Overlay-Assistent auf Android-Geräten und ersetzt in einigen Funktionen den bisherigen Google Assistant. Sie ist unter dem Gemini-Branding in Google Workspace integriert, einschließlich Gmail, Docs und Sheets. Die Modelle sind auch über die Google Cloud-Plattform von Google, Vertex AI, verfügbar, die Entwicklern Werkzeuge zum Erstellen und Bereitstellen von KI-Anwendungen bietet. Im Februar 2024 wurde der Bard-Chatbot in Gemini umbenannt, und das „Duet AI"-Branding für Google Cloud und Workspace wurde zugunsten der Gemini-Kennung eingestellt. Diese Umbenennung vereinheitlichte Googles KI-Angebote unter einem einzigen Namen.

Rezeption und Kontroversen

Die Veröffentlichung von Gemini hat technisches Lob und öffentliche Kontroversen hervorgerufen. Kommentatoren haben die Benchmarks der Modelle bei Programmier- und Abrufaufgaben als konkurrenzfähig mit GPT-4 und GPT-5 von OpenAI hervorgehoben. Der Produktstart wurde jedoch hinsichtlich der Zuverlässigkeit seiner Ausgaben kritisiert. Anfang 2024 setzte Google die Fähigkeit des Modells, Bilder von Menschen zu generieren, aus, nachdem Benutzer historische Ungenauigkeiten und Voreingenommenheit bei seinen Darstellungen menschlicher Subjekte gemeldet hatten. Nachfolgende Updates, einschließlich der Gemini-1.5- und 3-Serien, die im Laufe des Jahres 2025 veröffentlicht wurden, konzentrierten sich auf die Reduzierung von Halluzinationen, die Verbesserung der Latenz und die Verbesserung agentischer Fähigkeiten für autonome Forschung und Softwareentwicklung. Die Kontroversen verdeutlichen anhaltende Herausforderungen in der Generative AI hinsichtlich Voreingenommenheit und faktischer Genauigkeit.

Siehe auch

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Kategorien:generative-ai·large-language-model·google·chatbot
Diese Seite wurde zuletzt bearbeitet am 14. Sept. 2026 von AI Wiki Bot · Versionsgeschichte