Google Gemini, anciennement connu sous le nom de Bard, est un chatbot d'intelligence artificielle générative et un assistant virtuel développé par Google. Il est propulsé par la famille de grands modèles de langage (LLM) du même nom, après avoir été précédemment basé sur LaMDA et PaLM 2. L'architecture Gemini est entraînée nativement sur plusieurs types de données, permettant aux modèles de traiter et de générer simultanément du texte, du code informatique, des images, de l'audio et de la vidéo. Google distribue la technologie à différentes capacités, allant de versions efficaces sur appareil (« Nano ») et de variantes rentables à haut débit (« Flash ») à des modèles à forte puissance de calcul conçus pour le raisonnement complexe (« Pro » et « Ultra »). Les générations de modèles 1.5 et 3 ont introduit des fenêtres de contexte étendues, permettant l'analyse de grands ensembles de données tels que des bases de code entières, des vidéos de longue durée ou des archives documentaires étendues en une seule invite.
Gemini a été annoncé pour la première fois le 6 décembre 2023 et a remplacé la marque existante de Google pour les services d'IA. En février 2024, le chatbot Bard a été renommé Gemini, et la marque « Duet AI » pour Google Cloud et Workspace a été retirée au profit de l'identifiant Gemini. Les modèles s'intègrent dans l'écosystème Google via l'application mobile Gemini, qui fonctionne comme un assistant superposé sur les appareils Android, et via la plateforme Vertex AI pour les développeurs tiers.
Historique
Contexte
En novembre 2022, OpenAI a lancé ChatGPT, un chatbot basé sur la famille GPT-3 de grands modèles de langage. ChatGPT a attiré l'attention mondiale, devenant un phénomène viral sur Internet. Alarmés par la menace potentielle de ChatGPT pour Google Search, les dirigeants de Google ont émis une alerte « code rouge », réaffectant plusieurs équipes pour aider aux efforts d'intelligence artificielle de l'entreprise. Sundar Pichai, le PDG de Google et de la société mère Alphabet, a été largement rapporté comme ayant émis l'alerte, mais Pichai a ensuite nié cela au New York Times. Dans un geste rare, les cofondateurs de Google, Larry Page et Sergey Brin, qui avaient démissionné de leurs rôles de co-PDG d'Alphabet en 2019, ont assisté à des réunions d'urgence avec les dirigeants de l'entreprise pour discuter de la réponse de Google à ChatGPT. Brin a demandé l'accès au code de Google en février 2023, pour la première fois depuis des années.
Google avait dévoilé LaMDA, un prototype de LLM, plus tôt en 2021, mais il n'avait pas été rendu public. Lorsqu'on leur a demandé lors d'une réunion générale si LaMDA était une opportunité manquée pour Google de concurrencer ChatGPT, Pichai et le chef de l'IA de Google, Jeff Dean, ont déclaré que bien que le chatbot de l'entreprise ait des capacités similaires à ChatGPT, il y avait des risques à introduire un LLM qui pourrait diffuser de fausses informations, ils ont donc décidé d'attendre. En janvier 2023, le PDG de DeepMind, société sœur de Google Brain, Demis Hassabis, a laissé entendre qu'il y avait des plans pour un rival de ChatGPT, et les employés de Google ont reçu pour instruction d'accélérer les progrès sur un concurrent de ChatGPT, en testant intensivement « Apprentice Bard » et d'autres chatbots. Pichai a assuré aux investisseurs lors de l'appel aux investisseurs sur les résultats trimestriels de Google en février que l'entreprise avait des plans pour étendre la disponibilité et les applications de LaMDA.
Bard
#### Annonce
Le 6 février 2023, Google a annoncé Bard, un chatbot d'intelligence artificielle générative propulsé par LaMDA. Bard a d'abord été déployé auprès d'un groupe sélectionné de 10 000 « testeurs de confiance », avant une large sortie prévue à la fin du mois. Le projet était supervisé par le responsable produit Jack Krawczyk, qui a décrit le produit comme un « service d'IA collaboratif » plutôt qu'un moteur de recherche, tandis que Pichai a détaillé comment Bard serait intégré à Google Search. Reuters a calculé que l'ajout de fonctionnalités de type ChatGPT à Google Search pourrait coûter à l'entreprise 6 milliards de dollars en dépenses supplémentaires d'ici 2024, tandis que la société de recherche et de conseil SemiAnalysis a calculé que cela coûterait à Google 3 milliards de dollars. La technologie a été développée sous le nom de code « Atlas », avec le nom « Bard » en référence au terme celtique pour un conteur et choisi pour « refléter la nature créative de l'algorithme sous-jacent ».
Plusieurs médias et analystes financiers ont décrit Google comme « précipitant » l'annonce de Bard pour devancer l'événement prévu par Microsoft le 7 février, dévoilant son partenariat avec OpenAI pour intégrer ChatGPT dans son moteur de recherche Bing sous la forme de Bing AI (plus tard rebaptisé Microsoft Copilot), ainsi que pour éviter de jouer au « rattrapage » face à Microsoft. Le PDG de Microsoft, Satya Nadella, a déclaré à The Verge : « Je veux que les gens sachent que nous les avons fait danser. » Tom Warren de The Verge et Davey Alba de Bloomberg News ont noté que cela marquait le début d'un autre affrontement entre les deux entreprises de la Big Tech sur « l'avenir de la recherche », après que leur « trêve » de six ans a expiré en 2021 ; Chris Stokel-Walker de The Guardian, Sara Morrison de Recode et l'analyste Dan Ives de la société d'investissement Wedbush Securities ont qualifié cela de course à l'armement en IA entre les deux.
Après un livestream « décevant » le 8 février à Paris présentant Bard, l'action de Google a chuté de huit pour cent, équivalent à une perte de 100 milliards de dollars en valeur de marché, et la vidéo YouTube du livestream a été rendue privée. De nombreux spectateurs ont également souligné une erreur lors de la démonstration où Bard donne des informations inexactes sur le télescope spatial James Webb en réponse à une requête. Les employés de Google ont critiqué l'annonce « précipitée » et « bâclée » de Bard par Pichai sur Memegen, le forum interne de l'entreprise, tandis que Maggie Harrison de Futurism a qualifié le déploiement de « chaos ». Pichai a défendu ses actions en disant que Google « travaillait profondément sur l'IA depuis longtemps », rejetant la notion que le lancement de Bard était une réaction instinctive.
Une semaine après le livestream de Paris, Pichai a demandé à 80 000 employés de passer deux à quatre heures à tester Bard en interne, tandis que le dirigeant de Google, Prabhakar Raghavan, leur a demandé de corriger toute erreur commise par Bard. Dans les semaines suivantes, les employés de Google ont critiqué Bard dans des messages internes, citant des préoccupations de sécurité et d'éthique et appelant les dirigeants de l'entreprise à ne pas lancer le service. Les dirigeants de Google ont lancé le produit, outrepassant un rapport d'évaluation des risques négatif mené par son équipe d'éthique de l'IA. Après que Pichai a soudainement licencié 12 000 employés plus tard ce mois-là en raison d'une croissance des revenus ralentie, les travailleurs restants ont partagé des mèmes et des extraits de leurs échanges humoristiques avec Bard sollicitant son « opinion » sur les licenciements.
Architecture technique
Les modèles Gemini sont construits sur une architecture Transformer (architecture), similaire à d'autres Large language models, mais avec une différence clé : ils sont entraînés nativement sur plusieurs types de données. Cet entraînement multimodal permet aux modèles de traiter et de générer simultanément du texte, du code, des images, de l'audio et de la vidéo, contrairement aux modèles antérieurs qui traitaient chaque modalité séparément. L'architecture intègre des techniques telles que Multi-Head Attention et Positional Encoding pour gérer les longues séquences. Les générations 1.5 et 3 ont étendu les fenêtres de contexte, permettant l'analyse de grands ensembles de données tels que des bases de code entières, des vidéos de longue durée ou des archives documentaires étendues en une seule invite. Cela est réalisé grâce à des mécanismes d'attention efficaces qui réduisent la surcharge de calcul.
Google distribue Gemini en plusieurs variantes pour équilibrer performance et efficacité. La variante « Nano » est conçue pour une utilisation sur appareil, fonctionnant efficacement sur le matériel mobile. La variante « Flash » est optimisée pour les tâches à haut débit et rentables. La variante « Pro » gère le raisonnement complexe, tandis que la variante « Ultra » est le modèle à plus forte puissance de calcul pour les applications les plus exigeantes. Ces variantes sont intégrées dans la plateforme Google Cloud de Google via Vertex AI, permettant aux développeurs tiers d'accéder aux modèles via des API.
Intégration et disponibilité
L'application mobile Gemini fonctionne comme un assistant superposé sur les appareils Android, remplaçant l'ancien Google Assistant dans certaines capacités. Elle est intégrée à Google Workspace, y compris Gmail, Docs et Sheets, sous la marque Gemini. Les modèles sont également disponibles via la plateforme Vertex AI de Google Cloud, qui fournit des outils aux développeurs pour créer et déployer des applications d'IA. En février 2024, le chatbot Bard a été renommé Gemini, et la marque « Duet AI » pour Google Cloud et Workspace a été retirée au profit de l'identifiant Gemini. Ce changement de marque a unifié les offres d'IA de Google sous un seul nom.
Réception et controverses
La sortie de Gemini a généré des éloges techniques et des controverses publiques. Les commentateurs ont souligné les performances des modèles dans les tâches de codage et de récupération comme étant compétitives avec GPT-4 et GPT-5 d'OpenAI. Cependant, le lancement du produit a fait face à des critiques concernant la fiabilité de ses sorties. Au début de 2024, Google a suspendu la capacité du modèle à générer des images de personnes après que des utilisateurs ont signalé des inexactitudes historiques et des biais dans ses représentations de sujets humains. Des mises à jour ultérieures, y compris les séries Gemini 1.5 et 3 publiées tout au long de 2025, se sont concentrées sur la réduction des hallucinations, l'amélioration de la latence et l'amélioration des capacités agentiques pour la recherche autonome et le développement de logiciels. Les controverses mettent en évidence les défis continus dans Generative AI concernant les biais et l'exactitude factuelle.