Gemini est une famille de modèles de langage multimodaux de grande taille (LLM) développée par Google DeepMind, une filiale de Google. Annoncée le 6 décembre 2023, Gemini succède aux modèles antérieurs de Google, LaMDA et PaLM 2. La famille de modèles comprend Gemini Pro, Gemini Deep Think, Gemini Flash et Gemini Flash Lite, et alimente le chatbot Gemini. Le nom dérive du signe du zodiaque des Gémeaux, symbolisant la double nature du projet, qui a fusionné Google Brain et DeepMind. Gemini est conçu pour traiter simultanément plusieurs types de données, notamment le texte, les images, l'audio, la vidéo et le code informatique, ce qui le distingue de nombreux prédécesseurs exclusivement textuels.
Contexte de développement
Google a d'abord annoncé Gemini lors du discours d'ouverture de Google I/O le 10 mai 2023, le positionnant comme un successeur plus puissant de PaLM 2, également dévoilé lors de cet événement. Le PDG de Google, Sundar Pichai, a déclaré que Gemini en était encore à ses premiers stades de développement. Contrairement aux modèles de langage typiques entraînés uniquement sur des corpus de texte, Gemini a été conçu dès le départ pour être multimodal, lui permettant de traiter simultanément divers types d'entrées. Le développement a été une collaboration entre DeepMind et Google Brain, deux branches qui ont été fusionnées en une seule entité, Google DeepMind.
Dans une interview avec Wired, le PDG de DeepMind, Demis Hassabis, a vanté les capacités avancées de Gemini, suggérant qu'il surpasserait le ChatGPT d'OpenAI, qui fonctionne sur GPT-4. Hassabis a souligné les points forts du programme AlphaGo de DeepMind, qui a attiré l'attention mondiale en 2016 lorsqu'il a battu le champion de Go Lee Sedol, déclarant que Gemini combinerait la puissance d'AlphaGo avec d'autres LLM de Google-DeepMind. Cette ambition reflétait la réponse agressive de Google à la popularité croissante de ChatGPT et de son propre chatbot Bard, lancé plus tôt.
En août 2023, The Information a publié un rapport décrivant la feuille de route de Google pour Gemini, révélant une date de lancement cible fin 2023. Le rapport indiquait que Google espérait surpasser OpenAI et d'autres concurrents en combinant les capacités de conversation textuelle avec la génération d'images alimentée par l'IA, permettant des images contextuelles et un plus large éventail de cas d'utilisation. Le cofondateur de Google, Sergey Brin, a été rappelé de sa retraite pour aider au développement, aux côtés de centaines d'ingénieurs de Google Brain et DeepMind ; il a ensuite été crédité comme un « contributeur principal ». Comme Gemini a été entraîné sur des transcriptions de vidéos YouTube, des avocats ont été sollicités pour filtrer les éléments potentiellement protégés par le droit d'auteur.
Lancement et modèles initiaux
Le 6 décembre 2023, Pichai et Hassabis ont annoncé « Gemini 1.0 » lors d'une conférence de presse virtuelle. La version comprenait trois modèles : Gemini Ultra, conçu pour des « tâches hautement complexes » ; Gemini Pro, pour « un large éventail de tâches » ; et Gemini Nano, pour des « tâches sur appareil ». Lors du lancement, Gemini Pro et Nano ont été intégrés respectivement à Bard et au smartphone Pixel 8 Pro. Gemini Ultra devait alimenter « Bard Advanced » et devenir disponible pour les développeurs de logiciels début 2024. D'autres produits destinés à l'intégration comprenaient Search, Ads, Chrome, Duet AI sur Google Workspace et AlphaCode 2. La version initiale n'était disponible qu'en anglais.
Google a présenté Gemini comme son « modèle d'IA le plus grand et le plus capable », conçu pour imiter le comportement humain. La société a déclaré que Gemini ne serait pas largement disponible avant l'année suivante en raison de la nécessité de « tests de sécurité approfondis ». Gemini a été entraîné et alimenté par les unités de traitement tensoriel (TPU) de Google. Le nom fait également référence au projet Gemini de la NASA, reflétant la fusion de DeepMind et de Google Brain.
Performances et références
Il a été rapporté que Gemini Ultra surpassait GPT-4, Claude 2 d'Anthropic, Inflection-2 d'Inflection AI, LLaMA 2 de Meta et Grok 1 de xAI sur divers critères de référence de l'industrie. Gemini Pro aurait surpassé GPT-3.5. Notamment, Gemini Ultra a été le premier modèle de langage à surpasser les experts humains au test Massive Multitask Language Understanding (MMLU) portant sur 57 sujets, obtenant un score de 90 %. Ce résultat de référence a positionné Gemini comme un modèle de premier plan dans le domaine de la intelligence artificielle et de la recherche sur les modèles de langage de grande taille.
Gemini Pro a été mis à la disposition des clients de Google Cloud sur AI Studio et Vertex AI le 13 décembre 2023. Gemini Nano a ensuite été mis à la disposition des développeurs Android. Hassabis a en outre révélé que DeepMind explorait comment Gemini pourrait être combiné à la robotique pour interagir physiquement avec le monde. Conformément à un décret signé par le président américain Joe Biden en octobre 2023, Google a déclaré qu'il partagerait les résultats des tests de Gemini Ultra avec le gouvernement fédéral. De même, la société a engagé des discussions avec le gouvernement du Royaume-Uni pour se conformer aux principes énoncés lors du sommet sur la sécurité de l'IA à Bletchley Park en novembre 2023.
Intégration avec les produits Google
Après son lancement, Gemini a été rapidement intégré dans l'écosystème de Google. En janvier 2024, Google s'est associé à Samsung pour intégrer Gemini Nano et Gemini Pro dans la gamme de smartphones Galaxy S24. Le mois suivant, Bard et Duet AI ont été unifiés sous la marque Gemini, avec « Gemini Advanced with Ultra 1.0 » publié via un nouveau niveau « AI Premium » du service d'abonnement Google One. Gemini Pro a également connu un lancement mondial, élargissant sa disponibilité au-delà de sa disponibilité initiale en anglais uniquement.
En février 2024, Google a lancé Gemini 1.5, le décrivant comme plus puissant et plus capable que le 1.0 Ultra. Les changements comprenaient une nouvelle architecture, une approche de mélange d'experts et une fenêtre de contexte plus grande d'un million de jetons. Le même mois, Google a dévoilé Gemma, une gamme plus petite, gratuite et open source de modèles Gemini. Plusieurs publications ont décrit cela comme une réponse à Meta et à d'autres qui ont ouvert leurs modèles d'IA, et un revirement par rapport à la pratique antérieure de Google de garder son IA propriétaire.
Google a annoncé un modèle supplémentaire, Gemini 1.5 Flash, le 14 mai lors du discours d'ouverture de l'I/O 2024. Lors du même événement, Google a annoncé son intention d'intégrer une version de Gemini Nano optimisée pour le bureau directement dans le navigateur Google Chrome via son architecture « Built-in AI », exposant les capacités de traitement local aux développeurs web via des API expérimentales telles que l'API Prompt (« window.ai »).
Mises à jour ultérieures et modèles
Deux modèles Gemini mis à jour, Gemini-1.5-Pro-002 et Gemini-1.5-Flash-002, ont été publiés le 24 septembre 2024. Le 11 décembre 2024, Google a annoncé le nouveau modèle expérimental Gemini 2.0 Flash. Les fonctionnalités comprenaient une API multimodale en direct pour les interactions audio et vidéo en temps réel, la génération native d'images et de synthèse vocale contrôlable (avec filigrane), et la recherche Google intégrée. Cette itération a continué à repousser les limites des capacités de l'IA multimodale.
En juin 2025, Google a introduit Gemini CLI, un agent d'IA open source qui apporte les capacités de Gemini directement au terminal, offrant des fonctionnalités avancées de codage, d'automatisation et de résolution de problèmes avec des limites d'utilisation gratuites généreuses pour les développeurs individuels. Cette décision a souligné l'engagement de Google en faveur de l'accessibilité des développeurs et des outils open source.
Positionnement concurrentiel
La sortie de Gemini a été un événement important dans le paysage concurrentiel de la IA générative. Google a positionné Gemini directement contre les modèles de OpenAI, Anthropic et d'autres organisations de recherche en IA. Les capacités multimodales du modèle et ses performances de référence solides étaient destinées à défier la domination de GPT-4 et d'autres LLM de premier plan. L'intégration de Gemini dans le vaste écosystème de produits de Google, y compris Search, Workspace et Android, a fourni un avantage de distribution par rapport aux concurrents.
Le développement de Gemini a également impliqué des collaborations avec des partenaires matériels. L'intégration avec le Galaxy S24 de Samsung a souligné l'importance de l'IA sur appareil, tandis que l'utilisation des TPU de Google a souligné le rôle du matériel spécialisé dans la formation de grands modèles. La dynamique concurrentielle s'est étendue aux services cloud, avec Gemini Pro disponible sur Google Cloud Vertex AI, en concurrence avec les offres de Amazon Web Services et Azure.
Architecture technique et recherche
L'architecture de Gemini s'appuie sur les avancées en matière de apprentissage profond et de modèles transformers. En tant que modèle multimodal, il intègre des techniques d'attention multi-têtes et de attention croisée pour traiter et relier les informations à travers différentes modalités. L'approche de mélange d'experts dans Gemini 1.5 permet une mise à l'échelle plus efficace, n'activant que les parties pertinentes du réseau pour des tâches données. La formation du modèle a probablement impliqué des techniques telles que le RLFA (apprentissage par renforcement à partir de retours d'IA) et l'apprentissage curriculaire pour améliorer les performances et l'alignement.
La recherche derrière Gemini s'appuie sur le domaine plus large de l'apprentissage automatique, y compris les contributions d'institutions comme le CSAIL du MIT, le laboratoire d'IA de Stanford et le recherche en IA de Berkeley. L'héritage de Google DeepMind, y compris le programme AlphaGo, a éclairé la conception du modèle, en particulier sa capacité à gérer des tâches de raisonnement complexes et en plusieurs étapes. Le développement a également impliqué des chercheurs comme Demis Hassabis et d'autres figures clés de la communauté de l'IA.
Sécurité et gouvernance
Google a mis l'accent sur les tests de sécurité pour Gemini, retardant la large disponibilité pour mener des évaluations approfondies. La société s'est engagée à partager les résultats des tests avec le gouvernement fédéral américain à la suite du décret d'octobre 2023 sur l'IA. Les discussions avec le gouvernement britannique visaient à s'aligner sur les principes du sommet sur la sécurité de l'IA à Bletchley Park. Ces mesures reflètent la surveillance réglementaire croissante de l'intelligence artificielle et la nécessité d'un déploiement responsable de modèles puissants.
L'intégration de Gemini dans des produits de consommation comme le Pixel 8 Pro et le Galaxy S24 a soulevé des questions sur la confidentialité et le traitement sur appareil. Les capacités de traitement local de Gemini Nano ont été conçues pour minimiser la transmission de données, répondant à certaines préoccupations en matière de confidentialité. Cependant, le déploiement plus large de l'IA multimodale continue de susciter un débat sur l'utilisation éthique et les impacts sociétaux potentiels.
Orientations futures
En 2025, Gemini continue d'évoluer avec de nouveaux modèles et fonctionnalités. L'introduction de Gemini CLI et des modèles open source Gemma indique une stratégie d'élargissement de l'accès aux capacités de l'IA. L'investissement continu de Google dans Google DeepMind et son intégration avec Google Cloud suggèrent que Gemini restera un pilier central de la stratégie d'IA de l'entreprise. Les développements futurs pourraient inclure de nouvelles améliorations du raisonnement, des architectures plus efficaces et une intégration plus profonde avec la robotique et les systèmes physiques, comme l'ont laissé entendre les commentaires de Hassabis sur la combinaison de Gemini avec la robotique.
Le paysage concurrentiel reste dynamique, avec OpenAI et Anthropic qui continuent de publier des modèles avancés. Le succès de Gemini dépendra de sa capacité à maintenir son leadership en matière de performances, à étendre ses capacités multimodales et à naviguer dans le paysage réglementaire et éthique complexe de l'IA. Le nom du modèle, évoquant la double nature du signe du zodiaque, capture bien l'ambition du projet d'unifier diverses capacités d'IA en un système unique et puissant.