Gemini est une famille de modèles de langage multimodaux à grande échelle (LLM) développés par Google DeepMind, une filiale de Google. Annoncé le 6 décembre 2023, Gemini succède aux modèles précédents de Google, LaMDA et PaLM 2. Il est conçu pour traiter simultanément plusieurs types de données, notamment le texte, les images, l'audio, la vidéo et le code informatique, ce qui le distingue de nombreux LLM exclusivement textuels. Le nom Gemini fait référence au signe du zodiaque et évoque également la fusion de Google Brain et DeepMind, ainsi que le projet Gemini de la NASA.
Le lancement a introduit trois niveaux de modèles : Gemini Ultra, destiné aux tâches très complexes ; Gemini Pro, pour une large gamme de tâches ; et Gemini Nano, optimisé pour les tâches sur appareil. Lors du lancement, Gemini Pro a été intégré au chatbot Bard de Google, et Gemini Nano a alimenté des fonctionnalités sur le smartphone Pixel 8 Pro. Gemini Ultra devait être publié début 2024 sous le nom de « Bard Advanced ». Les modèles étaient initialement disponibles uniquement en anglais, Google invoquant la nécessité de tests de sécurité approfondis avant un déploiement plus large.
Développement
Google a d'abord annoncé Gemini lors du discours d'ouverture de Google I/O le 10 mai 2023, le PDG Sundar Pichai le décrivant comme un successeur plus puissant de PaLM 2, également dévoilé lors de cet événement. Contrairement aux LLM typiques, Gemini a été conçu dès le départ comme un système multimodal, capable de comprendre et de générer du texte, des images, de l'audio, de la vidéo et du code. Le développement a été une collaboration entre DeepMind et Google Brain, qui avaient fusionné pour former Google DeepMind plus tôt dans l'année.
Le PDG de DeepMind, Demis Hassabis, a souligné le potentiel de Gemini à surpasser ChatGPT d'OpenAI, qui fonctionnait avec GPT-4. Il a établi des parallèles avec AlphaGo, le programme de DeepMind qui a battu le champion de Go Lee Sedol en 2016, suggérant que Gemini combinerait les forces d'AlphaGo avec des capacités linguistiques avancées. En août 2023, The Information a rapporté que Google visait un lancement fin 2023, avec des projets d'intégration de la génération d'images et d'autres fonctionnalités multimodales pour devancer ses concurrents.
Le cofondateur de Google, Sergey Brin, est sorti de sa retraite pour aider au développement de Gemini, étant crédité comme un « contributeur essentiel ». Des centaines d'ingénieurs de Google Brain et DeepMind ont travaillé sur le projet. Comme Gemini a été entraîné sur des transcriptions de vidéos YouTube, des avocats ont été impliqués pour filtrer les contenus potentiellement protégés par le droit d'auteur.
Lancement et première diffusion
Le 6 décembre 2023, Pichai et Hassabis ont annoncé Gemini 1.0 lors d'une conférence de presse virtuelle. La structure à trois niveaux a été révélée : Ultra pour les tâches complexes, Pro pour les tâches générales et Nano pour les applications sur appareil. Lors du lancement, Gemini Pro a été intégré à Bard, et Gemini Nano a été intégré au Pixel 8 Pro. Gemini Ultra était prévu pour début 2024, alimentant « Bard Advanced » et disponible pour les développeurs. Google prévoyait d'intégrer Gemini dans Search, Ads, Chrome, Duet AI sur Google Workspace et AlphaCode 2.
Gemini a été entraîné sur les unités de traitement tensoriel (TPU) de Google. Google l'a présenté comme son « modèle d'IA le plus grand et le plus performant », conçu pour imiter le comportement humain. L'entreprise a déclaré que Gemini ne serait pas largement disponible avant l'année suivante en raison des exigences de tests de sécurité. Conformément à un décret exécutif américain signé par le président Joe Biden en octobre 2023, Google a accepté de partager les résultats des tests de Gemini Ultra avec le gouvernement fédéral. Des discussions avec le gouvernement britannique visaient également à s'aligner sur les principes du sommet sur la sécurité de l'IA à Bletchley Park en novembre.
Gemini Ultra aurait surpassé GPT-4, Claude 2 d'Anthropic, Inflection-2 d'Inflection AI, LLaMA 2 de Meta et Grok 1 de xAI sur les benchmarks de l'industrie. Gemini Pro aurait surpassé GPT-3.5. Gemini Ultra a été le premier modèle de langage à dépasser les experts humains sur le test Massive Multitask Language Understanding (MMLU) portant sur 57 sujets, avec un score de 90 %. Gemini Pro est devenu disponible pour les clients de Google Cloud via AI Studio et Vertex AI le 13 décembre 2023.
Intégration et expansion
En janvier 2024, Google s'est associé à Samsung pour intégrer Gemini Nano et Gemini Pro dans la gamme de smartphones Galaxy S24. Le mois suivant, Bard et Duet AI ont été unifiés sous la marque Gemini, et « Gemini Advanced avec Ultra 1.0 » a été lancé via un nouveau niveau « AI Premium » de Google One. Gemini Pro a également reçu un lancement mondial.
En février 2024, Google a introduit Gemini 1.5, décrit comme plus puissant que 1.0 Ultra, avec une nouvelle architecture, une approche de mélange d'experts et une fenêtre de contexte d'un million de jetons. Le même mois, Google a dévoilé Gemma, une gamme plus petite et open source de modèles Gemini, considérée comme une réponse à Meta et à d'autres qui ouvrent leurs modèles d'IA.
Lors du discours d'ouverture de Google I/O le 14 mai 2024, Google a annoncé Gemini 1.5 Flash, un modèle plus rapide et plus efficace. Des plans ont également été révélés pour intégrer une version de Gemini Nano optimisée pour le bureau dans le navigateur Google Chrome via son architecture « IA intégrée », exposant les capacités de traitement local aux développeurs web via des API expérimentales comme l'API Prompt (« window.ai »).
Mises à jour ultérieures
Deux modèles mis à jour, Gemini-1.5-Pro-002 et Gemini-1.5-Flash-002, ont été publiés le 24 septembre 2024. Le 11 décembre 2024, Google a annoncé Gemini 2.0 Flash Experimental, avec une API multimodale en direct pour les interactions audio et vidéo en temps réel, la génération d'images native, la synthèse vocale contrôlable avec filigrane et la recherche Google intégrée.
En juin 2025, Google a introduit Gemini CLI, un agent d'IA open source qui apporte les capacités de Gemini au terminal, offrant des fonctionnalités de codage, d'automatisation et de résolution de problèmes avec des limites d'utilisation gratuites généreuses pour les développeurs individuels.
Architecture technique et capacités
Gemini est construit sur une architecture Transformer (architecture), similaire à d'autres Large language models modernes. Il utilise des mécanismes de Multi-Head Attention et un Positional Encoding pour traiter les données séquentielles. Le modèle est multimodal, entraîné sur divers types de données, et utilise les TPU de Google pour l'entraînement et l'inférence. La conception de Gemini intègre des techniques comme le Mixture of experts (dans les versions ultérieures) et prend en charge une grande fenêtre de contexte, lui permettant de traiter de longs documents et des tâches de raisonnement complexes.
Les capacités de Gemini incluent la compréhension du langage naturel, la génération de code, le traitement d'images et d'audio, et l'intégration avec des outils externes. Le modèle est conçu pour être adaptable à divers domaines, des applications grand public comme Bard aux solutions d'entreprise sur Google Cloud.
Impact et réception
Le lancement de Gemini a intensifié la concurrence dans l'espace de l'Generative AI, en particulier avec les modèles GPT-4 d'OpenAI et Claude d'Anthropic. Google a positionné Gemini comme un challenger direct de ces systèmes, en tirant parti de son intégration profonde avec l'écosystème Google, notamment Search, Workspace et Cloud. La nature multimodale du modèle a été considérée comme une étape significative vers une IA plus proche de l'humain, avec des applications potentielles en robotique, comme Hassabis l'a laissé entendre en combinant Gemini avec la robotique pour une interaction physique.
Les analystes de l'industrie ont noté les performances solides de Gemini sur des benchmarks comme MMLU, mais ont également soulevé des préoccupations concernant la sécurité, les biais et l'impact environnemental de l'entraînement de grands modèles. La décision de Google d'ouvrir Gemma en open source a été perçue comme une décision stratégique pour favoriser l'adoption par la communauté et répondre aux critiques concernant l'IA propriétaire.
Orientations futures
Google continue de faire évoluer Gemini, avec des mises à jour continues et de nouvelles versions de modèles. L'intégration de Gemini dans Chrome et les appareils Android vise à apporter l'IA sur appareil à un large public. Le développement de Gemini CLI et d'autres outils suggère une focalisation sur les applications destinées aux développeurs. En 2025, Gemini reste un élément central de la stratégie d'IA de Google, en concurrence avec d'autres acteurs majeurs du domaine.