Gemini est une famille de modèles de langage multimodaux à grande échelle (LLM) développés par Google DeepMind, une filiale de Google. Elle succède aux modèles antérieurs de Google, LaMDA et PaLM 2. La famille Gemini comprend plusieurs variantes, telles que Gemini Pro, Gemini Deep Think, Gemini Flash et Gemini Flash Lite, et elle alimente le chatbot Gemini. Le nom Gemini fait référence au signe du zodiaque des Gémeaux et rend également hommage à la fusion de Google Brain et DeepMind, ainsi qu'au projet Gemini de la NASA. Annoncé le 6 décembre 2023, Gemini a été conçu pour traiter simultanément plusieurs types de données, notamment le texte, les images, l'audio, la vidéo et le code informatique, ce qui le distingue de nombreux prédécesseurs exclusivement textuels.
Le développement de Gemini a marqué une étape importante dans les efforts de Google pour rivaliser dans le domaine de l'IA générative, en particulier contre le GPT-4 d'OpenAI et d'autres modèles de langage à grande échelle. Google a positionné Gemini comme son « modèle d'IA le plus grand et le plus performant », avec des capacités qui vont au-delà de la génération de texte pour inclure la compréhension et la génération d'images, ainsi qu'une intégration potentielle avec la robotique. Le modèle a été entraîné sur les unités de traitement tensoriel (TPU) de Google et n'était initialement disponible qu'en anglais, avec un déploiement progressif dans les produits et services Google.
Développement
Google a annoncé pour la première fois Gemini lors du discours d'ouverture de Google I/O le 10 mai 2023, le PDG Sundar Pichai le décrivant comme un successeur plus puissant de PaLM 2, également dévoilé lors de cet événement. À l'époque, Gemini était encore en phase de développement précoce, mais il était déjà remarquable pour sa conception multimodale, qui le distinguait de nombreux LLM existants reposant principalement sur des corpus textuels. Le modèle a été développé en collaboration entre DeepMind et Google Brain, deux groupes de recherche en IA qui ont été fusionnés dans Google DeepMind en avril 2023.
Demis Hassabis, PDG de DeepMind, a souligné le potentiel de Gemini dans une interview avec Wired, suggérant qu'il pourrait surpasser ChatGPT d'OpenAI, qui fonctionne sur GPT-4. Hassabis s'est appuyé sur l'expérience de DeepMind avec AlphaGo, le programme qui a battu le champion de Go Lee Sedol en 2016, et a indiqué que Gemini combinerait les forces d'AlphaGo avec d'autres LLM de Google-DeepMind. En août 2023, The Information a rapporté que Google visait à lancer Gemini d'ici fin 2023, avec des plans pour intégrer les capacités de texte conversationnel à la génération d'images par IA, permettant la création d'images contextuelles et des cas d'utilisation plus larges.
Le cofondateur de Google, Sergey Brin, a été sorti de sa retraite pour aider au développement de Gemini, travaillant aux côtés de centaines d'ingénieurs de Google Brain et DeepMind. Brin a ensuite été crédité comme « contributeur principal » du projet. Parce que Gemini a été entraîné sur des transcriptions de vidéos YouTube, Google a engagé des avocats pour filtrer les contenus potentiellement protégés par le droit d'auteur. Le processus de développement a également impliqué des tests de sécurité approfondis, car Google a déclaré que Gemini ne serait pas largement publié avant 2024 pour garantir un déploiement responsable.
En réponse au lancement imminent de Gemini, OpenAI a accéléré ses travaux sur l'intégration de fonctionnalités multimodales dans GPT-4. En septembre 2023, plusieurs entreprises avaient obtenu un accès anticipé à une version précoce de Gemini, que Google prévoyait d'offrir via le service Vertex AI de Google Cloud. Le modèle était également positionné pour concurrencer GitHub Copilot de Microsoft dans le domaine des assistants de codage.
Lancement
Le 6 décembre 2023, Sundar Pichai et Demis Hassabis ont annoncé « Gemini 1.0 » lors d'une conférence de presse virtuelle. La version initiale comprenait trois modèles : Gemini Ultra, conçu pour des « tâches hautement complexes » ; Gemini Pro, pour « une large gamme de tâches » ; et Gemini Nano, pour des « tâches sur appareil ». Lors du lancement, Gemini Pro et Nano ont été intégrés respectivement à Bard (le chatbot de Google) et au smartphone Pixel 8 Pro. Gemini Ultra était prévu pour alimenter « Bard Advanced » et devenir disponible pour les développeurs début 2024. Google prévoyait également d'incorporer Gemini dans Search, Ads, Chrome, Duet AI sur Google Workspace et AlphaCode 2.
Gemini n'était initialement disponible qu'en anglais. Google l'a vanté comme son « modèle d'IA le plus grand et le plus performant », conçu pour imiter le comportement humain. L'entreprise a souligné que Gemini ne serait pas largement disponible avant l'année suivante en raison de la nécessité de « tests de sécurité approfondis ». Gemini a été entraîné sur et alimenté par les TPU de Google, et le nom faisait référence à la fusion DeepMind-Google Brain ainsi qu'au projet Gemini de la NASA.
Gemini Ultra aurait surpassé plusieurs modèles concurrents, notamment GPT-4, Claude 2 d'Anthropic, Inflection-2 d'Inflection AI, LLaMA 2 de Meta et Grok 1 de xAI, sur divers benchmarks industriels. Gemini Pro était dit surpasser GPT-3.5. Notamment, Gemini Ultra a été le premier modèle de langage à dépasser les experts humains sur le test Massive Multitask Language Understanding (MMLU) de 57 sujets, obtenant un score de 90 %. Gemini Pro a été rendu disponible aux clients de Google Cloud sur AI Studio et Vertex AI le 13 décembre 2023, et Gemini Nano a ensuite été mis à disposition des développeurs Android.
Hassabis a également révélé que DeepMind explorait comment Gemini pourrait être combiné avec la robotique pour permettre une interaction physique avec le monde. Conformément à un décret exécutif américain signé par le président Joe Biden en octobre 2023, Google a déclaré qu'il partagerait les résultats des tests de Gemini Ultra avec le gouvernement fédéral américain. De même, Google s'est engagé auprès du gouvernement britannique pour s'aligner sur les principes du sommet sur la sécurité de l'IA à Bletchley Park en novembre 2023.
En juin 2025, Google a introduit Gemini CLI, un agent d'IA open source qui apporte les capacités de Gemini au terminal, offrant des fonctionnalités de codage, d'automatisation et de résolution de problèmes avec des limites d'utilisation gratuites généreuses pour les développeurs individuels.
Mises à jour
En janvier 2024, Google s'est associé à Samsung pour intégrer Gemini Nano et Gemini Pro dans la gamme de smartphones Galaxy S24. Le mois suivant, Bard et Duet AI ont été unifiés sous la marque Gemini, et « Gemini Advanced avec Ultra 1.0 » a été publié via un nouveau niveau « AI Premium » du service d'abonnement Google One. Gemini Pro a également reçu un lancement mondial.
En février 2024, Google a lancé Gemini 1.5, le décrivant comme plus puissant et plus performant que 1.0 Ultra. Les changements comprenaient une nouvelle architecture, une approche de mélange d'experts et une fenêtre de contexte plus grande d'un million de jetons. Le même mois, Google a dévoilé Gemma, une gamme plus petite, gratuite et open source de modèles Gemini. Plusieurs publications ont décrit cela comme une réponse à Meta et à d'autres qui rendaient leurs modèles d'IA open source, et un revirement par rapport à la pratique antérieure de Google de garder son IA propriétaire.
Google a annoncé un modèle supplémentaire, Gemini 1.5 Flash, le 14 mai 2024, lors du discours d'ouverture de Google I/O. Lors du même événement, Google a annoncé des plans pour intégrer une version de Gemini Nano optimisée pour le bureau directement dans le navigateur Google Chrome via son architecture « Built-in AI », exposant les capacités de traitement local aux développeurs web via des API expérimentales telles que l'API Prompt (« window.ai »).
Deux modèles Gemini mis à jour, Gemini-1.5-Pro-002 et Gemini-1.5-Flash-002, ont été publiés le 24 septembre 2024.
Le 11 décembre 2024, Google a annoncé le nouveau modèle expérimental Gemini 2.0 Flash. Les fonctionnalités incluent une API Live multimodale pour les interactions audio et vidéo en temps réel, une génération native d'images et de texte à partir de la parole contrôlable (avec filigrane), et une recherche Google intégrée. Il a également introduit des améliorations dans les capacités de raisonnement et de codage.
Architecture et entraînement
Gemini est construit sur une architecture Transformer (architecture), qui est le fondement de nombreux Large language model modernes. Le modèle utilise une approche de mélange d'experts dans les versions ultérieures, lui permettant de s'adapter efficacement en activant uniquement les sous-réseaux pertinents pour chaque tâche. L'entraînement a impliqué des ensembles de données massifs, comprenant du texte, des images, de l'audio, de la vidéo et du code, provenant de divers référentiels, y compris des transcriptions YouTube, ce qui a nécessité un filtrage minutieux pour la conformité au droit d'auteur.
Le modèle a été entraîné sur les TPU de Google, qui sont des Artificial intelligence accélérateurs personnalisés. Cette infrastructure a permis à Gemini de gérer des sessions d'entraînement à grande échelle, contribuant à ses performances sur des benchmarks comme MMLU. L'approche d'entraînement multimodale permet à Gemini de traiter et de générer du contenu à travers différentes modalités, le rendant polyvalent pour des applications allant de la génération de texte à la compréhension d'images.
Capacités et performances
Les capacités de Gemini couvrent plusieurs domaines. Il peut effectuer des tâches de raisonnement complexes, générer du code, comprendre et générer des images, et traiter de l'audio et de la vidéo. Les performances du modèle sur les benchmarks industriels ont été un argument de vente clé. Le score de 90 % de Gemini Ultra sur MMLU, où il a surpassé les experts humains, a été une réalisation notable, soulignant sa large connaissance dans 57 sujets.
En plus des benchmarks, Gemini a été intégré dans divers produits Google, notamment Search, Ads et Chrome, améliorant leurs fonctionnalités basées sur l'IA. La capacité du modèle à gérer de longues fenêtres de contexte, jusqu'à un million de jetons dans Gemini 1.5, lui permet de traiter de grands documents ou des bases de code entières, le rendant utile pour les développeurs et les chercheurs.
Intégration et écosystème
Gemini est intégré dans les services cloud de Google, y compris Google Cloud et Vertex AI, permettant aux entreprises d'accéder à ses capacités. Il alimente également le chatbot Gemini, qui a été renommé de Bard en février 2024. La disponibilité du modèle sur les appareils Android, via Gemini Nano, permet un traitement de l'IA sur appareil, ce qui est important pour les applications sensibles à la confidentialité et à la latence.
Google a également rendu Gemini disponible via des partenariats, comme avec Samsung Electronics pour le Galaxy S24, et via des versions open source comme Gemma, qui sont des modèles plus petits et plus accessibles. Le Gemini CLI, introduit en 2025, fournit une interface en ligne de commande pour les développeurs, élargissant encore son écosystème.
Réception et impact
Gemini a été bien accueilli dans la communauté de l'IA pour ses capacités multimodales et ses performances solides sur les benchmarks. Cependant, il a également fait face à un examen minutieux concernant la sécurité, les problèmes de droit d'auteur et l'impact environnemental de l'entraînement de grands modèles. La décision de Google de partager les résultats des tests avec les gouvernements reflète des préoccupations plus larges concernant la réglementation et la sécurité de l'IA.
Le lancement de Gemini a intensifié la concurrence dans l'industrie de l'IA, incitant des rivaux comme OpenAI et Anthropic à accélérer leurs propres développements. L'intégration de Gemini dans les produits Google a également soulevé des questions sur la domination du marché et les implications éthiques du déploiement de l'IA.
Orientations futures
Google continue d'itérer sur Gemini, avec des mises à jour comme Gemini 2.0 Flash Experimental indiquant un accent sur les interactions en temps réel et la génération multimodale. L'exploration de l'intégration robotique suggère des applications potentielles dans les systèmes d'IA physiques. En 2025, Gemini devrait évoluer davantage, avec des recherches en cours sur l'amélioration du raisonnement, de l'efficacité et de la sécurité.
Le développement de Gemini s'aligne également sur les tendances plus larges dans Generative AI, où les modèles deviennent plus multimodaux et capables de gérer des tâches complexes. L'investissement de Google dans les TPU et son partenariat avec Broadcom pour des puces personnalisées soulignent son engagement à faire progresser l'infrastructure de l'IA.