Google Gemini 3 Image est un modèle de langage multimodal (LLM) développé par Google DeepMind, publié en novembre 2025. Il fait partie de la famille Gemini, qui comprend des modèles tels que Gemini Pro, Gemini Flash et Gemini Nano. Gemini 3 Image se concentre sur la génération et l'édition avancées d'images, permettant aux utilisateurs de créer et de modifier des images à l'aide d'invites en langage naturel. Le modèle s'intègre à l'écosystème de Google, notamment Google Cloud et le chatbot Gemini, et est conçu pour concurrencer d'autres systèmes d'IA générative d'OpenAI et d'Anthropic.
Gemini 3 Image s'appuie sur les fondations des modèles Gemini antérieurs, qui ont été annoncés pour la première fois le 6 décembre 2023. Le Gemini 1.0 original comprenait trois variantes : Ultra, Pro et Nano, Ultra étant le plus puissant. Des mises à jour ultérieures ont introduit Gemini 1.5 avec une fenêtre contextuelle plus large et Gemini 2.0 Flash avec des capacités multimodales améliorées. Gemini 3 Image représente une avancée significative dans l'IA centrée sur l'image, en tirant parti des progrès des réseaux neuronaux et de l'apprentissage profond.
Développement et contexte
Le développement de Gemini a commencé en 2023, à la suite de la fusion de Google Brain et de DeepMind au sein de Google DeepMind. Le projet était dirigé par Demis Hassabis, PDG de Google DeepMind, et impliquait la collaboration de centaines d'ingénieurs. Gemini a été conçu pour être multimodal dès le départ, traitant le texte, les images, l'audio, la vidéo et le code. Le nom « Gemini » fait référence au signe du zodiaque et à la fusion des deux groupes de recherche en IA.
Gemini 3 Image a été développé dans le cadre de l'évolution continue de la famille Gemini. Il intègre des techniques issues des grands modèles de langage, des transformeurs et de l'IA générative. Le modèle utilise une architecture de réseau neuronal avec des mécanismes de attention multi-têtes et de attention croisée, lui permettant de générer des images de haute qualité à partir de descriptions textuelles. L'entraînement a impliqué des ensembles de données à grande échelle et de la augmentation de données pour améliorer la robustesse.
Capacités et fonctionnalités
Gemini 3 Image offre une génération d'images avancée, permettant aux utilisateurs de créer des images détaillées et réalistes à partir d'invites textuelles. Il prend également en charge une édition sophistiquée, comme la modification d'objets, le changement d'arrière-plans et l'ajustement de l'éclairage. Le modèle peut comprendre des instructions complexes et maintenir le contexte sur plusieurs tours, ce qui le rend adapté aux applications interactives.
Par rapport aux modèles Gemini précédents, Gemini 3 Image présente une fidélité et une cohérence améliorées dans les images générées. Il s'appuie sur des réseaux résiduels et des architectures U-Net pour la synthèse d'images. Le modèle intègre également du RLHF (apprentissage par renforcement à partir de retours humains) pour aligner les sorties sur les préférences des utilisateurs.
Publication et disponibilité
Gemini 3 Image a été publié en novembre 2025, à la suite d'une série de mises à jour de la famille Gemini. Il a été rendu disponible via Vertex AI et AI Studio de Google Cloud, ainsi qu'intégré au chatbot Gemini. Le modèle prend en charge plusieurs langues, bien qu'il ait été initialement principalement axé sur l'anglais. Google a également annoncé son intention d'intégrer Gemini 3 Image dans d'autres produits, tels que Google Search et Workspace.
Lors de son lancement, Gemini 3 Image était proposé en différents niveaux, notamment une version gratuite avec des fonctionnalités limitées et une version premium via l'abonnement AI Premium de Google One. Les développeurs pouvaient accéder au modèle via des API, leur permettant de créer des applications personnalisées.
Performances et références
Gemini 3 Image a démontré de solides performances sur les références de génération et d'édition d'images. Il a surpassé les modèles Gemini précédents et les systèmes concurrents d'OpenAI et d'Anthropic dans des tâches telles que le sous-titrage d'images, la réponse à des questions visuelles et la synthèse texte-image. Le modèle a également montré des améliorations dans la réduction des biais et la génération de sorties plus diverses.
Dans les évaluations internes, Gemini 3 Image a obtenu des scores élevés au test MMLU (Massive Multitask Language Understanding), bien que les chiffres spécifiques n'aient pas été divulgués publiquement. La capacité du modèle à gérer des tâches multimodales complexes le positionne comme un leader dans le domaine.
Intégration avec l'écosystème Google
Gemini 3 Image est profondément intégré aux services de Google. Il alimente les fonctionnalités de génération d'images dans Google Slides, Docs et Gmail, permettant aux utilisateurs de créer des visuels directement dans ces applications. Le modèle fonctionne également avec Google Cloud pour fournir des solutions d'entreprise, et avec la recherche Google DeepMind pour faire progresser les capacités de l'IA.
De plus, Gemini 3 Image est disponible sur les appareils Android via l'application Gemini, et sur iOS via l'application Google. Il prend en charge les interactions en temps réel, telles que la génération d'images à partir de commandes vocales ou d'entrées de caméra.
Paysage concurrentiel
La publication de Gemini 3 Image intensifie la concurrence sur le marché de l'IA générative. OpenAI a développé DALL-E et GPT-4 avec des capacités d'image, tandis qu'Anthropic propose Claude avec des fonctionnalités multimodales. Google vise à différencier Gemini 3 Image grâce à son intégration avec les outils de recherche et de productivité de Google, ainsi qu'à ses solides performances dans les références.
Le modèle concurrence également les systèmes spécialisés de génération d'images de sociétés comme Midjourney et Stability AI. Cependant, la nature multimodale de Gemini 3 Image et son intégration avec l'infrastructure d'IA lui confèrent un avantage unique.
Orientations futures
Google prévoit de continuer à développer Gemini 3 Image, avec des mises à jour attendues pour améliorer la qualité, la vitesse et l'efficacité des images. L'entreprise explore des moyens d'intégrer le modèle à la robotique et aux interactions avec le monde physique, comme l'a laissé entendre Demis Hassabis. De plus, Google travaille à rendre Gemini 3 Image plus accessible aux développeurs et aux entreprises du monde entier.
À la fin de 2025, Gemini 3 Image représente une étape importante dans la génération d'images pilotée par l'IA, s'appuyant sur l'héritage de la famille Gemini et repoussant les limites de ce qui est possible avec l'IA multimodale.