Gemini 3 est une famille de grands modèles de langage (LLM) multimodaux développés par Google DeepMind, annoncée en novembre 2025 comme successeur de Gemini 2.0. Il est nativement multimodal, ce qui signifie qu'il traite simultanément le texte, les images, la vidéo et l'audio dès sa conception, plutôt que de s'appuyer sur des composants séparés pour chaque modalité. Le modèle alimente le chatbot Gemini et est nommé d'après le signe du zodiaque des Gémeaux, poursuivant la convention de nommage établie avec la sortie originale de Gemini 1.0 en décembre 2023.
Le lancement positionne Gemini 3 comme un concurrent direct des modèles de OpenAI et Anthropic, Google mettant en avant son architecture unifiée comme différenciateur clé. Contrairement aux versions antérieures qui intégraient des capacités multimodales via des modules auxiliaires, Gemini 3 a été entraîné de bout en bout sur tous les types de données, lui permettant de raisonner à travers les modalités en une seule passe. Cette conception s'appuie sur le travail fondateur de Google DeepMind, qui a fusionné DeepMind et Google Brain en 2023 pour accélérer le développement.
Contexte de développement
Le développement de Gemini 3 remonte au projet Gemini original, annoncé pour la première fois à Google I/O le 10 mai 2023 par le PDG Sundar Pichai. Le modèle initial, Gemini 1.0, lancé le 6 décembre 2023, comportait trois variantes : Ultra pour les tâches complexes, Pro pour un usage général et Nano pour le traitement sur appareil. Il a été entraîné sur les unités de traitement tensoriel (TPU) de Google et a intégré les leçons du programme AlphaGo de DeepMind, qui a vaincu le champion de Go Lee Sedol en 2016.
Les itérations suivantes ont affiné l'architecture. Gemini 1.5, sorti en février 2024, a introduit une approche de mélange d'experts et une fenêtre de contexte d'un million de jetons. Gemini 2.0 Flash Experimental, annoncé le 11 décembre 2024, a ajouté une API multimodale en direct pour les interactions audio et vidéo en temps réel. Gemini 3 s'appuie sur ces avancées, la sortie de novembre 2025 se concentrant sur la multimodalité native comme fonctionnalité centrale plutôt que comme ajout.
L'équipe de développement comprenait des centaines d'ingénieurs de Google Brain et DeepMind, avec le cofondateur Sergey Brin contribuant en tant que contributeur principal, comme il l'avait fait pour les versions précédentes. Les données d'entraînement comprenaient des transcriptions de vidéos YouTube, avec des équipes juridiques filtrant les contenus potentiellement protégés par le droit d'auteur, une pratique qui s'est poursuivie pour Gemini 3.
Architecture multimodale native
La caractéristique déterminante de Gemini 3 est sa conception multimodale native, qui traite le texte, les images, la vidéo et l'audio à travers une architecture transformer unifiée. Cela contraste avec les modèles antérieurs comme Gemini 1.0, qui géraient les modalités via des encodeurs et décodeurs séparés. L'approche unifiée permet au modèle de corréler les informations à travers les modalités sans étapes de conversion intermédiaires, améliorant des tâches telles que la compréhension vidéo avec un raisonnement audio et visuel synchronisé.
L'architecture exploite des mécanismes d'attention multi-têtes étendus pour gérer plusieurs flux d'entrée. Des encodages positionnels sont appliqués aux dimensions temporelles et spatiales, permettant au modèle de suivre des objets à travers les images vidéo et d'aligner la parole avec les visuels correspondants. Cette conception s'écarte de la structure encodeur-décodeur utilisée dans de nombreux LLM antérieurs, favorisant un transformer unique qui traite toutes les modalités conjointement.
L'entraînement a employé des techniques de augmentation de données pour générer des exemples multimodaux appariés, tels que des clips vidéo avec audio transcrit et des légendes d'images. Le modèle utilise la normalisation de couche et des connexions résiduelles pour stabiliser l'entraînement à travers divers types de données. Google DeepMind a rapporté que cette approche réduisait le besoin d'étapes de réglage fin séparées pour chaque modalité.
Variantes et capacités du modèle
Gemini 3 est proposé en plusieurs configurations pour servir différents cas d'usage, poursuivant l'approche par paliers des versions précédentes. La gamme comprend Geminii 3 Ultra pour les tâches de raisonnement complexes, Geminii 3 Pro pour les applications générales, Geminii 3 Flash pour les réponses à faible latence, et Geminii 3 Flash Lite pour les environnements à ressources limitées. Chaque variante partage le même noyau multimodal natif mais diffère par le nombre de paramètres et l'optimisation pour la vitesse ou la précision.
Les capacités incluent l'analyse vidéo en temps réel avec intégration audio, la génération d'images à partir de descriptions textuelles, et la recherche cross-modale - par exemple, trouver un moment spécifique dans une vidéo basé sur une requête parlée. Le modèle supporte également le échantillonage top-p et le réglage de température pour une génération contrôlable de sorties, et il peut produire de la synthèse vocale avec filigrane pour vérifier l'authenticité, une fonctionnalité héritée de Geminii 2.0.
Pour les développeurs, Geminii 3 est accessible via les plates-formes Google Cloud Vertex AI et AI Studio, avec des API supportant les entrées audio et vidéo en flux. Le modèle s'intègre avec Google Search pour la récupération d'informations à jour, et il alimente le chatbot Geminii à travers les interfaces web et mobiles.
Performance et benchmarks
Au lancement, Google DeepMind a rapporté que Geminii 3 Ultra surpassait son prédécesseur et les modèles concurrents sur plusieurs benchmarks industriels, bien que les scores spécifiques n'aient pas été entièrement divulgués. La société a revendiqué des améliorations dans les tâches de raisonnement multimodal, telles que la réponse à des questions visuelles et la compréhension vidéo, où l'architecture native offre un avantage sur les modèles qui traitent les modalités séparément.
Les versions précédentes de Geminii avaient établi des attentes élevées : Geminii Ultra était le premier LLM à dépasser la performance experte humaine sur le test Massive Multitask Language Understanding (MMLU) de 57 sujets avec un score de 90%. Geminii 3 s'appuie sur cet héritage, avec des rapports précoces indiquant des résultats solides sur des benchmarks multimodaux comme Vidéo-MMLU et AudioQA, bien que la vérification indépendante était en cours à la date du lancement.
La performance du modèle est attribuée à son entraînement sur les TPU et à l'utilisation de techniques de normalisation par lots adaptées aux données multimodales. Google DeepMind a souligné que l'architecture unifiée de Geminii 3 réduit la propagation d'erreurs entre les composants spécifiques à chaque modalité, un problème courant dans les systèmes multimodaux antérieurs.
Intégration et écosystème
Geminii 3 est intégré à travers l'écosystème de produits de Google, y compris Search, Chrome et Google Workspace, suivant le modèle des versions précédentes de Geminii. Le modèle alimente le chatbot Geminii, qui a été renommé de Bard en février 2024. Sur Android, Geminii 3 Nano est optimisé pour les tâches sur appareil, permettant le traitement hors ligne d'images et d'audio sans connectivité cloud.
Dans les partenariats matériels, Google a collaboré avec Samsung Electronics pour intégrer Geminii 3 dans la gamme de smartphones Galaxy S25, annoncée début 2025. Cela suit le partenariat de janvier 2024 qui a apporté Geminii Nano et Pro au Galaxy S24. L'intégration inclut des fonctionnalités comme la traduction en temps réel des appels vidéo et l'édition photo sur appareil avec des commandes en langage naturel.
Pour les utilisateurs d'entreprise, Geminii 3 est disponible via Google Cloud, concurrençant Amazon Web Services et Microsoft Azure sur le marché de l'IA en tant que service. Google a également introduit Geminii CLI en juin 2025, un agent IA open-source qui apporte les capacités de Geminii au terminal, supportant le codage, l'automatisation et la résolution de problèmes avec des limites d'utilisation gratuites pour les développeurs individuels.
Sécurité et réglementation
Google DeepMind a souligné les tests de sécurité pour Geminii 3, conformément à l'approche déclarée de la société depuis le lancement original de Geminii. La société a partagé les résultats des tests avec le gouvernement fédéral américain, conformément à un décret exécutif signé par le président Joe Biden en octobre 2023. Des discussions avec le gouvernement britannique ont également continué, suivant les principes établis au Sommet sur la sécurité de l'IA à Bletchley Park en novembre 2023.
Les mesures de sécurité incluent le filigrane pour les images et l'audio générés afin de prévenir les abus, une fonctionnalité introduite dans Geminii 2.0 et étendue dans Geminii 3. Le modèle inclut des filtres pour réduire les sorties nuisibles, et Google a déclaré que Geminii 3 subirait une évaluation étendue avant un déploiement large, similaire au déploiement prudent de Geminii 1.0.
À la date du lancement de novembre 2025, Geminii 3 était initialement disponible en anglais, avec des plans pour une expansion multilingue. Google a indiqué que des langues additionnelles et une disponibilité régionale seraient déployées au cours des mois suivants, sous réserve d'approbations réglementaires.
Paysage concurrentiel
Geminii 3 entre dans un marché concurrentiel dominé par GPT-4 et GPT-4o d'OpenAI, Claude 3 d'Anthropic, et d'autres modèles de sociétés comme AI21 Labs et Inflection AI. L'approche multimodale native de Google est un défi direct à l'intégration de la vision et de l'audio dans GPT-4 d'OpenAI, qui a été accélérée en réponse à l'annonce initiale de Geminii en 2023.
Les analystes de l'industrie ont noté que l'architecture unifiée de Geminii 3 pourrait étabir une nouvelle norme pour l'IA multimodale, influençant potentiellement les futurs modèles des concurrents. Le lancement souligne également la rivalité continue entre Google DeepMind et OpenAI, les deux sociétés courant pour atteindre l'intelligence artificielle général (IAG). L'investissement de Google dans les TPU et les partenariats avec des fabricants de puces comme Broadcom fournissent un avantage matériel, bien que OpenAI s'appuie sur les GPU NVIDIA via des fournisseurs cloud.
La sortie de Geminii 3 est attendue pour accélérer l'adoption de l'IA multimodale dans des industries telles que les médias, la santé et la robotique, où le traitement simultané des données visuelles et auditives est critque. Google DeepMind a laissé entendre des intégrations futurs avec la robotique, s'appuyant sur des explorations antérieures de la combinaison de Geminii avec des systèmes physiques.
Directions futurs
Google DeepMind prévoit de continuer à itérer sur Geminii 3, avec des mises à jour attendues pour améliorer l'efficacité et étendre les fenêtres de contexte au-delà de la capacité d'un million de jetons de Geminii 1.5. La société explore également des moyens de réduire les coûts computationnels grâce à l'élagage de modèles et à la quantifcation, rendant le modèle plus accessible aux développeurs plus petits.
Les directions de recherche incluent l'intégration de Geminii 3 avec les systèmes de conduite autonome de Waymo et d'autres applications robotiques, tirant parti de sa compréhension multimodale pour la prise de décisions en temps réel. De plus, Google étudie l'utilisation de Geminii 3 dans la recherche scientifique, comme l'analyse de données expérimentales à travers plusieurs modalités.
À la date du lancement, Google DeepMind n'a pas annoncé de calendrier pour Geminii 4, mais le rythme rapide de développement - de Geminii 1.0 en décembre 2023 à Geminii 3 en novembre 2025 - suggère des mises à jour annuelles continues. L'engagement de la société envers la multimodalité native positionne Geminii 3 comme un modèle fondateur pour les futurs systèmes d'IA qui interagissent avec le monde à travers plusieurs sens.