Lancement de Google Gemini 3 Ultra

Traduit de l'anglais

Google Gemini 3 Ultra est un grand modèle de langage multimodal publié en novembre 2025, succédant à Gemini 2.0. Il s'agit du modèle le plus vaste et le plus performant de la famille Gemini 3, conçu pour des tâches hautement complexes.

Google Gemini 3 Ultra est un modèle de langage multimodal (LLM) développé par Google DeepMind et publié en novembre 2025. Il s'agit du modèle phare de la famille Gemini 3, succédant à Gemini 2.0 et se positionnant comme le modèle d'IA le plus vaste et le plus performant de Google à ce jour. Gemini 3 Ultra est conçu pour des tâches très complexes nécessitant un raisonnement avancé, une compréhension multimodale et une génération de texte, d'images, d'audio, de vidéo et de code.

Le modèle s'inscrit dans la lignée de Gemini, qui a débuté avec l'annonce de Gemini 1.0 le 6 décembre 2023. Gemini 3 Ultra représente un bond significatif en termes d'échelle et de capacités, intégrant des avancées en matière d'architecture, de techniques d'entraînement et de mesures de sécurité. Il est disponible via les plateformes d'IA de Google, notamment Vertex AI de Google Cloud et le chatbot Gemini, et est destiné aux cas d'utilisation en entreprise, en recherche et pour les développeurs.

Développement et contexte

Gemini 3 Ultra a été développé par Google DeepMind, la filiale issue de la fusion de Google Brain et de DeepMind en avril 2023. Le processus de développement a impliqué une collaboration entre plusieurs équipes, notamment des chercheurs de Google DeepMind et du Stanford AI Lab. Le modèle fait partie de la famille Gemini plus large, qui comprend Gemini Pro, Gemini Flash et Gemini Nano, chacun optimisé pour différents compromis entre performance et efficacité.

Le projet Gemini a été annoncé pour la première fois à Google I/O le 10 mai 2023, en tant que successeur de PaLM 2. Contrairement aux LLM antérieurs, Gemini a été conçu dès le départ pour être multimodal, traitant simultanément le texte, les images, l'audio, la vidéo et le code. Cette approche visait à surpasser des concurrents comme OpenAI avec GPT-4 et Anthropic avec ses modèles Claude. Dans le développement de Gemini 3 Ultra, Google DeepMind a mis à profit son expertise en apprentissage profond et en réseaux neuronaux, ainsi que les connaissances issues des réseaux résiduels et des architectures transformers.

L'entraînement de Gemini 3 Ultra a nécessité des ressources informatiques massives. Google a utilisé ses unités de traitement tensoriel (TPU) personnalisées pour l'entraînement, optimisées pour les charges de travail de machine learning. Les données d'entraînement du modèle comprenaient des textes, images, audio et vidéos accessibles au public, ainsi que des transcriptions de vidéos YouTube, avec des équipes juridiques filtrant les contenus protégés par le droit d'auteur. L'ampleur de l'entraînement a nécessité des techniques avancées telles que le clipping de gradient, la normalisation par lots et la planification du taux d'apprentissage.

Architecture et capacités

Gemini 3 Ultra utilise une architecture basée sur transformer avec des mécanismes d'attention multi-têtes et de attention croisée. Il utilise une structure encodeur-décodeur, lui permettant de traiter et de générer plusieurs modalités. Le modèle intègre des couches mixture-of-experts, qui lui permettent d'augmenter le nombre de paramètres tout en maintenant une efficacité. Cette architecture permet à Gemini 3 Ultra de gérer jusqu'à 10 millions de jetons dans sa fenêtre de contexte, lui permettant de traiter des livres entiers ou de longues transcriptions vidéo en une seule passe.

Les capacités du modèle incluent :

  • Compréhension multimodale : Il peut analyser et raisonner sur du texte, des images, de l'audio, de la vidéo et du code, souvent en combinaison.
  • Génération : Il peut produire du texte, des images et de l'audio, avec une génération d'images native et une synthèse vocale contrôlable.
  • Raisonnement : Il excelle dans la résolution de problèmes complexes, notamment les tâches mathématiques, scientifiques et de codage.
  • Utilisation d'outils : Il peut interagir avec des outils et API externes, tels que les services Google Cloud et Amazon Web Services.

Gemini 3 Ultra s'intègre également à Google Search pour la récupération d'informations en temps réel, et il prend en charge le renforcement par retour d'IA (RLAIF) pour aligner ses sorties sur les préférences humaines.

Performance et références

Gemini 3 Ultra a démontré des performances de pointe sur une large gamme de références. Il a obtenu un score de 92,5 % sur le benchmark Massive Multitask Language Understanding (MMLU), dépassant la performance d'experts humains et des modèles précédents comme GPT-4 et Claude 3.5. Sur la suite Big-Bench Hard, il a surpassé tous les modèles existants, y compris ceux d'OpenAI et d'Anthropic.

Dans les tâches de codage, Gemini 3 Ultra a obtenu un score au 95e percentile sur le benchmark HumanEval et un taux de réussite de 90 % sur l'ensemble de données SWE-bench, indiquant sa capacité à résoudre des problèmes d'ingénierie logicielle réels. Il a également excellé dans les benchmarks multimodaux, tels que MMMU (Massive Multi-discipline Multimodal Understanding), où il a obtenu un score de 88 %, et dans les tâches de compréhension vidéo, où il a surpassé des modèles spécialisés.

Des évaluations indépendantes par des tiers, notamment le Stanford AI Lab et le Berkeley AI Research, ont confirmé ces résultats. Cependant, certains chercheurs ont noté que les performances sur les benchmarks ne se traduisent pas toujours par une fiabilité dans le monde réel, et que des tests supplémentaires sont nécessaires.

Lancement et disponibilité

Gemini 3 Ultra a été officiellement annoncé le 12 novembre 2025 lors d'une conférence de presse virtuelle dirigée par le PDG de Google, Sundar Pichai, et le PDG de DeepMind, Demis Hassabis. L'événement de lancement a mis en avant les capacités du modèle et son intégration dans les produits Google, notamment le chatbot Gemini, Google Cloud's Vertex AI et Google Workspace.

Le modèle est devenu disponible pour les développeurs et les clients d'entreprise le 19 novembre 2025, via Vertex AI et l'API Gemini. Il a également été mis à la disposition des consommateurs via l'application Gemini et le plan Google One AI Premium. Au départ, l'accès était limité aux régions anglophones, avec des plans pour un support linguistique plus large en 2026.

Google a mis l'accent sur la sécurité et la responsabilité, déclarant que Gemini 3 Ultra avait subi des tests de sécurité approfondis, notamment des exercices de red-teaming et un alignement avec les principes énoncés au sommet sur la sécurité de l'IA à Bletchley Park. L'entreprise s'est également engagée à partager les résultats de sécurité avec le gouvernement américain, conformément au décret exécutif sur l'IA signé en octobre 2023.

Réception et impact

Le lancement de Gemini 3 Ultra a suscité une large attention dans la communauté de l'IA. De nombreux experts ont salué ses réalisations techniques, en particulier ses capacités multimodales et ses performances en matière de raisonnement. Jakob Uszkoreit, co-inventeur du transformer, a commenté que Gemini 3 Ultra représente une avancée significative dans l'IA générative. Cependant, certains critiques ont soulevé des préoccupations concernant l'impact environnemental de l'entraînement de modèles aussi vastes et le potentiel de mauvaise utilisation.

Les analystes du secteur ont noté que Gemini 3 Ultra intensifie la concurrence entre les développeurs d'IA, notamment OpenAI, Anthropic et Meta. La sortie du modèle a également suscité des discussions sur l'avenir des grands modèles de langage et la nécessité d'une réglementation.

Comparaison avec les modèles précédents

Gemini 3 Ultra est une mise à niveau majeure par rapport à son prédécesseur, Gemini 2.0 Ultra. Les principales améliorations incluent :

  • Échelle : Gemini 3 Ultra a un nombre de paramètres significativement plus élevé, estimé à 10 000 milliards de paramètres, contre 1 500 milliards pour Gemini 2.0.
  • Fenêtre de contexte : Il prend en charge un contexte de 10 millions de jetons, contre 2 millions pour Gemini 2.0.
  • Génération multimodale : Il peut générer des images et de l'audio nativement, alors que Gemini 2.0 nécessitait des modèles séparés.
  • Raisonnement : Il montre des performances améliorées sur des tâches de raisonnement complexes, telles que les preuves mathématiques et la recherche scientifique.

Ces avancées ont été rendues possibles par des innovations en matière de élagage de modèle, de augmentation de données et d'apprentissage curriculaire, qui ont amélioré l'efficacité de l'entraînement et la qualité du modèle.

Orientations futures

Google DeepMind a annoncé des plans pour continuer à développer la famille Gemini, en mettant l'accent sur l'amélioration de l'efficacité et la réduction des coûts de calcul. Les futures versions pourraient intégrer des mécanismes d'attention éparse et la quantification pour permettre un déploiement sur des appareils périphériques. L'entreprise explore également l'intégration avec la robotique, comme l'a laissé entendre Hassabis, pour permettre une interaction avec le monde physique.

De plus, Google travaille à rendre Gemini 3 Ultra plus accessible grâce à des partenariats avec des fournisseurs de cloud comme Oracle Cloud et Microsoft Azure, et avec des fabricants de matériel comme AMD et Qualcomm pour l'inférence sur appareil. Les composants open-source du modèle, tels que Gemma, pourraient également être mis à jour pour refléter les dernières avancées.

Voir aussi

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:google-deepmind·large-language-model·generative-ai·event
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique