Lancement du contexte Google Gemini 3

Traduit de l'anglais

Le lancement de Google Gemini 3 Context, tenu en novembre 2025, a présenté Gemini 3, un grand modèle de langage multimodal avec une fenêtre de contexte de 1 million de jetons, permettant le traitement de documents longs. Il a succédé à Gemini 2.0 et a été développé par Google DeepMind.

Le lancement du contexte de Google Gemini 3, annoncé en novembre 2025, a marqué la sortie de Gemini 3, un modèle de langage multimodal de grande taille (LLM) développé par Google DeepMind. Ce lancement a été remarquable pour l'introduction d'une fenêtre de contexte d'un million de jetons, permettant au modèle de traiter et de comprendre des documents extrêmement longs en une seule passe. Cette capacité a positionné Gemini 3 comme une avancée significative dans le domaine de l'intelligence artificielle, en particulier pour les applications nécessitant une analyse approfondie de données textuelles étendues.

Gemini 3 fait partie de la famille de modèles Gemini, qui comprend des variantes telles que Gemini Pro, Gemini Flash et Gemini Flash Lite, et succède à des modèles antérieurs comme LaMDA et PaLM 2. Le modèle est conçu pour être multimodal, ce qui signifie qu'il peut traiter et intégrer plusieurs types de données, notamment le texte, les images, l'audio, la vidéo et le code informatique. L'événement de lancement de novembre 2025 s'est concentré sur la fenêtre de contexte élargie, qui constituait un différenciateur clé par rapport aux versions précédentes et aux modèles concurrents.

Développement et contexte

Le développement de Gemini 3 s'est appuyé sur les fondations posées par les modèles Gemini antérieurs. Google a initialement annoncé Gemini lors du discours d'ouverture de Google I/O le 10 mai 2023, le PDG Sundar Pichai le décrivant comme un successeur plus puissant de PaLM 2. Le modèle a été développé en collaboration entre DeepMind et Google Brain, qui avaient fusionné pour former Google DeepMind. Contrairement à de nombreux autres LLM, Gemini a été entraîné non seulement sur du texte, mais aussi sur plusieurs types de données, ce qui le rend intrinsèquement multimodal.

En août 2023, des rapports indiquaient que Google visait à lancer Gemini d'ici fin 2023, avec l'ambition de surpasser des concurrents comme OpenAI. Le développement a impliqué des centaines d'ingénieurs et a même sorti le cofondateur de Google, Sergey Brin, de sa retraite, qui a ensuite été crédité comme contributeur principal. Des équipes juridiques ont été impliquées pour filtrer le matériel protégé par le droit d'auteur dans les données d'entraînement, en particulier les transcriptions de vidéos YouTube.

Les premiers modèles Gemini 1.0 ont été annoncés le 6 décembre 2023, avec trois variantes : Ultra, Pro et Nano. Gemini Ultra a été présenté comme le plus performant, surpassant les experts humains sur le benchmark MMLU avec un score de 90 %. Des mises à jour ultérieures ont inclus Gemini 1.5 en février 2024, qui a introduit une fenêtre de contexte plus large d'un million de jetons, et Gemini 2.0 Flash Experimental en décembre 2024, avec des interactions audio et vidéo en temps réel.

Le lancement de novembre 2025

Le lancement du contexte de Gemini 3 a eu lieu en novembre 2025, avec Google DeepMind dévoilant le nouveau modèle lors d'une conférence de presse virtuelle. La fonctionnalité phare était la fenêtre de contexte de 1 million de jetons, qui permettait à Gemini 3 de traiter des documents d'une longueur sans précédent. Cette capacité visait les utilisateurs d'entreprise, les chercheurs et les développeurs qui travaillent avec des données textuelles à grande échelle, telles que des documents juridiques, des articles scientifiques et des manuels techniques.

Lors du lancement, Google a souligné que Gemini 3 était conçu pour gérer du contenu long avec une grande précision et cohérence, répondant aux limitations des modèles antérieurs qui peinaient avec des entrées très longues. Le modèle a été rendu disponible via les plateformes Vertex AI et AI Studio de Google Cloud, ainsi qu'intégré au chatbot Gemini et à d'autres produits Google.

Spécifications techniques

Gemini 3 est un modèle de langage de grande taille construit sur une architecture transformeur, similaire à d'autres LLM de pointe. Il utilise une approche de mélange d'experts, qui permet au modèle d'activer uniquement les parties pertinentes de son réseau neuronal pour chaque tâche, améliorant ainsi l'efficacité et les performances. La fenêtre de contexte de 1 million de jetons est une réalisation technique significative, nécessitant une gestion avancée de la mémoire et des mécanismes d'attention.

Le modèle est entraîné sur les unités de traitement tensoriel (TPU) de Google, qui sont des puces conçues sur mesure pour les charges de travail d'apprentissage automatique. Cette infrastructure d'entraînement permet le traitement d'ensembles de données massifs, y compris le texte, les images, l'audio et la vidéo, contribuant aux capacités multimodales de Gemini 3.

Applications et cas d'utilisation

La fenêtre de contexte élargie de Gemini 3 ouvre de nouvelles possibilités dans divers domaines. Dans le domaine juridique et de la conformité, le modèle peut analyser des contrats entiers ou des documents réglementaires en une seule fois, identifiant les clauses clés et les problèmes potentiels. Dans la recherche académique, il peut résumer et synthétiser les résultats de centaines d'articles, facilitant les revues de littérature. Pour le développement de logiciels, Gemini 3 peut traiter des bases de code entières, fournissant des suggestions contextuelles et une assistance au débogage.

Google a également souligné le potentiel du modèle dans le support client, où il peut gérer de longs historiques de conversation, et dans la création de contenu, où il peut maintenir la cohérence sur des documents longs. La nature multimodale du modèle lui permet de combiner le texte avec des données visuelles et audio, permettant des interactions plus riches.

Contexte du marché et concurrence

Le lancement de Gemini 3 a eu lieu dans un contexte de concurrence intense dans l'industrie de l'IA. Des rivaux tels que OpenAI avec son GPT-4 et Anthropic avec Claude ont continuellement amélioré leurs modèles. La fenêtre de contexte de 1 million de jetons a donné à Gemini 3 un avantage concurrentiel pour les tâches sur documents longs, un créneau que d'autres modèles n'avaient pas pleinement abordé à l'époque.

La stratégie de Google impliquait l'intégration de Gemini 3 dans son écosystème, y compris Search, Ads, Chrome et Workspace, similaire aux modèles Gemini précédents. L'entreprise a également rendu le modèle disponible aux développeurs via des API, encourageant l'innovation tierce.

Réception et impact

La réception initiale de Gemini 3 a été positive, les premiers utilisateurs saluant sa capacité à gérer des documents longs sans perdre le contexte. Cependant, certains experts ont noté que la fenêtre de 1 million de jetons, bien qu'impressionnante, nécessitait des ressources de calcul significatives, limitant potentiellement son accessibilité. Au moment du lancement, le modèle était disponible en anglais, avec des plans pour un support linguistique plus large.

Le lancement a renforcé la position de Google en tant que leader dans la recherche et le développement en IA. Il a également suscité des discussions sur l'avenir des fenêtres de contexte, les concurrents étant susceptibles de répondre avec des capacités similaires.

Orientations futures

Suite au lancement, Google DeepMind a indiqué son intention d'affiner Gemini 3 en fonction des retours des utilisateurs et d'explorer d'autres améliorations en matière d'efficacité et de précision. L'entreprise a également laissé entendre qu'elle intégrerait Gemini 3 à d'autres technologies, telles que la robotique, pour permettre des interactions avec le monde physique, faisant écho aux déclarations antérieures de Demis Hassabis.

Le développement de Gemini 3 s'inscrit dans une tendance plus large de l'IA vers des fenêtres de contexte plus grandes et des modèles multimodaux plus performants. À mesure que le domaine évolue, des modèles comme Gemini 3 devraient jouer un rôle crucial dans l'avancement des applications de apprentissage automatique et de apprentissage profond.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:artificial-intelligence·google-deepmind·large-language-model·technology-launch
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique