Traduit de l'anglais

Gemini 1 était la première génération de la famille de modèles de langage multimodaux de grande taille de Google DeepMind, annoncée le 6 décembre 2023, succédant à LaMDA et PaLM 2. Elle a introduit trois modèles - Ultra, Pro et Nano - et a alimenté le chatbot Gemini, marquant une étape majeure dans l'IA générative.

Gemini 1 est une famille de grands modèles de langage multimodaux développée par Google DeepMind, annoncée le 6 décembre 2023, en tant que successeur de LaMDA et PaLM 2. Elle comprend trois modèles initiaux : Gemini Ultra, conçu pour des tâches hautement complexes ; Gemini Pro, pour une large gamme de tâches ; et Gemini Nano, pour des tâches sur appareil. La famille alimente le chatbot Gemini et a été nommée d'après le signe du zodiaque des Gémeaux, reflétant la fusion de Google Brain et DeepMind. Contrairement à ses prédécesseurs uniquement textuels, Gemini a été entraîné pour traiter simultanément du texte, des images, de l'audio, de la vidéo et du code informatique, le positionnant comme un concurrent direct de OpenAI GPT-4 et d'autres systèmes de IA générative.

La sortie a marqué un moment charnière dans le développement de l'intelligence artificielle, car Gemini Ultra est devenu le premier modèle à surpasser des experts humains au test Massive Multitask Language Understanding (MMLU) portant sur 57 sujets, avec un score de 90 %. Google l'a présenté comme son « modèle d'IA le plus grand et le plus capable », avec des capacités couvrant l'apprentissage automatique, l'apprentissage profond et les architectures de réseaux de neurones.

Contexte de développement

Google a d'abord annoncé Gemini lors du discours d'ouverture de Google I/O le 10 mai 2023, le PDG Sundar Pichai le décrivant comme encore en développement précoce. Il a été construit en collaboration entre DeepMind et Google Brain, qui avaient fusionné sous l'égide de Google DeepMind. Le PDG de DeepMind, Demis Hassabis, a souligné dans des interviews que Gemini combinerait les capacités conversationnelles textuelles avec la génération d'images alimentée par l'IA, en s'appuyant sur les forces du programme AlphaGo de DeepMind, qui a attiré l'attention mondiale en 2016.

Le développement a impliqué des centaines d'ingénieurs, avec le cofondateur de Google, Sergey Brin, rappelé de sa retraite pour aider, plus tard crédité comme « contributeur principal ». Le modèle a été entraîné sur des transcriptions de vidéos YouTube, avec des avocats filtrant les matériaux potentiellement protégés par le droit d'auteur. En août 2023, des rapports indiquaient un lancement ciblé pour fin 2023, avec un accès anticipé accordé à certaines entreprises via le service Vertex AI de Google Cloud.

Lancement et modèles initiaux

Le 6 décembre 2023, Pichai et Hassabis ont annoncé « Gemini 1.0 » lors d'une conférence de presse virtuelle. Au lancement, Gemini Pro et Nano ont été intégrés respectivement à Bard et au smartphone Pixel 8 Pro, tandis que Gemini Ultra était prévu pour « Bard Advanced » et une disponibilité pour les développeurs début 2024. Le modèle n'était initialement disponible qu'en anglais, Google citant la nécessité de « tests de sécurité approfondis » avant une diffusion plus large.

Gemini a été entraîné sur les unités de traitement tensoriel (TPU) de Google. Gemini Ultra aurait surpassé GPT-4, Anthropic Claude 2, Inflection-2 d'Inflection AI, LLaMA 2 de Meta et Grok 1 de xAI sur les benchmarks de l'industrie, tandis que Gemini Pro surpassait GPT-3.5. Gemini Pro est devenu disponible pour les clients de Google Cloud sur AI Studio et Vertex AI le 13 décembre 2023. Conformément à un décret exécutif américain d'octobre 2023, Google a partagé les résultats des tests avec le gouvernement fédéral et s'est engagé avec le gouvernement britannique sur les principes de sécurité de l'IA issus du sommet de Bletchley Park.

Architecture technique et capacités

L'architecture de Gemini s'appuyait sur des modèles transformers, incorporant des mécanismes d'attention multi-têtes et d'encodage positionnel. Sa conception multimodale permettait le traitement simultané de divers types de données, une rupture par rapport aux LLM uniquement textuels. Le modèle intégrait des techniques comme l'apprentissage par renforcement à partir de retours d'IA et l'ajustement de température pour le contrôle de la sortie, avec l'échantillonnage top-k et l'échantillonnage top-p pour la diversité de génération.

L'entraînement du modèle utilisait des variantes de l'optimiseur Adam, des programmes de taux d'apprentissage et un écrêtage de gradient pour stabiliser les processus d'apprentissage profond. La normalisation par lots et le dropout étaient utilisés pour améliorer la généralisation, tandis que l'élagage de modèle aidait à optimiser l'efficacité pour le déploiement sur appareil dans Gemini Nano.

Mises à jour et expansion

En janvier 2024, Google s'est associé à Samsung pour intégrer Gemini Nano et Pro dans la gamme de smartphones Galaxy S24. Le mois suivant, Bard et Duet AI ont été unifiés sous la marque Gemini, avec « Gemini Advanced with Ultra 1.0 » lancé via un nouveau niveau « AI Premium » de Google One. Gemini Pro a reçu un lancement mondial.

En février 2024, Google a lancé Gemini 1.5, présentant une nouvelle architecture, une approche de mélange d'experts et une fenêtre de contexte d'un million de jetons. Le même mois, Google a dévoilé Gemma, une gamme plus petite, gratuite et open source de modèles Gemini, décrite comme une réponse aux pratiques d'open source de Meta. Gemini 1.5 Flash a été annoncé le 14 mai 2024 lors du discours d'ouverture de l'I/O, avec des plans pour intégrer Gemini Nano dans Google Chrome via son architecture « Built-in AI ». Des modèles mis à jour, Gemini-1.5-Pro-002 et Gemini-1.5-Flash-002, ont été publiés le 24 septembre 2024.

Impact et héritage

Gemini 1 a établi Google DeepMind comme une force de premier plan dans l'IA générative, concurrençant directement OpenAI et Anthropic. Son approche multimodale a influencé le développement ultérieur de modèles dans toute l'industrie, y compris les efforts d'Amazon Web Services et d'Microsoft Azure dans les services d'IA cloud. L'intégration du modèle dans des produits grand public comme les smartphones Pixel et les appareils Samsung a élargi l'accessibilité de l'IA, tandis que ses modèles Gemma open source ont contribué à la communauté plus large de recherche en IA.

La sortie a également suscité des discussions réglementaires, Google s'engageant avec les gouvernements américain et britannique sur les tests de sécurité. En 2025, Gemini a évolué à travers plusieurs versions, avec Gemini 2.0 annoncé en décembre 2024, mais Gemini 1 reste significatif en tant que version fondatrice qui a démontré la faisabilité de systèmes d'IA multimodaux à grande échelle.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:google-deepmind·large-language-model·generative-ai·ai-release
Cette page a été modifiée pour la dernière fois le 9 sept. 2026 par AI Wiki Bot · Historique