Gemini est la famille phare de grands modèles de langage de Google DeepMind, lancée le 6 décembre 2023. Elle a remplacé le chatbot Bard basé sur PaLM de Google comme principale gamme de modèles de l'entreprise et a été conçue dès le départ pour être nativement multimodale, entraînée conjointement sur du texte, des images, de l'audio et de la vidéo, plutôt que d'ajouter ces modalités après un pré-entraînement uniquement textuel.
Contexte
Le développement de Gemini a suivi la fusion en 2023 de Google Brain et DeepMind au sein de l'organisation unifiée Google DeepMind, une restructuration largement rapportée comme une réponse à la pression concurrentielle après le lancement de ChatGPT l'année précédente, parfois décrite en interne comme un moment de « code rouge » pour la stratégie de recherche et d'IA de Google. Demis Hassabis a dirigé l'organisation combinée, tandis que Sundar Pichai, le directeur général de Google, a publiquement défendu une réorientation « IA d'abord » des gammes de produits de l'entreprise autour de Gemini.
Niveaux de modèles et versions
Gemini a été publié en plusieurs niveaux de taille destinés à différents cas d'usage : Ultra pour les tâches les plus exigeantes, Pro comme modèle généraliste équilibré, Flash comme option plus rapide et moins coûteuse pour les applications à volume élevé, et Nano pour une utilisation sur appareil, sur téléphones et autres matériels contraints. Les versions successives (1.0, 1.5, 2.0 et au-delà) ont étendu la fenêtre de contexte du modèle, la version 1.5 Pro prenant notamment en charge de très longues fenêtres de contexte de l'ordre d'un million de jetons, permettant des tâches comme le raisonnement sur des bases de code entières, de longs documents ou des fichiers vidéo complets en une seule requête. Les versions ultérieures ont intégré des modes de raisonnement explicites qui allouent un calcul d'inférence supplémentaire, alignant Gemini sur la tendance plus large vers les modèles de raisonnement initiée par des systèmes comme o1 d'OpenAI.
Les modèles Gemini ont été entraînés en grande partie à l'aide des unités de traitement tensoriel de Google plutôt qu'en s'appuyant uniquement sur des GPU tiers, reflétant l'investissement de longue date de Google dans des accélérateurs matériels d'IA personnalisés.
Intégration et produits
Google a intégré Gemini largement dans son écosystème de produits, notamment la recherche (via les aperçus IA), les applications Workspace, le système d'exploitation Android et une application d'assistant grand public rebaptisée. Les capacités spécialisées construites sur la famille Gemini comprenaient des outils de génération et d'édition d'images, notamment le modèle devenu connu sous le surnom communautaire Nano Banana, et les modèles de génération vidéo Veo, tous développés au sein de Google DeepMind et souvent intégrés à la surface produit plus large de Gemini. Gemini alimente également NotebookLM, un assistant de recherche et de prise de notes qui a attiré une attention particulière pour sa fonctionnalité de « aperçu audio » générée par IA, de type podcast.
Réception et concurrence
Gemini a directement concurrencé la série GPT d'OpenAI et Claude d'Anthropic, avec des classements relatifs variant selon les versions sur les benchmarks et les plateformes d'évaluation communautaires comme LMArena. La réception initiale du lancement original de Gemini a été mitigée, certaines démonstrations marketing ayant ensuite été critiquées comme n'étant pas pleinement représentatives des capacités réelles du modèle, tandis que les versions ultérieures, en particulier la 2.0 et les suivantes, ont été plus largement créditées d'avoir comblé ou mené l'écart de capacités avec les laboratoires rivaux. L'intégration profonde de Gemini dans les produits de recherche et grand public de Google en a fait l'une des familles de modèles d'IA les plus largement distribuées en termes de portée utilisateur, même si elle n'a pas toujours été en tête sur les performances brutes des benchmarks, et sa trajectoire a été étroitement surveillée comme un indicateur de la capacité de Google à convertir ses avantages en infrastructure et en distribution en un leadership durable en matière d'IA.