Le lancement de Google Gemini Ultra en février 2024 a marqué la publication publique de Gemini Ultra 1.0, le modèle le plus grand et le plus performant de la famille Gemini de grands modèles de langage multimodaux développés par Google DeepMind. Ce lancement a suivi l'annonce initiale de Gemini 1.0 le 6 décembre 2023 et a rendu le modèle disponible aux consommateurs via un nouveau niveau d'abonnement, le positionnant comme un concurrent direct d'autres systèmes d'IA avancés comme le GPT-4 d'OpenAI.
Gemini Ultra 1.0 a été conçu pour des tâches hautement complexes, le distinguant des autres modèles de la famille Gemini, tels que Gemini Pro et Gemini Nano. Il a été intégré à Bard Advanced, une version premium du chatbot IA de Google, et a également été proposé via le service d'abonnement Google One sous le niveau « AI Premium ». Le lancement a représenté une étape significative dans les efforts de Google pour commercialiser sa technologie d'IA la plus avancée et concurrencer sur le marché en pleine évolution de l'IA générative.
Contexte et développement
Le développement de Gemini a commencé comme une collaboration entre Google Brain et DeepMind, qui ont fusionné en avril 2023 pour former Google DeepMind. Annoncé lors du discours principal de Google I/O le 10 mai 2023, Gemini a été positionné comme un successeur de PaLM 2, avec un accent sur la multimodalité - la capacité de traiter simultanément du texte, des images, de l'audio, de la vidéo et du code informatique. Le PDG de Google, Sundar Pichai, et le PDG de DeepMind, Demis Hassabis, ont dirigé le projet, avec le cofondateur Sergey Brin contribuant apparemment en tant que « contributeur principal ».
Pendant le développement, Google visait à surpasser les modèles existants comme GPT-4 et Claude 2 d'Anthropic. Le modèle a été entraîné sur les unités de traitement tensoriel (TPU) de Google et a incorporé des techniques du programme AlphaGo de DeepMind. En août 2023, des rapports indiquaient que Google visait un lancement fin 2023, et un accès anticipé a été accordé à certaines entreprises via le service Vertex AI de Google Cloud.
Annonce et publication initiale
Le 6 décembre 2023, Pichai et Hassabis ont annoncé Gemini 1.0 lors d'une conférence de presse virtuelle. La publication comprenait trois modèles : Gemini Ultra, conçu pour des « tâches hautement complexes » ; Gemini Pro, pour « une large gamme de tâches » ; et Gemini Nano, pour des « tâches sur appareil ». Au lancement, Gemini Pro et Nano ont été intégrés respectivement à Bard et au smartphone Pixel 8 Pro, tandis que Gemini Ultra était prévu pour une disponibilité début 2024 via Bard Advanced.
Gemini Ultra a été présenté comme le « modèle d'IA le plus grand et le plus performant » de Google et a été le premier à surpasser les experts humains au test Massive Multitask Language Understanding (MMLU) sur 57 sujets, obtenant un score de 90 %. Il a également surpassé GPT-4, Claude 2, Inflection-2, LLaMA 2 et Grok 1 sur divers benchmarks. En raison des exigences approfondies de tests de sécurité, le modèle n'a pas été largement disponible avant l'année suivante.
Le lancement de février 2024
En février 2024, Google a lancé Gemini Ultra 1.0 dans le cadre de l'expérience « Gemini Advanced », disponible via le niveau d'abonnement Google One AI Premium. Ce lancement a également vu l'unification de Bard et Duet AI sous la marque Gemini, avec Bard Advanced devenant Gemini Advanced. Le modèle a été mis à disposition des utilisateurs en anglais, avec un coût d'abonnement qui le positionnait comme une offre premium.
Le lancement a été accompagné d'un déploiement mondial de Gemini Pro, élargissant l'accès au modèle dans davantage de régions. Google a également commencé à intégrer Gemini dans d'autres produits, notamment Search, Ads, Chrome et Google Workspace, signalant une stratégie plus large visant à intégrer l'IA dans tout son écosystème.
Capacités techniques et architecture
Gemini Ultra 1.0 a été construit sur une architecture transformer, similaire à d'autres grands modèles de langage, mais avec des améliorations pour le traitement multimodal. Il pouvait gérer du texte, des images, de l'audio, de la vidéo et du code, le rendant polyvalent pour des applications allant de la compréhension du langage naturel à la génération de code. Le modèle a été entraîné sur un ensemble de données massif, comprenant des transcriptions de vidéos YouTube, avec des équipes juridiques filtrant le contenu protégé par le droit d'auteur.
Une caractéristique notable était sa capacité à générer des images contextuelles, une capacité qui le distinguait des modèles textuels uniquement. Cela a été réalisé grâce à l'intégration avec la génération d'images assistée par IA, permettant au modèle de créer du contenu visuel basé sur des invites textuelles. Le modèle a également démontré de fortes performances dans les tâches de raisonnement et de résolution de problèmes, en s'appuyant sur des techniques de apprentissage profond et de réseaux neuronaux.
Intégration et partenariats
Après le lancement, Google s'est associé à Samsung pour intégrer Gemini Nano et Pro dans la gamme de smartphones Galaxy S24 en janvier 2024. Cela a marqué une étape significative dans l'apport d'une IA avancée aux appareils mobiles, avec un traitement sur appareil pour des tâches comme la synthèse et la traduction.
Dans le domaine des entreprises, Gemini Ultra a été mis à disposition des développeurs via Vertex AI et AI Studio de Google Cloud, permettant aux entreprises de créer des applications personnalisées. Le modèle a également été intégré à Duet AI de Google pour Workspace, améliorant les outils de productivité avec une assistance alimentée par l'IA.
Réception et impact
Le lancement de Gemini Ultra 1.0 a suscité une attention considérable dans la communauté de l'IA, car il représentait une étape majeure dans la course aux capacités avancées de l'IA. Ses performances sur des benchmarks comme MMLU ont établi une nouvelle norme, et ses fonctionnalités multimodales ont été considérées comme un pas vers une IA plus humaine.
Cependant, certains critiques ont noté que la disponibilité du modèle était limitée, et l'accès par abonnement a été perçu comme un obstacle pour certains utilisateurs. Malgré cela, le lancement a consolidé la position de Google en tant que leader en intelligence artificielle, concurrençant directement OpenAI et d'autres acteurs.
Développements ultérieurs
Dans les mois suivant le lancement, Google a continué à itérer sur la famille Gemini. En février 2024, la société a introduit Gemini 1.5, qui présentait une architecture de mélange d'experts et une fenêtre de contexte plus large d'un million de jetons. Plus tard dans l'année, Google a publié des versions mises à jour, Gemini-1.5-Pro-002 et Gemini-1.5-Flash-002, et en décembre 2024, a annoncé Gemini 2.0 Flash Experimental.
Ces mises à jour ont démontré l'engagement de Google envers une avancée rapide dans l'IA, chaque itération apportant des améliorations en termes de performance, d'efficacité et de capacités. Le lancement de Gemini Ultra a ainsi marqué le début d'une nouvelle ère dans les offres d'IA de Google, préparant le terrain pour de futures innovations dans le domaine.