Gemma est une série de modèles de langage de grande taille à code source disponible, développée par Google DeepMind. Elle repose sur des technologies similaires à celles de la série de modèles Gemini et est conçue pour soutenir la mission de Google de « rendre l'IA utile à tous ». La première version a été publiée en février 2024, suivie de Gemma 2 en juin 2024, de Gemma 3 en mars 2025 et de Gemma 4 à poids ouverts en avril 2026. Des variantes de Gemma ont également été développées, comme le modèle de vision-langage PaliGemma et le modèle MedGemma pour les sujets de consultation médicale.
Historique
En février 2024, Google a dévoilé Gemma, une collection de LLM à code source disponible servant de version légère de Gemini. La version initiale était proposée en deux tailles : des réseaux de neurones avec respectivement deux et sept milliards de paramètres. Plusieurs publications ont vu dans cette initiative une réponse à des concurrents comme Meta, qui publient le code source de leurs modèles d'IA, ainsi qu'un changement par rapport à la pratique de longue date de Google de garder privé le code source de ses IA.
Gemma 2 a été publiée le 27 juin 2024, et Gemma 3 le 12 mars 2025. Le 2 avril 2026, Google a publié Gemma 4 sous la licence libre et open source Apache 2.0.
Vue d'ensemble
Basée sur des technologies similaires à celles de la série de modèles Gemini, Gemma est décrite par Google comme contribuant à sa mission de « rendre l'IA utile à tous ». Google propose des variantes officielles de Gemma optimisées pour des cas d'utilisation spécifiques, comme MedGemma pour l'analyse médicale.
Depuis sa sortie, les modèles Gemma ont enregistré plus de 150 millions de téléchargements, avec 70 000 variantes disponibles sur Hugging Face.
Gemma 3 a été proposée en tailles de 1, 4, 12 et 27 milliards de paramètres, avec un support de plus de 140 langues. En tant que modèles multimodaux, ils prennent en charge à la fois les entrées texte et image. Google propose également Gemma 3n - des modèles plus petits optimisés pour une exécution sur des appareils grand public comme les smartphones, les ordinateurs portables et les tablettes.
La dernière génération de modèles est Gemma 4, publiée le 2 avril 2026. Elle est disponible en quatre tailles : Effective 2B (E2B), Effective 4B (E4B), 26B Mixture of Experts (MoE) et 31B Dense. Gemma 4 prend en charge les entrées multimodales, y compris les images et les vidéos sur tous les modèles, avec une entrée audio native sur les modèles E2B et E4B. La variante 31B Dense de Gemma 4 a atteint la troisième place du classement textuel d'Arena, et la variante 26B a atteint la sixième place. Gemma 4 12B a été publiée le 3 juin 2026 et présente une architecture multimodale unifiée qui traite les images et l'audio sans encodeurs.
Architecture
Gemma 3 repose sur une architecture transformeur à décodeur seul avec attention par requêtes groupées (GQA) et l'encodeur visuel SigLIP. Chaque modèle a une longueur de contexte de 128K, à l'exception de Gemma 3 1B, qui a une longueur de contexte de 32K.
Des versions quantifiées affinées à l'aide d'un apprentissage sensible à la quantification (QAT) sont également disponibles, offrant des améliorations notables de l'utilisation de la mémoire avec un certain impact négatif sur la précision et l'exactitude.
Variantes
Google développe des variantes officielles des modèles Gemma conçues pour des objectifs spécifiques, comme l'analyse médicale ou la programmation. Elles comprennent :
- CodeGemma (2B et 7B) : CodeGemma est un groupe de modèles conçus pour la complétion de code ainsi que pour un usage général de programmation. Il prend en charge plusieurs langages de programmation, notamment Python, Java, C++ et d'autres.
- DolphinGemma (environ 400M) : Développé en collaboration avec des chercheurs du Georgia Tech et du Wild Dolphin Project, DolphinGemma vise à mieux comprendre la communication des dauphins grâce à l'analyse audio. Cependant, aucun modèle ni donnée n'a été rendu public.
- MedGemma (4B et 27B) : Également basée sur Gemma 3, MedGemma est conçue pour des applications médicales comme l'analyse d'images. Cependant, Google note également que MedGemma « n'est pas encore de qualité clinique ». Des développeurs de Tap Health à Gurgaon, en Inde, ont utilisé MedGemma pour améliorer des applications de gestion du diabète assistées par IA.
- PaliGemma (3B, 10B et 28B, basée respectivement sur Gemma 2 avec 2B, 9B et 27B) : Pour la vision par machine et l'analyse d'images.
- ShieldGemma 2 (4B) : Basée sur la famille Gemma 3, ShieldGemma est conçue pour identifier et filtrer les images violentes, dangereuses et sexuellement explicites.
- TranslateGemma (4B, 12B et 27B) : Pour la traduction automatique.
Remarque : les modèles à poids ouverts peuvent voir leur longueur de contexte redimensionnée au moment de l'inférence. Avec Gemma 1, Gemma 2, PaliGemma et PaliGemma 2, le coût est une augmentation linéaire de la taille du cache kv par rapport à la taille de la fenêtre de contexte. Avec Gemma 3, la courbe de croissance est améliorée grâce à la séparation de l'attention locale et globale. Avec RecurrentGemma, l'utilisation de la mémoire reste inchangée après 2 048 jetons.
Voir aussi
- Liste des modèles de langage de grande taille
- Listes des logiciels d'intelligence artificielle open source