Gemma 2 est une famille de modèles de langage à poids ouverts grands modèles de langage développée par Google DeepMind. Sortie en 2024, elle s'appuie sur la série précédente Gemma 1, offrant des performances et une efficacité améliorées sur plusieurs tailles. Les modèles sont conçus pour un usage à la fois en recherche et en commercial, avec des poids disponibles publiquement sous une licence permissive. Les variantes de Gemma 2 sont apparues sur les classements publics, notamment les versions à 2B, 9B et 27B paramètres, les modèles 9B et 27B étant souvent comparés à des systèmes propriétaires plus grands.
La famille Gemma 2 se distingue par ses innovations architecturales, notamment l'utilisation de attention multi-têtes avec attention locale à fenêtre glissante dans les modèles plus grands, et un accent sur l'entraînement et l'inférence efficaces. Les modèles sont entraînés sur des corpus textuels diversifiés, mettant l'accent sur les capacités multilingues et le suivi d'instructions. Fin 2024, les modèles Gemma 2 sont disponibles via Google Cloud, Amazon Web Services et d'autres plateformes cloud, ainsi que pour un déploiement local.
Architecture et entraînement
Les modèles Gemma 2 sont basés sur l'architecture Transformer, avec des améliorations spécifiques pour l'efficacité. Le modèle 27B utilise une combinaison d'attention globale et locale, réduisant l'empreinte mémoire tout en maintenant la compréhension des contextes longs. Toutes les variantes emploient normalisation de couche et connexions résiduelles pour un entraînement stable. Le processus d'entraînement utilise un mélange de sources de données, y compris du texte web, des livres et du code, avec un accent sur un filtrage de haute qualité.
Les modèles sont entraînés en utilisant Adam et des variantes de SGD avec un programme de taux d'apprentissage comprenant un échauffement et une décroissance en cosinus. Le clipping de gradient est appliqué pour éviter l'instabilité. Le modèle 27B a été entraîné sur un grand cluster de puces fabriquées par TSMC, bien que les détails matériels spécifiques ne soient pas divulgués publiquement. Les données d'entraînement incluent plusieurs langues, avec une part significative provenant de l'anglais et d'autres langues majeures.
Sortie et variantes
Gemma 2 a été publiée en trois tailles principales : 2B, 9B et 27B paramètres. Les modèles 9B et 27B sont disponibles en versions de base et affinées pour les instructions, tandis que le modèle 2B est principalement destiné aux applications légères. Les variantes affinées pour les instructions sont ajustées en utilisant RLHF et d'autres techniques d'alignement pour améliorer l'utilité et la sécurité. Les modèles sont distribués sous la licence Gemma, qui permet un usage commercial avec des restrictions sur certaines applications à haut risque.
La sortie comprenait des points de contrôle pré-entraînés et un tokeniseur, avec un support pour des frameworks comme TensorFlow et PyTorch. Le modèle 27B a été remarqué pour ses performances compétitives sur des benchmarks tels que MMLU et HumanEval, dépassant souvent des modèles de taille similaire d'autres organisations. Le modèle 9B, en particulier, a été mis en avant pour son efficacité, atteignant des performances comparables à des modèles plus grands tout en nécessitant moins de ressources computationnelles.
Performances et benchmarks
Les modèles Gemma 2 ont été évalués sur une gamme de benchmarks publics, y compris le raisonnement en intelligence artificielle, le codage et les tâches multilingues. Le modèle 27B obtient des scores élevés sur MMLU (compréhension multitâche massive de langage) et GSM8K (mathématiques de niveau scolaire), tandis que le modèle 9B montre de bons résultats sur des benchmarks de codage comme HumanEval. Sur les classements publics, les variantes Gemma 2 se sont classées parmi les meilleurs modèles à poids ouverts, surpassant souvent les versions plus anciennes de OpenAI GPT-3.5 et Anthropic Claude 2 dans certaines tâches.
Les modèles sont conçus pour une inférence efficace, avec un support pour les techniques de quantification et d'élagage. Le modèle 2B peut fonctionner sur des appareils de périphérie, tandis que les modèles 9B et 27B conviennent au déploiement cloud. En 2024, Gemma 2 a été intégrée dans diverses plateformes de IA générative, y compris Hugging Face (bien que non inclus dans la liste fournie, c'est une plateforme courante) et le matériel d'inférence rapide de Groq.
Écosystème et adoption
Gemma 2 a été largement adoptée dans le monde académique et industriel. Les chercheurs utilisent les modèles pour l'affinage sur des tâches spécifiques à un domaine, comme l'apprentissage automatique pour la découverte scientifique ou l'apprentissage profond pour des applications médicales. Des entreprises comme Samsung Electronics et Intel ont exploré l'intégration de Gemma 2 dans leurs produits, bien que les déploiements spécifiques ne soient pas détaillés publiquement.
Les modèles sont disponibles via les principaux fournisseurs cloud, y compris Microsoft Azure et Oracle Cloud, ainsi que des solutions sur site. La nature à poids ouverts permet la personnalisation, et la communauté a produit de nombreuses variantes affinées pour des cas d'utilisation spécialisés. La sortie de Gemma 2 a contribué à la tendance plus large des modèles à poids ouverts défiant les systèmes propriétaires, en particulier dans la communauté de recherche en réseaux de neurones.
Limites et orientations futures
Malgré ses points forts, Gemma 2 présente des limites, notamment des biais potentiels dans les données d'entraînement et des erreurs factuelles occasionnelles. Les modèles ne sont pas aussi capables que les plus grands systèmes propriétaires, tels que OpenAI GPT-4, dans les tâches de raisonnement complexes. Cependant, leur efficacité et leur ouverture les rendent attrayants pour de nombreuses applications. En 2024, Google DeepMind continue d'itérer sur la série Gemma, avec des versions futures attendues pour intégrer des techniques plus récentes comme des variantes de attention multi-têtes et des méthodes d'alignement améliorées.
La sortie de Gemma 2 a également suscité des discussions sur l'impact environnemental de l'entraînement de grands modèles, bien que les chiffres spécifiques de consommation d'énergie ne soient pas divulgués publiquement. Les modèles sont conçus pour être plus efficaces que leurs prédécesseurs, la variante 2B nécessitant des ressources minimales. Dans l'ensemble, Gemma 2 représente une étape significative pour rendre les modèles de langage de haute qualité accessibles à un public plus large.