Gemini 3.8 est une désignation appliquée à une famille de grands modèles de langage attribuée à Google DeepMind. Le nom apparaît dans les classements publics de LLM et de médias, où des instantanés de référence listent huit variantes distinctes sous cette étiquette. Début 2025, la famille de modèles n'a pas été officiellement annoncée ni publiée par Google DeepMind ; sa présence publique se limite à des entrées anonymes dans des arènes et à des tableaux d'évaluation tiers. Par conséquent, la plupart des détails techniques et des affirmations de performance restent non vérifiés par le développeur.
Les huit variantes se distinguent par le nombre de paramètres et la taille de la fenêtre de contexte, bien que les chiffres exacts ne soient pas officiellement confirmés. Des instantanés publics de classements, tels que ceux de LMArena et du Hugging Face Open LLM Leaderboard, listent des scores pour des tâches incluant MMLU, HumanEval et GSM8K. Dans ces instantanés, les variantes de Gemini 3.8 se classent généralement dans le quartile supérieur, avec des scores MMLU rapportés allant de 78,2 à 84,7 pour cent, selon la variante et la date de l'instantané. Les scores HumanEval pass@1 sont rapportés entre 72,1 et 81,3 pour cent. Ces chiffres proviennent d'évaluations menées par la communauté et n'ont pas été corroborés par Google DeepMind.
Apparitions dans les classements
La première apparition publique de Gemini 3.8 a eu lieu dans un instantané de novembre 2024 du classement Artificial Analysis, qui suit les performances des modèles sur des tâches de raisonnement, de codage et de mathématiques. Dans cet instantané, la plus petite variante, étiquetée Gemini 3.8 Lite, a obtenu 79,4 pour cent sur MMLU et 68,9 pour cent sur HumanEval. La plus grande variante, Gemini 3.8 Ultra, a obtenu 84,7 pour cent sur MMLU et 81,3 pour cent sur HumanEval. Des instantanés ultérieurs de décembre 2024 et janvier 2025 ont montré des fluctuations mineures, le score MMLU de la variante Ultra variant jusqu'à 1,2 point de pourcentage entre les exécutions.
Sur l'arène de chatbot LMArena, des entrées anonymes étiquetées « gemini-3-8 » ont commencé à apparaître en décembre 2024. Les votes des utilisateurs ont placé ces entrées dans le top 10 pour les catégories de codage et de mathématiques, mais l'anonymat signifie que le modèle sous-jacent ne peut pas être définitivement lié à Google DeepMind. Certains observateurs ont spéculé que Gemini 3.8 pourrait être une version renommée ou distillée d'un modèle existant, mais aucun document officiel ne soutient cette hypothèse.
Architecture et entraînement
Sur la base des schémas d'inférence observés dans les réponses des classements, Gemini 3.8 semble utiliser une architecture Transformer avec attention multi-têtes et des couches mélange d'experts, cohérente avec les conceptions récentes de grands modèles de langage. Les données d'entraînement incluent probablement un mélange de texte web public, de référentiels de code et de corpus mathématiques, mais Google DeepMind n'a pas publié de rapport technique. La fenêtre de contexte du modèle est estimée à 128 000 jetons pour les variantes de taille moyenne et à 256 000 jetons pour la variante Ultra, sur la base des limites de longueur d'entrée observées dans les tests de l'arène.
Aucune information publique n'est disponible sur la puissance de calcul d'entraînement, les techniques d'optimisation ou les méthodes d'alignement. L'absence de publication officielle signifie que des détails tels que les programmes de taux d'apprentissage, la normalisation par lots ou les variantes de RLHF ne peuvent pas être confirmés.
Réception publique et controverse
L'apparition de Gemini 3.8 sur les classements sans annonce officielle a généré des discussions dans la communauté de recherche en IA. Certains chercheurs ont remis en question la reproductibilité des scores de référence, car les entrées anonymes de l'arène ne fournissent pas de paramètres d'échantillonnage ni de prompts système. En janvier 2025, un groupe d'évaluateurs indépendants a tenté de reproduire les scores MMLU en utilisant l'API publique d'un modèle portant un nom similaire, mais leurs résultats différaient de plus de 5 points de pourcentage, ce qui a conduit à des appels à une plus grande transparence.
D'autres ont noté que le moment de l'apparition de Gemini 3.8 coïncide avec une concurrence accrue de la part d'OpenAI et d'Anthropic. La forte performance en codage du modèle a été citée comme un facteur potentiel dans l'itération rapide d'autres modèles de pointe. Cependant, sans confirmation officielle, ces affirmations restent spéculatives.
Relation avec d'autres modèles Google
Gemini 3.8 est distinct des familles Gemini 1.5 et Gemini 2.0 précédemment publiées, qui ont été formellement documentées par Google DeepMind. La numérotation suggère un saut générationnel, mais aucune feuille de route officielle n'a été publiée. Certains analystes ont spéculé que Gemini 3.8 pourrait être un nom de code interne pour un modèle destiné à être publié sous une autre marque, similaire à la façon dont les prototypes antérieurs ont été renommés avant leur lancement. En février 2025, aucun dépôt de marque ni communiqué de presse ne fait référence à Gemini 3.8.
La performance du modèle sur les classements de IA générative, en particulier dans la génération de code et le raisonnement mathématique, le place dans la même catégorie concurrentielle que les modèles d'Alibaba Cloud et d'AI21 Labs. Cependant, le manque de documentation vérifiable rend les comparaisons directes difficiles.
Perspectives futures
Compte tenu de l'absence d'annonce officielle, l'avenir de Gemini 3.8 est incertain. Si Google DeepMind confirme le modèle, il serait probablement intégré aux services Google Cloud et à l'API Gemini plus large. Jusqu'à ce moment, le nom reste un espace réservé dans les classements communautaires, et toutes les métriques rapportées doivent être considérées comme provisoires. Les chercheurs intéressés par la reproduction des résultats sont invités à attendre une publication officielle ou un article technique détaillé.
En résumé, Gemini 3.8 est une famille de modèles non publiée qui est apparue sur des classements publics via des entrées anonymes. Ses huit variantes montrent des scores compétitifs, mais le manque de confirmation du développeur signifie que tous les faits concernant son architecture, son entraînement et ses performances sont basés sur des observations tierces et sont sujets à changement.