Qwen3.8 est une famille de grands modèles de langage développée par Alibaba Cloud. La série a été introduite en 2025 en tant que successeur de la génération Qwen2.5, offrant une gamme de tailles de paramètres allant des modèles denses aux architectures de mélange d'experts (MoE). Les modèles sont conçus à la fois pour une distribution open-source et un déploiement commercial via la plateforme d'Alibaba Cloud.
La famille Qwen3.8 comprend plusieurs configurations, avec les modèles denses phares à 8 milliards et 32 milliards de paramètres, ainsi que des variantes MoE telles que Qwen3.8-A14B, qui active 2,2 milliards de paramètres par jeton. Ces modèles prennent en charge une longueur de contexte de 131 072 jetons et sont entraînés sur des données multilingues couvrant plus de 30 langues, avec une force particulière en anglais et en chinois.
Architecture et entraînement
Les modèles Qwen3.8 utilisent une architecture Transformer (architecture) décodeur seul standard, avec des améliorations telles que attention multi-têtes, l'activation SwiGLU et des plongements de position rotatifs. Le processus d'entraînement a utilisé une approche en deux étapes : un pré-entraînement initial sur un large corpus de textes web, de livres et de code, suivi d'un affinage supervisé et d'un apprentissage par renforcement à partir de retours d'IA (RLAIF) pour s'aligner sur les préférences humaines.
Une caractéristique notable de Qwen3.8 est son mode de pensée hybride, qui permet au modèle de basculer entre la génération rapide de réponses et un raisonnement étendu. Cela est contrôlé via une invite système, permettant aux utilisateurs d'équilibrer la vitesse et la profondeur de l'analyse. Les modèles intègrent également des stratégies d'échantillonnage glouton et de échantillonnage top-p lors de l'inférence.
Performance et benchmarks
Sur les benchmarks publics, les modèles Qwen3.8 ont démontré des performances compétitives. Le modèle Qwen3.8-32B a obtenu un score de 75,1 sur le benchmark MMLU-Pro, surpassant plusieurs modèles plus grands. Sur le concours de mathématiques AIME24, le modèle 32B a obtenu 67,0, tandis que la variante MoE Qwen3.8-A14B a obtenu 81,0. Dans les tâches de codage, les modèles ont enregistré des résultats solides sur LiveCodeBench et SWE-bench, le modèle 32B atteignant un taux de réussite de 45,0 sur ce dernier.
Les modèles sont apparus sur les classements de grands modèles de langage publics, notamment LMArena et le Open LLM Leaderboard, où ils se sont classés parmi les meilleurs modèles open-weight dans leur catégorie de taille. Des évaluations indépendantes ont noté leur efficacité, en particulier les variantes MoE qui offrent des performances comparables aux modèles denses à un coût de calcul réduit.
Publication et disponibilité
Qwen3.8 a été publié par étapes, avec les modèles plus petits de 0,6B et 1,7B disponibles en premier, suivis des modèles denses 8B et 32B, et enfin des variantes MoE. Les poids sont distribués sous la licence Apache 2.0, permettant à la fois une utilisation en recherche et commerciale. Les modèles sont disponibles en téléchargement via Hugging Face et ModelScope, et peuvent être déployés via le service Model Studio de Alibaba Cloud.
Le support matériel inclut les GPU NVIDIA, avec les modèles optimisés pour l'inférence sur le matériel AMD et Intel également. Les options de déploiement vont de l'inférence locale utilisant vLLM ou SGLang aux API cloud. La publication a également inclus des versions quantifiées utilisant les techniques GPTQ et AWQ pour réduire l'empreinte mémoire.
Réception et impact
La série Qwen3.8 a été bien accueillie dans la communauté de l'IA open-source, les développeurs saluant son rapport performance-taille et la flexibilité du mode de pensée hybride. Les modèles ont été intégrés dans diverses applications, des assistants de codage aux outils de traduction multilingue. La publication a contribué à la tendance plus large de la démocratisation de l'IA générative, fournissant des modèles de haute qualité pouvant fonctionner sur du matériel grand public.
À la fin de 2025, la famille Qwen3.8 reste activement maintenue, avec des mises à jour périodiques et des variantes affinées supplémentaires publiées. Les modèles ont également servi de base à des recherches supplémentaires dans des domaines tels que l'élagage de modèles et la augmentation de données.