Qwen (également connu sous le nom de Tongyi Qianwen, chinois : 通义千问 ; pinyin : Tōngyì Qiānwèn) est une famille de modèles de langage de grande et petite taille (LLM et SLM) principalement à poids ouverts, développée par Alibaba Cloud. La série comprend des architectures denses et à mélange d'experts, allant de petits modèles adaptés aux appareils de périphérie à des modèles à grande échelle avec des billions de paramètres. Les modèles Qwen sont largement utilisés comme base pour le fine-tuning et l'ablitération dans la communauté open-source, et une version locale alimente Apple Intelligence en Chine.
La première itération, basée sur l'architecture Llama 1 de Meta AI, a été lancée en version bêta en avril 2023 et a publié ses poids de 72B en décembre 2023. Les versions suivantes, Qwen2 et Qwen3, ont élargi la famille avec des capacités visuelles, audio et omni-modales, et ont introduit des modèles axés sur le raisonnement. La dernière version, Qwen3.8, inclut le Qwen3.8-Max de 2,4 billions de paramètres, qui était le deuxième plus grand et le deuxième plus puissant LLM à poids ouverts et LLM chinois au 12 août 2026, après Kimi K3.
Architecture et entraînement des modèles
Les modèles Qwen sont construits sur l'architecture Transformer, adoptant initialement la conception Llama de Meta AI. Les versions ultérieures intègrent des innovations telles que l'attention multi-têtes, les couches à mélange d'experts (MoE) et de longues fenêtres de contexte. Par exemple, Qwen3.8-Max utilise une architecture MoE avec environ 95 milliards de paramètres actifs par passage avant et prend en charge une fenêtre de contexte allant jusqu'à un million de jetons. Les données d'entraînement de Qwen3 comprenaient 36 billions de jetons dans 119 langues et dialectes, permettant des capacités multilingues étendues.
La famille comprend à la fois des modèles denses (par exemple, les variantes denses de Qwen3 de 0,6B à 32B paramètres) et des modèles MoE (par exemple, Qwen3-30B-A3B et Qwen3-235B-A22B). Qwen3.8-Max, avec 2,4 billions de paramètres au total, est le plus grand modèle à poids ouverts de la série. Les modèles sont entraînés à l'aide de techniques standard de deep learning, y compris l'optimisation Adam et la planification du taux d'apprentissage, bien que les détails spécifiques de l'entraînement ne soient souvent pas entièrement divulgués.
Variantes et capacités des modèles
Qwen englobe plusieurs lignes de modèles spécialisés. La série Qwen-VL combine un transformateur de vision avec un LLM pour les tâches de langage visuel, avec des variantes telles que Qwen2-VL (2B et 7B) et Qwen2.5-VL (3B, 7B, 32B, 72B). Qwen2.5-Omni-7B accepte du texte, des images, des vidéos et de l'audio en entrée et génère à la fois du texte et de l'audio en sortie, permettant une interaction vocale en temps réel. Qwen-Audio gère les tâches audio, et Qwen2-Math se concentre sur le raisonnement mathématique. La série QwQ, commençant avec QwQ-32B-Preview en novembre 2024, met l'accent sur le raisonnement similaire à OpenAI's o1, avec une longueur de contexte de 32K jetons.
Qwen3 a introduit un mode de réflexion qui peut être activé ou désactivé, permettant au modèle de délibérer avant de répondre ou de répondre directement. Qwen3.8-Max, publié en poids ouverts le 12 août 2026, omet certaines fonctionnalités cloud telles que l'entrée d'images et le mode sans réflexion, mais le Qwen3.8-27B distillé inclut ces fonctionnalités et est sous licence Apache License permissive.
Publications et licences
Alibaba a publié plus de 100 modèles à poids ouverts, avec des téléchargements cumulés dépassant 40 millions au début de 2025. Les licences varient selon le modèle : de nombreuses versions plus petites et distillées utilisent la licence Apache 2.0, tandis que les modèles plus grands exigent souvent un accord de partage des revenus pour les fournisseurs générant plus de 50 millions de dollars US par an. Par exemple, Qwen3.8-2.4T-A95B nécessite une telle licence commerciale, tandis que Qwen3.8-27B est sous Apache 2.0. Cette stratégie équilibre l'ouverture avec les intérêts commerciaux, faisant de Qwen un point de départ courant pour le fine-tuning communautaire.
Les dates de publication clés incluent : la version bêta de Qwen en avril 2023 ; les poids de Qwen 7B en août 2023 ; Qwen 72B et 1.8B en décembre 2023 ; Qwen2 en juin 2024 ; Qwen2.5-VL en janvier 2025 ; Qwen2.5-Max le 29 janvier 2025 ; Qwen2.5-VL-32B-Instruct le 24 mars 2025 ; Qwen2.5-Omni-7B le 26 mars 2025 ; Qwen3 le 28 avril 2025 ; Qwen3.5 en février 2026 ; l'aperçu de Qwen3.8-Max en juillet 2026 ; la version cloud le 3 août 2026 ; les poids ouverts le 12 août 2026 ; et Qwen3.8-27B le 14 août 2026.
Écosystème et applications
Les modèles Qwen sont intégrés dans les services cloud et les applications grand public d'Alibaba. L'application mobile Qwen, mise à jour en janvier 2026, se connecte à l'écosystème d'Alibaba, commençant par la livraison de services alimentaires, avec des plans d'extension à des plateformes comme Taobao et Fliggy. Une version locale de Qwen est utilisée par Apple Intelligence en Chine, intégrée au système d'exploitation. L'application Accio, lancée en novembre 2024, exploite Qwen pour une assistance shopping pilotée par l'IA.
Dans la communauté open-source, les licences permissives de Qwen ont conduit à de nombreux dérivés fine-tunés et ablitérés, tels que « Liberated Qwen » d'Abacus AI, qui supprime les restrictions de contenu, et « Qwable », incorporant des données de tuning d'Anthropic's Fable 5. Ces dérivés soulignent le rôle de Qwen en tant que modèle fondamental pour l'expérimentation.
Développements récents
En mars 2026, Lin Junyang, ancien responsable de la division des modèles IA Qwen, a démissionné après la publication de Qwen3.5 et Qwen3.5-Plus, devenant le troisième dirigeant à quitter Alibaba cette année-là. Alibaba a réaffirmé son engagement envers l'IA open-source malgré ces départs. Plus tard dans le mois, une annonce de l'entreprise a révélé la formation d'une nouvelle entité, bien que les détails restent limités au début de 2026. La série Qwen3.8, y compris le Qwen3.8-Max propriétaire et le Qwen3.8-27B ouvert, représente la dernière avancée, Alibaba continuant à repousser les limites de l'échelle et des capacités des modèles à poids ouverts.