Qwen3 est une famille de grands modèles de langage développée par Alibaba Cloud. Sortie en avril 2025, la famille comprend à la fois des architectures denses et à mélange d'experts (MoE), avec des nombres de paramètres allant de 0,6 milliard à 235 milliards. Les modèles se distinguent par leur disponibilité en poids ouverts et leurs performances solides sur les bancs d'essai publics, apparaissant sur les classements médiatiques et ceux des LLM. La sortie comprenait 20 variantes dans les instantanés de bancs d'essai, couvrant différentes tailles et configurations.
La série Qwen3 s'appuie sur les familles de modèles antérieures Qwen et Qwen2, également développées par Alibaba Cloud. Les modèles sont conçus pour une gamme de tâches, notamment la génération de texte, le raisonnement et le codage. Ils prennent en charge plusieurs langues, avec un accent particulier sur l'anglais et le chinois, reflétant la base d'utilisateurs mondiale et nationale d'Alibaba.
Architecture et variantes
Les modèles Qwen3 utilisent une architecture Transformer (architecture), la norme pour les grands modèles de langage modernes. La famille comprend des modèles denses (où tous les paramètres sont actifs pour chaque jeton) et des modèles MoE (où seul un sous-ensemble de paramètres est activé par jeton, améliorant l'efficacité). Le plus grand modèle dense a 32 milliards de paramètres, tandis que le plus grand modèle MoE a 235 milliards de paramètres totaux avec 22 milliards activés par jeton.
Les 20 variantes dans les instantanés de bancs d'essai incluent des modèles avec 0,6B, 1,7B, 4B, 8B, 14B, 32B de paramètres denses, et des modèles MoE avec des configurations 30B-A3B, 57B-A14B, 235B-A22B (où le deuxième nombre indique les paramètres activés). Chaque taille est disponible en versions de base et ajustée par instructions, certaines ayant également un mode « pensée » qui permet un raisonnement prolongé avant de répondre.
Entraînement et fonctionnalités
Les modèles Qwen3 ont été entraînés sur un vaste corpus de données textuelles, bien qu'Alibaba Cloud n'ait pas divulgué la taille exacte de l'ensemble de données. Le processus d'entraînement a utilisé des techniques standard telles que l'optimiseur Adam et la planification du taux d'apprentissage. Les modèles intègrent des fonctionnalités comme l'attention multi-têtes et le encodage positionnel, courantes dans les modèles de langage basés sur les transformeurs.
Une caractéristique clé de Qwen3 est son mode de pensée hybride. Les utilisateurs peuvent basculer entre un mode de réponse rapide et directe et un mode de pensée qui génère des étapes de raisonnement internes avant de produire la réponse finale. Cela est similaire aux approches utilisées par d'autres familles de modèles comme la série o1 d'OpenAI, bien que l'implémentation de Qwen3 soit open-source.
Les versions ajustées par instructions ont été alignées en utilisant des techniques telles que le RLHF (apprentissage par renforcement à partir de retours humains) et le fine-tuning supervisé. Les modèles prennent également en charge l'échantillonnage top-p et la mise à l'échelle de la température pour contrôler le caractère aléatoire des sorties.
Performances et bancs d'essai
Les modèles Qwen3 sont apparus sur les classements publics de LLM, notamment LMArena (anciennement Chatbot Arena) et divers bancs d'essai académiques. Le plus grand modèle, Qwen3-235B-A22B, a montré des performances compétitives par rapport aux modèles fermés de premier plan d'OpenAI, d'Anthropic et de Google DeepMind sur des tâches comme les mathématiques, le codage et les connaissances générales.
Dans les instantanés de bancs d'essai, les 20 variantes couvrent une gamme de tailles, permettant aux utilisateurs de choisir un modèle qui équilibre performance et coût computationnel. Les modèles plus petits (0,6B à 8B) conviennent au déploiement en périphérie, tandis que les modèles plus grands nécessitent des ressources GPU substantielles. Les modèles ont été testés sur des bancs d'essai standard tels que MMLU, HumanEval et GSM8K, bien que les scores spécifiques varient selon la variante.
Disponibilité et écosystème
Les modèles Qwen3 sont publiés sous une licence ouverte, permettant une utilisation commerciale et de recherche. Ils sont disponibles en téléchargement sur Hugging Face et d'autres référentiels de modèles. Alibaba Cloud propose également les modèles via sa plateforme cloud, avec des API pour le déploiement.
Les modèles sont pris en charge par un écosystème croissant d'outils et de bibliothèques, notamment vLLM et Ollama pour l'inférence locale. Ils peuvent être affinés en utilisant des frameworks comme Hugging Face Transformers et PyTorch. La nature des poids ouverts a conduit à des adaptations communautaires, y compris des versions quantifiées qui fonctionnent sur du matériel grand public.
Réception et impact
La sortie de Qwen3 a été remarquable par son échelle et son ouverture. Au moment de la sortie, c'était l'une des plus grandes familles de modèles à poids ouverts disponibles, en concurrence avec les modèles de la série Llama de Meta et de Mistral AI. L'inclusion de variantes MoE a rendu les modèles à grande échelle plus accessibles, car ils nécessitent moins de ressources computationnelles lors de l'inférence.
La couverture médiatique a souligné les performances solides de Qwen3 sur les tâches de raisonnement et ses capacités multilingues. Les modèles ont été utilisés dans diverses applications, notamment les chatbots, les assistants de codage et les outils éducatifs. Cependant, comme pour tous les grands modèles de langage, il existe des préoccupations concernant les biais potentiels et les abus, qu'Alibaba Cloud a abordées grâce à un fine-tuning de sécurité et des directives d'utilisation.
À la mi-2025, Qwen3 continue d'être mis à jour, avec Alibaba Cloud publiant des correctifs et des variantes supplémentaires. La famille de modèles représente une contribution significative à la communauté de l'IA open-source, offrant une alternative haute performance aux systèmes propriétaires.