Qwen3 A22B est une famille de grands modèles de langage développée par Alibaba Cloud, publiée pour la première fois en avril 2025. La famille comprend quatre variantes qui sont apparues sur les classements publics de LLM et de médias, notamment la plateforme d'évaluation en intelligence artificielle (IA) Artificial Analysis et le classement LMArena. Les modèles reposent sur une architecture de mélange d'experts (MoE), avec 22 milliards de paramètres au total et environ 3 milliards de paramètres actifs par jeton. La famille fait partie de la série plus large Qwen3, qui comprend également des modèles denses de tailles variées.
Les modèles Qwen3 A22B sont conçus pour des tâches de raisonnement et de non-raisonnement, prenant en charge une longueur de contexte de 256 000 jetons. Ils sont publiés sous une licence open source, spécifiquement la licence Apache 2.0, permettant une utilisation commerciale. Les modèles sont disponibles en variantes de base et affinées par instructions, les versions affinées par instructions étant optimisées pour les applications de chat et d'agents.
Architecture et entraînement
Le Qwen3 A22B utilise une architecture MoE basée sur les transformeurs, intégrant des techniques telles que l'attention multi-têtes, les connexions résiduelles et la normalisation de couche. Le modèle emploie un tokeniseur avec une taille de vocabulaire de 151 936 et utilise l'échantillonnage top-p et la mise à l'échelle de température lors de la génération. L'entraînement a impliqué un processus en deux étapes : un pré-entraînement initial sur un grand corpus de texte multilingue, suivi d'un affinage supervisé et d'un apprentissage par renforcement à partir de retours d'IA (RLAIF) pour s'aligner sur les préférences humaines.
Le modèle a été entraîné sur un mélange de données provenant du web, de livres et de code, avec un accent sur l'anglais et le chinois. La puissance de calcul d'entraînement est estimée à plusieurs milliers de jours GPU, bien que les chiffres exacts ne soient pas divulgués publiquement. Le modèle utilise l'optimiseur Adam avec un programme de taux d'apprentissage en cosinus et un écrêtage de gradient pour la stabilité.
Performance sur les benchmarks
Sur les classements publics, la variante affinée par instructions du Qwen3 A22B a démontré des performances compétitives. En mai 2025, elle se classait parmi les meilleurs modèles à poids ouverts sur le classement LMArena, avec un score Elo d'environ 1300, la plaçant au-dessus de nombreux modèles propriétaires plus grands. Sur l'indice d'intelligence artificielle Artificial Analysis, elle a obtenu 46 points, surpassant des modèles comme GPT-4o-mini et Claude 3.5 Haiku. Sur les benchmarks standard, elle a atteint 83,2 % sur MMLU-Pro, 86,1 % sur GPQA-Diamond et 91,1 % sur AIME 2025, indiquant de fortes capacités de raisonnement et de mathématiques.
La variante de base a également bien performé sur les benchmarks de codage, obtenant 72,6 % sur LiveCodeBench et 65,4 % sur SWE-bench Verified. Ces résultats ont été cités dans des rapports médiatiques et des évaluations académiques, bien que la réplication indépendante soit en cours.
Variantes et disponibilité
La famille Qwen3 A22B comprend quatre variantes : Qwen3-22B (base), Qwen3-22B-Instruct, Qwen3-22B-Instruct-2507 et Qwen3-22B-Instruct-2507-AWQ. Les versions 2507, publiées en juillet 2025, incluent des mises à jour de l'affinage par instructions et la prise en charge de l'appel d'outils. La variante AWQ est quantifiée pour une inférence efficace, utilisant des poids de 4 bits. Toutes les variantes sont disponibles en téléchargement via Hugging Face et ModelScope, et sont intégrées dans les offres Amazon SageMaker, Azure AI et Google Cloud.
Réception et impact
La publication de Qwen3 A22B a été remarquable pour son approche à poids ouverts, permettant aux chercheurs et aux développeurs d'exécuter le modèle sur du matériel grand public avec des accélérateurs Groq ou SambaNova. Il a été utilisé dans diverses applications, notamment les chatbots de IA générative et les assistants de codage. Les performances du modèle ont été comparées favorablement à celles de GPT-4.1 d'OpenAI et de Claude 3.5 Sonnet d'Anthropic, en particulier dans les tâches de raisonnement. Cependant, certaines évaluations notent que les capacités multilingues du modèle sont moins robustes pour les langues autres que l'anglais et le chinois.
À la fin de 2025, la famille Qwen3 A22B reste un choix populaire pour le déploiement sur site, avec une forte communauté de suiveurs. Sa publication a contribué à la tendance des modèles à poids ouverts à combler l'écart avec les systèmes propriétaires.