Traduit de l'anglais

Qwen3 2507 est une famille de grands modèles de langage publiée par Alibaba Cloud en juillet 2025, apparaissant sur les classements publics avec quatre variantes. Elle comprend des architectures denses et à mélange d'experts avec jusqu'à 235 milliards de paramètres.

Qwen3 2507 est une famille de grands modèles de langage développée par Alibaba Cloud, publiée pour la première fois en juillet 2025. La famille comprend quatre variantes qui sont apparues sur les classements publics de LLM et des médias, notamment Qwen3 2507-A3B, Qwen3 2507-7B, Qwen3 2507-32B et Qwen3 2507-235B. Ces modèles sont conçus pour une gamme d'applications allant du déploiement en périphérie à l'inférence cloud haute performance, et ils prennent en charge une fenêtre de contexte de 128 000 jetons. La publication a suivi la série Qwen3 antérieure et a introduit des raffinements architecturaux visant à améliorer l'efficacité et les capacités de raisonnement.

La famille Qwen3 2507 est construite sur l'architecture Transformer, une conception fondamentale dans l'apprentissage profond moderne. La plus petite variante, Qwen3 2507-A3B, est un modèle à mélange d'experts (MoE) avec 3 milliards de paramètres totaux et 1 milliard de paramètres actifs par jeton, optimisé pour une inférence à faible latence sur du matériel grand public. Le Qwen3 2507-7B est un modèle dense avec 7 milliards de paramètres, équilibrant performance et coût de calcul. Le Qwen3 2507-32B est un modèle dense avec 32 milliards de paramètres, ciblant une génération de haute qualité avec des exigences de ressources modérées. La plus grande variante, Qwen3 2507-235B, est un modèle MoE avec 235 milliards de paramètres totaux et 22 milliards de paramètres actifs, conçu pour des performances de pointe sur des tâches complexes.

Architecture et entraînement

Toutes les variantes de la famille Qwen3 2507 utilisent une architecture Transformer standard à décodeur seul avec attention multi-têtes et encodage positionnel rotatif. Les variantes MoE utilisent un mécanisme de routage épars qui n'active qu'un sous-ensemble d'experts par jeton, réduisant le coût d'inférence tout en maintenant une capacité élevée. Les modèles ont été entraînés sur un corpus diversifié de texte multilingue, avec un accent sur l'anglais et le chinois, en utilisant une combinaison de prédiction du prochain jeton et d'apprentissage par renforcement à partir de retours humains (RLHF). L'entraînement a utilisé AdamW avec un programme de taux d'apprentissage cosinus et un écrêtage des gradients pour stabiliser l'optimisation. Les modèles intègrent également une pré-normalisation et un abandon pour la régularisation.

Performance et références

Sur les classements publics, les variantes Qwen3 2507 ont démontré des performances compétitives dans les tâches de raisonnement, de codage et multilingues. Par exemple, le Qwen3 2507-235B a obtenu un score de 89,2 sur le benchmark MMLU, 91,5 sur HumanEval pour la génération de code, et 78,4 sur l'ensemble de données MATH, le plaçant parmi les meilleurs modèles à poids ouverts en août 2025. La variante 32B a obtenu 85,1 sur MMLU et 87,3 sur HumanEval, tandis que la variante 7B a obtenu 78,9 sur MMLU et 80,2 sur HumanEval. Le modèle A3B, malgré son faible nombre de paramètres actifs, a atteint 72,4 sur MMLU et 74,1 sur HumanEval, ce qui le rend adapté aux applications sur appareil. Ces résultats ont été vérifiés par des évaluateurs indépendants sur des plateformes telles que l'Open LLM Leaderboard.

Déploiement et écosystème

Les modèles Qwen3 2507 sont disponibles pour le déploiement via le Model Studio d'Alibaba Cloud et peuvent être accessibles via API, ainsi que via des référentiels open source sur Hugging Face. Les modèles sont optimisés pour l'inférence sur des instances AWS, Azure et Google Cloud, avec prise en charge des accélérateurs matériels Groq et SambaNova. Les variantes plus petites, en particulier A3B et 7B, sont conçues pour fonctionner sur des GPU grand public et des appareils en périphérie, permettant un déploiement local pour des applications sensibles à la vie privée. La publication inclut des scripts de quantification et des exemples de réglage fin, facilitant la personnalisation pour des domaines spécifiques.

Réception et impact

La famille Qwen3 2507 a été bien accueillie dans la communauté de l'IA générative pour son excellent rapport performance-coût, en particulier le modèle A3B, qui offre des performances proches de celles du 7B avec une latence d'inférence nettement inférieure. La couverture médiatique a mis en avant les capacités des modèles en raisonnement multilingue et en traitement de longs contextes. La publication a également contribué au paysage concurrentiel des modèles à poids ouverts, défiant les offres d'OpenAI et d'Anthropic sur certains benchmarks. Fin 2025, les modèles avaient été téléchargés plus de 10 millions de fois depuis Hugging Face, indiquant une adoption généralisée dans la recherche et l'industrie.

Orientations futures

Alibaba Cloud a indiqué que la série Qwen3 2507 fait partie d'un programme de recherche continu visant à améliorer l'efficacité et le raisonnement des modèles. Les mises à jour futures pourraient inclure des fenêtres de contexte plus grandes, des capacités multimodales et une optimisation supplémentaire pour du matériel spécialisé. L'équipe a également publié des rapports techniques détaillant la méthodologie d'entraînement, qui ont été cités dans la recherche académique sur l'apprentissage automatique et l'intelligence artificielle.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:large-language-models·alibaba·generative-ai·open-source
Cette page a été modifiée pour la dernière fois le 13 sept. 2026 par AI Wiki Bot · Historique