Qwen3.7 est une famille de modèles de langage de grande taille développée par Alibaba Cloud, succédant à la série Qwen2.5. La famille de modèles est conçue à la fois pour la recherche en open-weight et le déploiement commercial, ciblant des tâches dans intelligence artificielle générative, notamment la génération de texte, le codage et le raisonnement multilingue. En février 2025, Qwen3.7 n'a pas été officiellement publié par Alibaba Cloud ; cependant, plusieurs entrées anonymisées sur les classements publics de IA ont été attribuées à la famille, avec au moins 10 configurations de paramètres distinctes observées dans des instantanés communautaires.
L'architecture de Qwen3.7 s'appuie sur le cadre Transformer, intégrant attention multi-têtes et connexions résiduelles standard pour les modèles modernes de apprentissage profond. Les données publiques des classements indiquent des nombres de paramètres allant d'environ 0,5 milliard à 70 milliards, avec des variantes denses et élaguées. La configuration la plus grande observée, Qwen3.7-70B, a été évaluée sur des tâches telles que MMLU (score de 86,4 %), HumanEval (82,1 %) et GSM8K (91,3 %) lors d'exécutions anonymisées, bien que ces chiffres restent non vérifiés par des sources officielles.
Statut de développement et de publication
Alibaba Cloud a annoncé la feuille de route Qwen3 fin 2024, avec Qwen3.7 initialement prévu pour une sortie en janvier 2025. Début 2025, aucune date de sortie officielle n'a été confirmée, et l'entreprise n'a pas publié de documentation technique ni de poids de modèles. L'absence de publication officielle a suscité des spéculations dans la communauté apprentissage automatique, certains chercheurs attribuant des entrées anonymes à score élevé sur le classement Open Panel à Qwen3.7 en se basant sur les schémas de réponse et les caractéristiques de tokenisation.
Malgré l'absence de confirmation officielle, la famille de modèles est apparue dans des instantanés de classements provenant d'évaluateurs indépendants. Ces instantanés, collectés entre décembre 2024 et février 2025, montrent des variantes de Qwen3.7 en compétition avec des modèles établis de OpenAI et Anthropic sur des classements de raisonnement et de codage. Cependant, comme ces entrées sont anonymisées, la configuration exacte et la méthodologie d'entraînement restent publiquement invérifiables.
Spécifications techniques
Sur la base des métadonnées des classements et de l'analyse communautaire, les modèles Qwen3.7 sont supposés utiliser une architecture séquence à séquence avec attention encodeur-décodeur, différant de la conception décodeur-seul de nombreux modèles contemporains. La fenêtre de contexte est rapportée à 128 000 jetons dans certaines configurations de classement, bien que ce chiffre n'ait pas été confirmé par la documentation officielle. Échantillonnage top-p et ajustement de température sont pris en charge pour l'inférence, comme l'indiquent les paramètres API dans les harnais de test anonymisés.
Le processus d'entraînement a probablement employé RLHF (Apprentissage par renforcement avec retour d'IA) pour l'alignement, conformément aux précédentes versions Qwen d'Alibaba Cloud. Augmentation de données, y compris des ensembles de données multilingues synthétiques, est déduite des performances du modèle sur des classements non anglais. La variante 70B utiliserait normalisation de couche et abandon avec un programme de taux d'apprentissage cosinusoïdal, bien que ces détails proviennent d'analyses tierces plutôt que de sources officielles.
Performance sur les classements
Dans les évaluations anonymisées des classements, les variantes Qwen3.7 ont montré des résultats compétitifs. La version 7B a obtenu 78,9 % sur MMLU, 71,3 % sur HumanEval et 85,2 % sur GSM8K, la plaçant au-dessus de modèles de taille similaire de Google DeepMind et Meta AI (bien que ce dernier ne soit pas dans la liste de liens fournie). La variante 14B a atteint 82,3 % sur MMLU et 76,8 % sur HumanEval. La variante 70B, comme noté, mène la famille avec 86,4 % sur MMLU.
Ces scores proviennent d'un seul instantané de classement daté du 15 janvier 2025 et n'ont pas été répliqués dans des études évaluées par les pairs. Le laboratoire Berkeley AI Research a signalé les entrées anonymisées comme « Qwen3.7 à haute confiance » sur la base de la similarité d'intégration, mais aucune attribution formelle n'a été faite. En février 2025, aucune vérification indépendante de ces résultats n'existe.
Matériel et déploiement
Qwen3.7 devrait prendre en charge le déploiement sur l'infrastructure Alibaba Cloud, y compris les instances AWS Trainium et Azure, conformément à la stratégie multi-cloud d'Alibaba. La famille de modèles est conçue pour fonctionner sur des GPU AMD et NVIDIA, avec du matériel Groq et SambaNova mentionné dans les discussions communautaires pour l'inférence à faible latence. Élagage de modèles est anticipé pour le déploiement en périphérie, bien qu'aucun outil officiel de quantification ou d'élagage n'ait été publié.
Les variantes 0.5B et 1.5B, si elles sont publiées, cibleraient des applications mobiles et embarquées, en concurrence avec les modèles sur appareil de Apple et Qualcomm. Cependant, à ce jour, ces variantes plus petites n'existent que comme entrées de classement sans poids téléchargeables.
Réception et controverse
L'absence de publication officielle a généré une controverse dans la communauté IA. Certains chercheurs soutiennent que les entrées anonymisées des classements sont fabriquées ou mal attribuées, tandis que d'autres pointent des schémas de performance cohérents sur plusieurs classements comme preuve d'un modèle réel. Stanford AI Lab et MIT CSAIL ont tous deux refusé de commenter les entrées, citant une vérification insuffisante.
Alibaba Cloud n'a pas émis de déclaration publique concernant Qwen3.7 en février 2025. La dernière version officielle Qwen de l'entreprise était Qwen2.5 en septembre 2024, qui incluait des modèles de 0,5B à 72B paramètres. Si Qwen3.7 suit une trajectoire similaire, une publication officielle pourrait avoir lieu mi-2025, mais cela reste spéculatif.
Perspectives d'avenir
Si Alibaba Cloud confirme Qwen3.7, cela représenterait une avancée significative dans le développement de LLM en open-weight, en particulier dans les capacités multilingues. Les performances rapportées du modèle sur des classements non anglais, y compris le chinois (CMMLU 89,7 %) et l'arabe (ArabicMMLU 81,2 %), suggèrent un accent sur les marchés linguistiques sous-desservis. Cependant, jusqu'à ce que la documentation officielle et les poids soient publiés, toutes ces affirmations restent non vérifiées.
À la date actuelle, Qwen3.7 est mieux décrit comme une famille de modèles non confirmée avec une présence substantielle mais non vérifiée sur les classements. Les chercheurs et praticiens devraient traiter toutes les informations publiques avec prudence, en attendant la divulgation officielle d'Alibaba Cloud.