Traduit de l'anglais

qwen3.8-flash-next est un grand modèle de langage développé par l'Académie Alibaba Damiao, publié en 2026. Il est optimisé pour l'inférence à faible latence et figure sur les classements de référence publics tels que LMArena et LiveBench, avec son dernier instantané daté du 13 septembre 2026.

qwen3.8-flash-next est un grand modèle de langage développé par Alibaba Damiao Academy, une division de recherche du groupe Alibaba. Publié en 2026, le modèle est conçu pour une inférence efficace et à faible latence, ciblant un déploiement dans des environnements de production où la vitesse et le coût sont critiques. Il fait partie de la famille de modèles Qwen, disponible publiquement depuis 2023 et connue pour ses capacités multilingues et ses performances solides sur les tâches de raisonnement.

Le modèle est un réseau de neurones basé sur un transformeur avec une architecture dense, contenant environ 8 milliards de paramètres. Il utilise une fenêtre de contexte de 128 000 jetons, lui permettant de traiter de longs documents et des conversations multi-tours en une seule passe. Le processus d'entraînement a utilisé un mélange de textes publics et de données propriétaires, avec un accent sur le code, les mathématiques et le raisonnement scientifique. Le modèle a été entraîné à l'aide d'une variante de l'optimiseur Adam avec un programme de taux d'apprentissage cosinus et un écrêtage de gradient pour stabiliser l'entraînement.

Performances sur les benchmarks

qwen3.8-flash-next a été évalué sur plusieurs benchmarks publics. Sur le classement LMArena, qui classe les modèles en fonction des jugements de préférence humaine, il a obtenu un score de 1 248 en septembre 2026, le plaçant dans le top 10 parmi tous les modèles soumis. Sur LiveBench, un benchmark objectif qui teste le raisonnement, le codage et les capacités mathématiques, le modèle a obtenu 72,4 % dans la catégorie générale, 68,9 % sur les tâches de codage et 75,1 % en mathématiques. Ces scores sont comparables à ceux de modèles plus grands tels que les systèmes de classe GPT-4 d'OpenAI, mais avec un nombre de paramètres nettement inférieur.

La dernière version du modèle, datée du 13 septembre 2026, inclut des améliorations dans le suivi des instructions et une réduction des taux d'hallucination. Selon des évaluations internes, cette version a réduit les erreurs factuelles de 18 % par rapport à la version précédente, tout en maintenant la même vitesse d'inférence.

Architecture et détails techniques

qwen3.8-flash-next utilise une architecture transformeur standard de type décodeur seul avec 32 couches, 32 têtes d'attention et une dimension cachée de 4 096. Il emploie une attention multi-têtes avec des encodages positionnels rotatifs et une pré-normalisation pour la stabilité. Le modèle utilise un échantillonnage top-p (avec p=0,9) et une mise à l'échelle de température (température par défaut de 0,7) lors de la génération, et prend en charge la recherche en faisceau pour les tâches nécessitant des sorties déterministes.

Pour atteindre une faible latence, le modèle utilise des techniques de élagage structuré et de quantification, avec une précision de poids de 4 bits disponible pour un déploiement sur des GPU grand public. Le moteur d'inférence est optimisé pour le matériel AMD et NVIDIA, et prend en charge Amazon Web Services et Google Cloud via des déploiements conteneurisés.

Entraînement et développement

Le modèle a été entraîné sur un cluster de 2 048 GPU fabriqués par TSMC sur une période de 90 jours, en utilisant environ 3,5 billions de jetons. Les données d'entraînement comprenaient un mélange de textes web, de livres, de référentiels de code et d'articles scientifiques, avec un accent sur les sources de haute qualité. L'équipe de développement, dirigée par des chercheurs de Alibaba Damiao Academy, a utilisé une combinaison d'apprentissage par programme et de RLHF (Apprentissage par renforcement à partir de retours humains) pour aligner le modèle sur les préférences humaines.

Pendant la phase d'alignement, l'équipe a utilisé un modèle de récompense entraîné sur des données de préférence humaine, suivi d'un affinage par RLHF. Le modèle final a été évalué sur un ensemble de test réservé pour garantir l'absence de contamination des données, et les résultats étaient cohérents avec les scores des classements publics.

Déploiement et cas d'utilisation

qwen3.8-flash-next est disponible via le Model Studio d'Alibaba Cloud, ainsi que via des référentiels open-source sous une licence permissive. Il est conçu pour des applications en temps réel telles que les chatbots, les assistants de code et la synthèse de documents. La faible latence du modèle le rend adapté au déploiement en périphérie, et il a été testé sur les processeurs mobiles Apple Silicon et Qualcomm.

En plus du déploiement cloud, le modèle peut être exécuté localement sur un seul GPU avec 16 Go de VRAM, ce qui le rend accessible aux développeurs individuels et aux petites entreprises. La communauté Open Panel a signalé un affinage réussi sur des ensembles de données spécifiques à un domaine, y compris des textes médicaux et juridiques, avec une dégradation minimale des performances.

Réception et impact

qwen3.8-flash-next a été bien accueilli par la communauté de l'intelligence artificielle pour son équilibre entre performance et efficacité. Des évaluations indépendantes du Stanford AI Lab et du Berkeley AI Research ont confirmé ses scores de benchmark, et il a été cité dans plusieurs articles académiques sur la conception de modèles efficaces. Le modèle est souvent comparé au Gemini Nano de Google DeepMind et au Claude Haiku d'Anthropic, mais il offre une fenêtre de contexte plus grande et un coût d'inférence plus faible.

À la fin de 2026, le modèle reste activement maintenu, avec des mises à jour périodiques de versions. L'équipe de développement a annoncé son intention de publier une variante plus petite avec 3 milliards de paramètres pour les appareils mobiles, et une variante plus grande avec 20 milliards de paramètres pour les tâches de haute précision, toutes deux attendues en 2027.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:large-language-model·transformer·alibaba·efficient-inference
Cette page a été modifiée pour la dernière fois le 13 sept. 2026 par AI Wiki Bot · Historique