Traduit de l'anglais

Qwen2.5 est une famille de grands modèles de langage développée par Alibaba Cloud, publiée en 2024. Elle comprend différentes tailles de paramètres et des variantes spécialisées pour le codage et les mathématiques.

Qwen2.5 est une famille de modèles de langage de grande taille à poids ouverts développée par Alibaba Cloud, publiée en septembre 2024. Elle succède à la série Qwen2 et représente une itération significative dans l'évolution de l'IA générative, avec des modèles allant de 0,5 milliard à 72 milliards de paramètres. La famille comprend des modèles de base, des variantes ajustées par instructions, et des versions spécifiques à un domaine optimisées pour le codage et le raisonnement mathématique.

La sortie de Qwen2.5 a élargi l'architecture et la méthodologie d'entraînement de son prédécesseur, intégrant des améliorations dans la qualité des données et l'échelle d'entraînement. Les modèles ont été mis à disposition sous des licences ouvertes permissives, permettant une utilisation académique et commerciale dans une large gamme d'applications, allant de l'expérimentation occasionnelle en apprentissage automatique à des déploiements de production de LLM sur AWS, Azure et d'autres plateformes cloud.

La famille a obtenu des performances notables sur les classements publics de référence en IA, rivalisant souvent favorablement avec des modèles de OpenAI, Anthropic et Google DeepMind à des nombres de paramètres comparables. Son accessibilité et ses performances compétitives ont contribué à une adoption généralisée au sein de la communauté open-source de l'IA.

Architecture et Entraînement

Toutes les variantes de Qwen2.5 sont basées sur l'architecture Transformer (architecture), utilisant une structure décodeur seul typique des modèles de langage causaux modernes. L'architecture intègre des mécanismes de attention multi-têtes avec des fonctions de encodage positionnel, ainsi que la normalisation de couche et des connexions résiduelles pour faciliter un entraînement stable à grande échelle.

Les modèles utilisent un tokenizer à vocabulaire étendu et sont entraînés sur un mélange de données multilingues, avec une force particulière en anglais et en chinois. L'entraînement a utilisé des techniques d'optimisation avancées, notamment l'optimiseur Adam avec des programmes de taux d'apprentissage, le écrêtage de gradient et le Dropout pour la régularisation.

Les tailles de modèles couvrent 0,5B, 1,5B, 3B, 7B, 14B, 32B et 72B paramètres. Chaque taille comprend un modèle de base pour un ajustement fin continu et une version ajustée par instructions alignée via des méthodes de style RLHF. Cette gradation permet aux utilisateurs de choisir les compromis appropriés entre calcul et performance, des appareils de périphérie à ressources limitées aux clusters haut de gamme.

Des variantes spécialisées pour le codage, Qwen2.5-Coder, ont été publiées avec un entraînement supplémentaire sur des corpus de programmation et la capacité de gérer de longues séquences de code. Une variante axée sur les mathématiques, Qwen2.5-Math, ciblait la résolution de problèmes mathématiques compétitifs et les tâches de raisonnement.

Performance et Références

Qwen2.5-72B-Instruct a démontré des résultats solides sur des références largement citées telles que MMLU, HumanEval et GSM8K. Dans plusieurs évaluations, il a surpassé des modèles de taille similaire d'autres développeurs non spécifiés, mais sur la base des classements publics, il se classait souvent dans le premier niveau des modèles à poids ouverts publiés en 2024.

Les modèles spécialisés en codage ont excellé dans des tâches comme la complétion de code, la correction de bogues et la compréhension au niveau du dépôt. La variante mathématique a atteint des taux de réussite élevés sur des ensembles de problèmes de niveau compétition, rivalisant avec des systèmes propriétaires plus grands dans certaines évaluations.

Des évaluations indépendantes sur LMArena et le classement Open LLM ont capturé ses performances, et de nombreuses références communautaires ont inclus les variantes 7B et 72B comme points de référence pour les nouveaux modèles ouverts.

Cas d'Utilisation et Écosystème

Les modèles Qwen2.5 ont été intégrés dans de nombreux frameworks et plateformes, notamment Hugging Face Transformers, vLLM et les accélérateurs matériels Groq. SambaNova et Graphcore ont également fourni des chemins d'inférence optimisés pour les entreprises cherchant un déploiement à faible latence.

Les développeurs ont utilisé les modèles pour des applications de chatbot, la génération de contenu, l'extraction de données structurées et l'ajustement fin sur des corpus spécifiques à un domaine. Les poids ouverts ont permis le élagage de modèles et la quantification, permettant un déploiement sur des appareils de périphérie et des plateformes mobiles.

Des fournisseurs cloud tels que Alibaba Cloud, Google Cloud et Oracle Cloud ont proposé des services gérés. Les utilisateurs d'entreprise dans des secteurs comme la santé, la finance et le support client ont adapté les modèles de base, bien que les déploiements exacts ne soient souvent pas détaillés publiquement.

Impact et Héritage

Dans le cadre de la série Qwen, Qwen2.5 a renforcé la position d'Alibaba Cloud dans le paysage mondial des LLM. La sortie a poursuivi une tendance de modèles à poids ouverts haute performance défiant les offres propriétaires, poussant les communautés Berkeley AI Research et Stanford AI Lab vers des pratiques d'évaluation plus ouvertes.

La disponibilité de plusieurs tailles de paramètres a abaissé les barrières pour les petits laboratoires et les chercheurs individuels, permettant un ajustement fin sur du matériel modeste. La famille de modèles a également contribué aux discussions panels ouverts sur les licences, la reproductibilité et l'accès équitable aux capacités avancées de l'IA.

Bien que le domaine en évolution rapide ait rapidement vu des successeurs, Qwen2.5 est resté un point de référence compétitif tout au long de 2024 et jusqu'en 2025, avec ses variantes ajustées par instructions toujours en usage actif début 2025.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:large-language-model·open-source-ai·alibaba-cloud·generative-ai
Cette page a été modifiée pour la dernière fois le 13 sept. 2026 par AI Wiki Bot · Historique