Traduit de l'anglais

Qwen1.5 est une famille de grands modèles de langage développée par Alibaba Cloud, publiée au début de l'année 2024, disponible en plusieurs tailles de paramètres et variantes, incluant des versions open-source et propriétaires.

Qwen1.5 est une famille de grands modèles de langage développée par Alibaba Cloud, publiée au début de l'année 2024. La famille comprend plusieurs tailles de paramètres allant de 0,5 milliard à 72 milliards de paramètres, avec des variantes de base et ajustées par instructions. Les modèles Qwen1.5 sont conçus pour diverses tâches de traitement du langage naturel, notamment la génération de texte, la traduction et la réponse aux questions, et sont apparus sur des classements publics de LLM et de médias, avec sept variantes capturées dans des instantanés de référence.

Les modèles sont construits sur l'architecture Transformer (architecture), un type de réseau de neurones qui est devenu standard dans le développement des grands modèles de langage. Ils sont entraînés à l'aide de techniques de apprentissage profond, exploitant des ensembles de données à grande échelle et des ressources computationnelles. Qwen1.5 fait partie de la tendance plus large de la IA générative, où les modèles génèrent du texte semblable à celui des humains en fonction de prompts d'entrée.

Variantes et tailles de modèles

Qwen1.5 comprend plusieurs configurations de paramètres : 0,5B, 1,8B, 4B, 7B, 14B, 32B et 72B. Chaque taille est disponible en versions de base (pré-entraînée) et de chat (ajustée par instructions). La variante 72B est la plus grande et démontre généralement des performances supérieures sur des tâches complexes, tandis que les variantes plus petites sont optimisées pour l'efficacité et le déploiement sur des appareils à ressources limitées. Les modèles sont publiés sous une licence open source, permettant aux chercheurs et aux développeurs de les utiliser et de les modifier, avec certaines restrictions pour une utilisation commerciale dans des applications à plus grande échelle.

Entraînement et architecture

Les modèles Qwen1.5 utilisent une architecture transformer standard de type décodeur uniquement, similaire à d'autres LLM modernes. Ils utilisent des mécanismes de attention multi-têtes et de encodage positionnel pour traiter les données séquentielles. L'entraînement implique des techniques d'optimiseur Adam et de planification du taux d'apprentissage, avec un écrêtage de gradient pour stabiliser l'entraînement. Les modèles sont entraînés sur un corpus diversifié de données textuelles, bien que les détails spécifiques sur l'ensemble de données d'entraînement ne soient pas entièrement publics. Les variantes ajustées par instructions sont affinées à l'aide de techniques comme apprentissage par renforcement à partir de retours d'IA et un ajustement supervisé pour s'aligner sur l'intention de l'utilisateur.

Performances et références

Les modèles Qwen1.5 ont été évalués sur divers benchmarks, notamment la compréhension du langage, le raisonnement et les tâches de codage. Ils sont apparus sur des classements publics, tels que le Open LLM Leaderboard, où ils se sont classés de manière compétitive parmi d'autres modèles open source. La variante 72B, en particulier, a montré de fortes performances, souvent comparables à des modèles propriétaires plus grands. Cependant, les scores exacts des benchmarks varient selon la tâche et sont susceptibles de changer à mesure que de nouvelles évaluations sont menées.

Disponibilité et déploiement

Qwen1.5 est disponible via plusieurs canaux. Les versions open source peuvent être téléchargées à partir de référentiels de modèles comme Hugging Face, et elles sont intégrées dans les services d'Alibaba Cloud, y compris l'API DashScope. Les modèles peuvent être déployés sur diverses plateformes, notamment Amazon Web Services, Azure et Google Cloud, ainsi que sur du matériel spécialisé comme AWS Trainium et Groq pour l'accélération de l'inférence. Cette flexibilité rend Qwen1.5 accessible à la fois pour la recherche et l'utilisation en production.

Réception et impact

Qwen1.5 a été bien accueilli dans la communauté de l'IA pour son rapport performance-taille, en particulier les variantes plus petites qui offrent des résultats compétitifs avec des exigences computationnelles plus faibles. Il a contribué à la prolifération des LLM open source, permettant un accès plus large à des capacités avancées d'IA. La famille de modèles a également été utilisée dans la recherche académique et des applications industrielles, renforçant davantage son rôle dans le paysage en évolution de l'intelligence artificielle.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:large-language-models·alibaba·open-source-ai·generative-ai
Cette page a été modifiée pour la dernière fois le 13 sept. 2026 par AI Wiki Bot · Historique