DeepSeek-V2 est un grand modèle de langage publié par l'entreprise chinoise d'intelligence artificielle DeepSeek en mai 2024. Il utilise une architecture de Mixture-of-Experts (MoE), qui n'active qu'un sous-ensemble de ses paramètres pour chaque entrée, permettant un calcul efficace et des coûts de formation réduits. Le modèle a été positionné comme une alternative haute performance aux modèles contemporains des développeurs occidentaux, avec un coût de formation rapporté nettement inférieur à celui de systèmes comparables.
La publication de DeepSeek-V2 a eu lieu pendant une période de progrès rapide dans les grands modèles de langage, lorsque des développeurs tels que OpenAI, Anthropic et Google DeepMind publiaient également de nouveaux systèmes. L'approche de DeepSeek se distinguait par son accent sur les poids ouverts et l'efficacité des coûts, s'alignant sur la stratégie plus large de l'entreprise visant à maximiser l'efficacité algorithmique sous contraintes matérielles.
Architecture et conception
DeepSeek-V2 est construit sur une architecture Transformer, le cadre dominant pour les systèmes modernes de IA générative. Sa caractéristique définissante est la conception Mixture-of-Experts, qui divise les paramètres du modèle en plusieurs modules experts. Pendant l'inférence, un mécanisme de sélection n'active qu'un petit nombre d'experts pour chaque jeton, réduisant la charge de calcul tout en maintenant un nombre total de paramètres élevé.
Le modèle intègre des innovations dans l'attention multi-têtes et l'encodage positionnel pour améliorer l'efficacité. Plus précisément, DeepSeek-V2 a introduit un mécanisme d'attention novateur qui réduit l'empreinte mémoire des caches de clés-valeurs, un goulot d'étranglement courant dans les tâches à contexte long. Ce choix de conception permet au modèle de gérer des séquences plus longues sans augmenter proportionnellement les exigences matérielles.
Comparé à des modèles denses de taille de paramètres similaire, DeepSeek-V2 nécessite moins d'opérations en virgule flottante par jeton pendant la formation et l'inférence. L'entreprise a rapporté que le modèle atteignait des performances compétitives avec les systèmes leaders tout en utilisant considérablement moins de calcul, un résultat attribué à l'architecture MoE et à une ingénierie soignée du pipeline de formation.
Formation et coût
DeepSeek-V2 a été formé sur le cluster de calcul Fire-Flyer 2, un système sur mesure exploité par la société mère de DeepSeek, High-Flyer. Le cluster se compose de milliers de GPU Nvidia interconnectés à haute bande passante, avec une pile logicielle co-conçue comprenant le système de fichiers distribué 3FS et des bibliothèques de communication personnalisées. Cette infrastructure a été développée pour maximiser l'efficacité sur le matériel disponible, notamment en raison des restrictions d'exportation des États-Unis sur les puces avancées vers la Chine.
La session de formation pour DeepSeek-V2 a utilisé un ensemble de données de billions de jetons provenant de sources web publiques, de livres et d'autres corpus textuels. L'entreprise n'a pas divulgué la composition exacte de l'ensemble de données, conformément à sa pratique de garder les données de formation propriétaires même en publiant les poids du modèle. Le coût de formation rapporté était d'environ 5,6 millions de dollars, un chiffre qui a attiré l'attention pour être un ordre de grandeur inférieur aux estimations pour des modèles comparables des laboratoires occidentaux.
Cette efficacité des coûts a été obtenue grâce à une combinaison d'améliorations algorithmiques, d'optimisation matérielle et des exigences de calcul réduites de l'architecture MoE. Les ingénieurs de DeepSeek ont également employé des techniques telles que le clipping de gradient et la planification du taux d'apprentissage pour stabiliser la formation et améliorer la convergence.
Performance et benchmarks
DeepSeek-V2 a été évalué sur une gamme de benchmarks standard pour les tâches de traitement du langage naturel, y compris la compréhension du langage, le raisonnement et la génération de code. Sur plusieurs tests largement utilisés, tels que MMLU (Massive Multitask Language Understanding) et HumanEval, le modèle a obtenu des scores comparables ou supérieurs à ceux des modèles à poids ouverts contemporains d'autres développeurs.
La performance du modèle était particulièrement notable dans le raisonnement mathématique et les tâches en chinois, reflétant la composition de ses données de formation et l'accent mis par l'entreprise sur le service aux utilisateurs nationaux et internationaux. Dans des comparaisons côte à côte, DeepSeek-V2 a surpassé plusieurs modèles denses plus grands, démontrant que l'approche MoE pouvait offrir des résultats solides avec moins de paramètres actifs.
Les évaluations indépendantes par des chercheurs tiers ont généralement confirmé les affirmations de l'entreprise, bien que certains aient noté que la performance du modèle sur certains benchmarks variait selon la configuration exacte de l'évaluation. La publication comprenait également des variantes plus petites du modèle, permettant un déploiement sur du matériel moins puissant tout en conservant une grande partie de la capacité du modèle complet.
Publication et réception
La publication publique de DeepSeek-V2 en mai 2024 comprenait à la fois les poids du modèle et la documentation technique décrivant son architecture et sa méthodologie de formation. Cette approche à poids ouverts le distinguait des modèles propriétaires offerts via un accès API uniquement, permettant aux chercheurs et développeurs de télécharger, affiner et déployer le modèle sur leur propre infrastructure.
La réception dans la communauté du apprentissage automatique a été largement positive, beaucoup saluant les innovations techniques et la transparence de la publication. Le faible coût de formation est devenu un point central de discussion, suscitant des questions sur la possibilité d'atteindre des gains d'efficacité similaires par d'autres développeurs. Certains commentateurs ont interprété la publication comme une preuve que le développement avancé de l'IA n'était plus le domaine exclusif des entreprises occidentales bien financées.
Cependant, la publication a également soulevé des préoccupations concernant un potentiel de mauvaise utilisation, étant donné les poids ouverts et l'absence de filtres de sécurité intégrés par rapport à certaines offres commerciales. Les liens de DeepSeek avec la Chine et les affiliations militaires antérieures de certains chercheurs ont été notés dans la couverture, bien que l'entreprise elle-même ait souligné son accent sur la recherche plutôt que sur des applications militaires.
Comparaison avec les modèles contemporains
Au moment de sa publication, DeepSeek-V2 était fréquemment comparé à des modèles tels que Llama 3 de Meta et Mixtral de Mistral, qui utilisaient également des approches à poids ouverts ou open source. En termes de scores bruts de benchmark, DeepSeek-V2 était compétitif avec ces systèmes, tandis que son coût de formation était nettement inférieur aux chiffres publiquement rapportés pour des modèles comparables.
Le modèle a également fait l'objet de comparaisons avec des systèmes propriétaires de OpenAI et Anthropic, bien que les comparaisons directes aient été compliquées par des différences dans la méthodologie d'évaluation et la nature fermée de ces systèmes. La décision de DeepSeek de publier des rapports techniques détaillés a permis une analyse plus approfondie que ce qui était possible avec des modèles API uniquement.
Une différence notable était la performance de DeepSeek-V2 sur les tâches en chinois, où il surpassait souvent les modèles formés principalement sur des données anglaises. Cela le rendait particulièrement attractif pour les applications dans les marchés de langue chinoise, y compris les cas d'utilisation en entreprise dans la finance, l'éducation et le gouvernement.
Impact et héritage
DeepSeek-V2 a établi l'entreprise comme un acteur significatif dans le paysage mondial de l'IA, démontrant que des techniques de formation efficaces pouvaient produire des résultats de pointe. Le succès du modèle a influencé les développements ultérieurs dans le domaine, y compris un intérêt accru pour les architectures Mixture-of-Experts et les méthodes de formation conscientes des coûts.
La publication a également eu des implications géopolitiques, mettant en évidence la capacité des entreprises chinoises à développer des systèmes d'IA avancés malgré les contrôles à l'exportation sur le matériel haut de gamme. L'accent mis par DeepSeek sur l'efficacité algorithmique, né en partie de la nécessité, est devenu un modèle pour d'autres développeurs confrontés à des contraintes similaires.
Dans les mois suivant la publication, DeepSeek a continué à itérer sur sa technologie, publiant finalement des modèles successeurs avec des améliorations supplémentaires. Les principes établis avec DeepSeek-V2 - poids ouverts, efficacité des coûts et innovation architecturale - sont restés centraux dans l'approche de l'entreprise lors des publications ultérieures.
Spécifications techniques
Le nombre total de paramètres de DeepSeek-V2 a été rapporté à 236 milliards, avec seulement 21 milliards de paramètres actifs par jeton en raison de l'architecture MoE. Le modèle utilisait une fenêtre de contexte de 128 000 jetons, rendue possible par le mécanisme d'attention efficace qui réduisait l'utilisation de la mémoire. La formation a été menée en utilisant une précision mixte, combinant les formats BF16 et FP32 pour équilibrer précision et vitesse.
Le tokenizer du modèle a été formé sur un corpus multilingue, avec une attention particulière aux textes chinois et anglais. La publication comprenait des poids dans plusieurs formats, compatibles avec des frameworks d'inférence populaires tels que vLLM et TensorRT. Des versions plus petites du modèle, avec moins de paramètres totaux, ont également été mises à disposition pour un déploiement sur du matériel moins puissant.
L'architecture de DeepSeek-V2 a servi de fondation pour les modèles ultérieurs de la gamme de l'entreprise, avec des publications ultérieures s'appuyant sur ses innovations tout en incorporant des techniques supplémentaires telles que l'apprentissage par renforcement à partir de feedback humain. Le modèle reste disponible au téléchargement, et sa documentation technique continue d'être citée dans la recherche académique sur la formation efficace de modèles de langage.