DeepSeek-V3 est un grand modèle de langage développé par DeepSeek, une entreprise chinoise d'intelligence artificielle basée à Hangzhou, dans le Zhejiang. Publié en décembre 2024, le modèle utilise une architecture de mélange d'experts (MoE) avec 671 milliards de paramètres au total, dont 37 milliards sont activés par jeton. Il a été conçu pour concurrencer les modèles propriétaires de OpenAI, Anthropic et Google DeepMind, tout en étant publié comme un modèle à poids ouverts, ce qui signifie que ses paramètres sont partagés publiquement, bien que les données d'entraînement ne soient pas sous licence ouverte.
Le lancement de DeepSeek-V3 a marqué une étape importante dans le paysage de l'IA générative, démontrant que des modèles performants pouvaient être entraînés efficacement sur du matériel plus ancien, en partie à cause des restrictions américaines sur les exportations de puces avancées vers la Chine. La publication du modèle a été accompagnée de rapports techniques et de poids ouverts, permettant aux chercheurs et aux développeurs de l'utiliser et de l'affiner, contribuant à son adoption rapide dans diverses applications.
Contexte
DeepSeek a été fondé en juillet 2023 par Liang Wenfeng, qui a également cofondé High-Flyer, un fonds spéculatif chinois initialement axé sur le trading piloté par l'IA. Les origines de l'entreprise remontent à l'investissement de High-Flyer dans des clusters de calcul basés sur des GPU, à commencer par Fire-Flyer en 2019, qui contenait 1 100 GPU interconnectés à 200 Gbit/s. En 2021, High-Flyer avait acquis 10 000 GPU Nvidia A100 avant que les restrictions américaines à l'exportation ne prennent effet, permettant la construction de Fire-Flyer 2, un cluster plus grand avec 5 000 GPU A100 PCIe répartis sur 625 nœuds.
La mission de DeepSeek est de faire progresser la recherche sur l'intelligence artificielle générale, avec un accent sur les modèles à poids ouverts. L'entreprise recrute des chercheurs issus des meilleures universités chinoises et embauche dans des domaines non traditionnels, comme la poésie et les mathématiques avancées, pour élargir les capacités des modèles. Cette approche, combinée à une stratégie axée sur la recherche, a permis à DeepSeek d'innover dans l'architecture des modèles et l'efficacité de l'entraînement.
Architecture du modèle
DeepSeek-V3 utilise une architecture de mélange d'experts, une conception qui divise le modèle en plusieurs sous-réseaux spécialisés, ou experts, et n'active qu'un sous-ensemble pour chaque entrée. Cette approche réduit le coût de calcul tout en maintenant une capacité élevée. Le modèle possède 671 milliards de paramètres, mais seulement 37 milliards sont actifs par jeton, ce qui permet une inférence et un entraînement efficaces.
L'architecture intègre des innovations telles que l'attention latente multi-têtes et l'équilibrage de charge sans fonction de perte auxiliaire, qui améliorent la stabilité de l'entraînement et les performances. Ces techniques s'appuient sur des travaux antérieurs sur les modèles transformers et l'attention multi-têtes, permettant à DeepSeek-V3 de gérer efficacement de longs contextes et des tâches de raisonnement complexes.
Entraînement et infrastructure
DeepSeek-V3 a été entraîné sur Fire-Flyer 2, un cluster de calcul co-conçu avec des logiciels et du matériel personnalisés. Le cluster utilise des GPU Nvidia avec des interconnexions de 200 Gbps et une topologie de réseau en arbre gras pour une grande bande passante de bissection. La pile logicielle comprend 3FS, un système de fichiers parallèle distribué optimisé pour les lectures aléatoires asynchrones, et hfreduce, une bibliothèque pour la communication asynchrone.
L'entraînement d'un modèle de cette envergure a nécessité des ressources de calcul importantes. DeepSeek a rapporté que Fire-Flyer 2 avait été utilisé à plus de 96 % de sa capacité en 2022, totalisant 56,74 millions d'heures GPU. La conception du cluster met l'accent sur l'efficacité, utilisant initialement des GPU A100 PCIe car les modèles tenaient dans 40 Go de VRAM, puis intégrant des NVLink et NCCL pour les modèles plus grands nécessitant un parallélisme de modèle.
Le processus d'entraînement a probablement utilisé des techniques telles que des variantes de l'optimiseur Adam, des programmes de taux d'apprentissage et le écrêtage de gradient pour assurer la stabilité. L'accent mis par DeepSeek sur l'efficacité algorithmique lui a permis d'entraîner des modèles compétitifs malgré les contraintes matérielles, une stratégie qui a été notée comme une réponse aux restrictions américaines sur les puces.
Performances et benchmarks
DeepSeek-V3 a démontré des performances compétitives sur divers benchmarks, rivalisant avec les modèles à source fermée de OpenAI et Google DeepMind. Dans les évaluations internes, il a obtenu de bons résultats en compréhension du langage naturel, en génération de code et en raisonnement mathématique. Par exemple, il aurait surpassé des modèles comme GPT-4o sur certaines tâches de codage, bien que la vérification indépendante ait été limitée au lancement.
La nature à poids ouverts du modèle a permis à la communauté de recherche de tester et de valider ses capacités, conduisant à une adoption généralisée dans des contextes académiques et commerciaux. Son efficacité et ses performances l'ont rendu particulièrement attractif pour les organisations disposant de ressources de calcul limitées.
Publication et réception
La publication de DeepSeek-V3 en décembre 2024 a suscité une attention considérable dans la communauté de l'IA. Il a été perçu comme une preuve que les modèles à poids ouverts pouvaient défier les systèmes propriétaires, suscitant des débats sur l'avenir du développement de l'IA. Le modèle a été hébergé par des fournisseurs de cloud tels que Azure et Perplexity AI, le rendant accessible à un large public.
Les critiques ont noté que l'approche à poids ouverts de DeepSeek, bien que transparente sur les paramètres, ne divulguait pas les données d'entraînement, soulevant des questions sur la provenance des données et les biais potentiels. De plus, les liens de l'entreprise avec High-Flyer et les affiliations de ses chercheurs avec des institutions de défense chinoises ont attiré l'attention, bien que DeepSeek ait déclaré que son objectif était la recherche.
Impact et héritage
DeepSeek-V3 a influencé les développements ultérieurs dans le domaine de l'IA, y compris la publication de DeepSeek-R1 en janvier 2025, qui a intégré des capacités de raisonnement. Le modèle a également contribué à la tendance plus large de l'IA efficace, encourageant d'autres entreprises à optimiser pour une consommation de ressources plus faible.
Le lancement a eu des implications géopolitiques, soulignant la capacité des entreprises chinoises à innover malgré les contrôles à l'exportation. Il a également stimulé des discussions sur la démocratisation de l'IA, car les modèles à poids ouverts permettent un accès plus large à une technologie avancée.
Orientations futures
Après DeepSeek-V3, DeepSeek a continué à publier des modèles sous licences open source, élargissant son portefeuille. La stratégie de l'entreprise, axée sur la recherche et l'efficacité, la positionne comme un acteur clé dans le paysage mondial de l'IA. En 2025, Fire-Flyer 2 restait opérationnel, soutenant la recherche et le développement en cours.
L'expansion de DeepSeek en Afrique, offrant des solutions d'IA abordables et économes en énergie, indique son ambition d'atteindre des marchés mal desservis. Les futures publications de l'entreprise devraient s'appuyer sur les innovations introduites avec DeepSeek-V3, influençant potentiellement la prochaine génération de grands modèles de langage.