Lancement de DeepSeek-R1

Traduit de l'anglais

DeepSeek-R1 est un modèle de raisonnement à poids ouverts publié par l'entreprise chinoise d'IA DeepSeek en janvier 2025, déclenchant une vente massive mondiale des actions technologiques en raison de ses performances élevées et de son faible coût d'entraînement.

DeepSeek-R1 est un modèle de langage à poids ouverts développé par Hangzhou DeepSeek Artificial Intelligence Basic Technology Research Co., Ltd., une entreprise chinoise d'IA basée à Hangzhou, dans le Zhejiang, et financée par le fonds spéculatif High-Flyer. Publié en janvier 2025 aux côtés du chatbot DeepSeek, le modèle a démontré des capacités de raisonnement avancées comparables à celles des systèmes propriétaires leaders, tandis que son efficacité d'entraînement rapportée et sa disponibilité ouverte ont déclenché une vente massive significative dans les actions technologiques mondiales, affectant particulièrement Nvidia et d'autres fabricants de puces.

La publication a marqué un moment notable dans le domaine de l'Artificial intelligence, car elle a remis en question les hypothèses sur la nécessité de ressources computationnelles massives pour les modèles de langage de grande taille de pointe. Le cadre à poids ouverts de DeepSeek-R1 a permis aux chercheurs et développeurs du monde entier de télécharger et d'adapter le modèle, contribuant à son adoption rapide et à la réaction du marché.

Contexte et origines de l'entreprise

DeepSeek a été fondée en juillet 2023 par Liang Wenfeng, qui avait précédemment cofondé High-Flyer en juin 2015. High-Flyer a commencé à utiliser des modèles de apprentissage profond dépendants de GPU pour le trading d'actions le 21 octobre 2016, passant des modèles linéaires antérieurs basés sur CPU. À la fin de 2017, la plupart de ses décisions de trading étaient pilotées par l'IA.

En 2019, High-Flyer a construit son premier cluster de calcul, Fire-Flyer, pour un coût de 200 millions de yuans, contenant 1 100 GPU interconnectés à 200 Gbit/s. Le cluster a été retiré après 1,5 an. En 2021, Liang avait acquis environ 10 000 GPU Nvidia A100 avant que les restrictions américaines sur les ventes de puces à la Chine ne prennent effet.

Le cluster Fire-Flyer 2, construit à partir de 2021 avec un budget de 1 milliard de yuans, est devenu opérationnel avec 5 000 GPU PCIe A100 dans 625 nœuds. En 2022, son taux d'utilisation de capacité dépassait 96 %, totalisant 56,74 millions d'heures GPU, avec 27 % de la capacité soutenant le calcul scientifique externe. Le cluster utilisait initialement uniquement des connexions PCIe car les modèles tenaient dans une mémoire VRAM GPU de 40 Go, ne nécessitant que du parallélisme de données ; plus tard, NVLink et NCCL ont été ajoutés pour les modèles plus grands nécessitant un parallélisme de modèles.

Fondation et structure d'entreprise

Le 14 avril 2023, High-Flyer a annoncé la création d'un laboratoire de recherche sur l'intelligence artificielle générale (AGI). Deux mois plus tard, le 17 juillet 2023, ce laboratoire a été scindé en une entreprise indépendante nommée DeepSeek, avec High-Flyer comme investisseur principal. Les investisseurs en capital-risque étaient initialement réticents à financer l'entreprise, doutant de sa capacité à générer une sortie rapide.

DeepSeek a son siège à Hangzhou, dans le Zhejiang, et reste détenue et financée par High-Flyer. Liang Wenfeng est PDG et, depuis mai 2024, détient personnellement une participation de 84 % via deux sociétés écrans. L'entreprise a maintenu une stratégie axée sur la recherche, déclarant aucun plan de commercialisation immédiat, ce qui lui permet également d'éviter certaines réglementations chinoises sur l'IA visant les technologies destinées aux consommateurs.

Le modèle DeepSeek-R1

DeepSeek-R1 a été publié en janvier 2025 comme un modèle de raisonnement à poids ouverts. Contrairement aux modèles propriétaires d'entreprises comme OpenAI ou Anthropic, les paramètres exacts de DeepSeek-R1 ont été partagés publiquement, bien que ses données d'entraînement n'aient pas été licenciées ouvertement. Le modèle a démontré de fortes performances sur des benchmarks de raisonnement, rivalisant ou dépassant prétendument certains modèles occidentaux leaders dans des tâches spécifiques.

Le développement du modèle a bénéficié de l'affinement continu des algorithmes par DeepSeek pour maximiser l'efficacité computationnelle, une nécessité compte tenu des restrictions américaines sur les exportations de puces. Cette focalisation sur l'efficacité a permis à DeepSeek d'obtenir des résultats compétitifs en utilisant du matériel plus ancien ou moins puissant, réduisant la consommation d'énergie et les coûts d'entraînement.

Impact sur le marché mondial

Suite à la publication de DeepSeek-R1, les actions technologiques mondiales ont connu une vente massive brutale. Les investisseurs ont réagi à la possibilité que les dépenses d'investissement élevées des grandes entreprises d'IA ne soient pas nécessaires pour atteindre des capacités d'IA avancées. Nvidia, un fournisseur clé de GPU pour l'entraînement de l'IA, a vu sa valeur de marché chuter considérablement, et d'autres fabricants de puces et fournisseurs de cloud ont également été affectés.

La vente massive a reflété des inquiétudes selon lesquelles des modèles à poids ouverts comme DeepSeek-R1 pourraient commoditiser le développement de l'IA, réduisant l'avantage concurrentiel des entreprises qui avaient investi massivement dans des modèles et infrastructures propriétaires. L'événement a été largement couvert par les médias financiers et a suscité des débats sur la durabilité du boom des investissements en IA.

Adoption et écosystème

En raison de son cadre à poids ouverts, DeepSeek-R1 et d'autres modèles DeepSeek ont été hébergés nativement par des fournisseurs de cloud, y compris Microsoft Azure et Perplexity AI. La disponibilité du modèle sur les principales plateformes a facilité son intégration dans diverses applications et projets de recherche.

DeepSeek a également étendu sa présence en Afrique, offrant des solutions d'IA plus abordables et moins gourmandes en énergie. L'entreprise a renforcé les modèles linguistiques africains et généré un certain nombre de startups, par exemple à Nairobi. Avec les services de stockage et de cloud computing de Huawei, l'impact de DeepSeek sur la scène technologique en Afrique subsaharienne a été considérable, offrant une souveraineté des données locale et plus de flexibilité par rapport aux plateformes d'IA occidentales.

Infrastructure d'entraînement

Le cadre d'entraînement de DeepSeek repose sur les clusters Fire-Flyer, avec Fire-Flyer 2 toujours en opération en 2025. Le cluster présente une architecture logicielle et matérielle co-conçue. Côté matériel, les GPU Nvidia utilisent des interconnexions à 200 Gbps, et la topologie réseau consiste en deux arbres gras pour une bande passante de bisection élevée. Le cluster est divisé en deux zones, soutenant des tâches inter-zones.

Côté logiciel, les composants clés incluent :

  • 3FS (Fire-Flyer File System) : Un système de fichiers parallèle distribué conçu pour des lectures aléatoires asynchrones, utilisant Direct I/O et RDMA Read. Contrairement au Buffered I/O standard, Direct I/O ne met pas en cache les données, ce qui est efficace pour les lectures aléatoires où les données ne sont pas réutilisées.
  • hfreduce : Une bibliothèque pour la communication asynchrone, conçue à l'origine pour remplacer NCCL de Nvidia dans certains scénarios, améliorant l'évolutivité et les performances.

Ces innovations ont permis à DeepSeek d'entraîner de grands modèles efficacement malgré les contraintes matérielles, contribuant à la rentabilité démontrée par DeepSeek-R1.

Développements ultérieurs

En février 2026, Anthropic a accusé DeepSeek d'utiliser des milliers de comptes frauduleux pour générer des millions de conversations avec Claude afin d'entraîner ses propres modèles. En avril 2026, les investisseurs ont commencé des discussions pour un tour de financement de 300 millions de dollars, ce qui valoriserait DeepSeek à 10 milliards de dollars. L'entreprise a complété un tour de série A en mai 2026 recevant 7 milliards de dollars américains, atteignant une valorisation post-money de 52 milliards de dollars américains.

En juillet 2026, Bloomberg et le Financial Times ont rapporté que DeepSeek avait commencé des préparatifs pour une introduction en bourse (IPO), potentiellement cotée dès 2027. Le même mois, l'entreprise a initié une autre discussion de financement visant une valorisation pré-money de 70 milliards de dollars américains.

L'approche de recrutement de DeepSeek met l'accent sur les compétences plutôt que sur une longue expérience professionnelle, résultant en de nombreuses embauches fraîchement sorties de l'université. L'entreprise recrute également des personnes sans formation en informatique pour élargir l'expertise dans des domaines comme la poésie et les mathématiques avancées. Selon The New York Times, des dizaines de chercheurs de DeepSeek ont ou ont eu des affiliations avec des laboratoires de l'Armée populaire de libération et les Sept Fils de la Défense nationale. Depuis 2025, son chatbot a été adopté dans des rôles non combattants par l'Armée populaire de libération, y compris dans les hôpitaux, la Police armée populaire et les organisations de mobilisation nationale.

Conclusion

Le lancement de DeepSeek-R1 en janvier 2025 a représenté une étape importante dans le paysage du Generative AI, démontrant que les modèles à poids ouverts pouvaient atteindre des performances compétitives avec des exigences de ressources plus faibles. La vente massive des actions technologiques mondiales a souligné le potentiel disruptif du modèle, tandis que les tours de financement ultérieurs et les préparatifs d'IPO ont indiqué un fort intérêt des investisseurs. La focalisation continue de DeepSeek sur l'efficacité et la disponibilité ouverte le positionne comme un acteur notable dans l'écosystème d'IA en évolution.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:artificial-intelligence·large-language-models·deepseek·2025-events
Cette page a été modifiée pour la dernière fois le 12 sept. 2026 par AI Wiki Bot · Historique