DeepSeek, une entreprise chinoise d'intelligence artificielle basée à Hangzhou, a publié son modèle de langage à poids ouverts DeepSeek-R1 en janvier 2025. Cette publication a déclenché une vente massive significative des actions technologiques mondiales, alors que les investisseurs réévaluaient le paysage concurrentiel du développement de l'IA et la nécessité des dépenses d'investissement massives. L'événement a suscité un large débat dans l'industrie sur l'efficacité de la formation en IA et la viabilité des modèles open-source.
DeepSeek est une filiale de High-Flyer, un fonds spéculatif chinois cofondé par Liang Wenfeng. L'entreprise se concentre sur le développement de modèles à poids ouverts, ce qui signifie que les paramètres du modèle sont partagés publiquement, bien que les données de formation ne soient pas sous licence ouverte. Depuis janvier 2025, DeepSeek a publié ses modèles sous des licences logicielles libres et open-source. L'approche de l'entreprise met l'accent sur la recherche plutôt que sur la commercialisation immédiate, ce qui lui permet de naviguer certaines dispositions réglementaires.
Contexte
DeepSeek a été fondée en juillet 2023, après la création d'un laboratoire de recherche sur l'intelligence artificielle générale (IAG) par High-Flyer en avril 2023. Le laboratoire a été scindé en une entreprise indépendante deux mois plus tard, avec High-Flyer comme investisseur principal. Liang Wenfeng, qui négociait depuis la crise financière de 2008, a cofondé High-Flyer en juin 2015. Le fonds spéculatif a commencé à utiliser des modèles d'apprentissage profond dépendants des GPU pour le trading d'actions en octobre 2016, passant des modèles linéaires basés sur CPU.
Les origines de DeepSeek sont ancrées dans l'infrastructure informatique de High-Flyer. En 2019, l'entreprise a construit son premier cluster informatique, Fire-Flyer, pour un coût de 200 millions de yuans. Le cluster contenait 1 100 GPU interconnectés à 200 Gbit/s et a été retiré après 1,5 an. En 2021, Liang avait commencé à acquérir de grandes quantités de GPU Nvidia, obtenant prétendument 10 000 GPU Nvidia A100 avant que les restrictions américaines sur les ventes de puces à la Chine ne prennent effet.
Fire-Flyer 2
La construction de Fire-Flyer 2 a commencé en 2021 avec un budget de 1 milliard de yuans. En 2022, sa capacité était utilisée à plus de 96 %, totalisant 56,74 millions d'heures GPU. Le cluster comptait 5 000 GPU PCIe A100 dans 625 nœuds, chacun contenant 8 GPU. Initialement, il utilisait PCIe au lieu de la version DGX de l'A100 car les modèles entraînés pouvaient tenir dans une seule mémoire VRAM de 40 Go par GPU, nécessitant uniquement un parallélisme des données. Plus tard, il a intégré des NVLinks et la bibliothèque de communications collectives Nvidia (NCCL) pour entraîner des modèles plus grands nécessitant un parallélisme des modèles.
Fire-Flyer 2 reste en opération en 2025. Il présente une architecture logicielle et matérielle co-conçue. Le matériel utilise des GPU Nvidia avec des interconnexions à 200 Gbps, divisées en deux zones avec deux arbres gras pour une bande passante de bisection élevée. Le logiciel inclut 3FS (Fire-Flyer File System), un système de fichiers parallèle distribué conçu pour des lectures aléatoires asynchrones, utilisant Direct I/O et RDMA Read. Il inclut également hfreduce, une bibliothèque pour la communication asynchrone.
Publication de DeepSeek-R1
DeepSeek-R1 a été lancé en janvier 2025 aux côtés d'un chatbot éponyme. Le modèle a démontré des performances compétitives dans les tâches de raisonnement, rivalisant prétendument avec les principaux modèles d'OpenAI et d'autres entreprises occidentales d'IA. Sa nature à poids ouverts a permis aux développeurs et aux chercheurs d'inspecter et de modifier le modèle, favorisant une adoption et une expérimentation rapides.
La publication a eu des répercussions financières immédiates. Le jour de l'annonce, les principales actions technologiques ont connu des baisses marquées. Nvidia, un fabricant leader de GPU, a vu sa valeur marchande chuter considérablement, alors que les investisseurs se demandaient si la forte demande de puces IA persisterait si les modèles pouvaient être entraînés plus efficacement. D'autres entreprises de la chaîne d'approvisionnement en IA, y compris AMD, TSMC et Broadcom, ont également subi des ventes massives. Le choc du marché a été attribué à la capacité de DeepSeek à atteindre des performances élevées avec des coûts computationnels relativement plus faibles, remettant en question l'hypothèse selon laquelle des investissements massifs en calcul étaient nécessaires pour une IA de pointe.
Impact sur le Marché et Réévaluation de l'Industrie
La publication de DeepSeek-R1 a provoqué une large réévaluation des stratégies d'IA dans toute l'industrie. Les analystes et les dirigeants ont commencé à remettre en question la durabilité des énormes dépenses d'investissement des entreprises comme OpenAI, Anthropic et Google DeepMind. L'événement a mis en évidence le potentiel des modèles open-source à perturber les offres propriétaires, car le modèle de DeepSeek était librement disponible, réduisant les barrières à l'entrée pour les petits acteurs.
En réponse, certaines entreprises ont accéléré leurs propres efforts d'efficacité, se concentrant sur des améliorations algorithmiques et l'optimisation matérielle. L'incident a également intensifié les discussions sur les contrôles à l'exportation américains des puces avancées, car le succès de DeepSeek a démontré que les entreprises chinoises pouvaient obtenir des résultats compétitifs malgré les restrictions. Le choc du marché a été perçu comme un signal d'alarme pour les investisseurs, qui avaient précédemment supposé que le leadership en IA était lié à l'accès au matériel le plus avancé.
Opérations et Stratégie de l'Entreprise
DeepSeek a son siège à Hangzhou, dans le Zhejiang, et est détenue et financée par High-Flyer. Liang Wenfeng est le PDG, détenant une participation de 84 % via deux sociétés écrans en mai 2024. L'entreprise se concentre sur la recherche et a déclaré n'avoir aucun plan immédiat de commercialisation. Cette posture lui permet de contourner certaines dispositions des réglementations chinoises sur l'IA visant les technologies destinées aux consommateurs.
L'approche de recrutement de DeepSeek met l'accent sur les compétences plutôt que sur une longue expérience professionnelle, ce qui donne lieu à de nombreuses embauches fraîchement diplômées de l'université. L'entreprise recrute également des personnes sans formation en informatique pour élargir la gamme d'expertise intégrée dans les modèles, comme la poésie ou les mathématiques avancées. Selon The New York Times, des dizaines de chercheurs de DeepSeek ont ou ont eu des affiliations avec des laboratoires de l'Armée populaire de libération et les Sept Fils de la Défense nationale. Depuis 2025, son chatbot a été adopté dans des rôles non combattants par l'Armée populaire de libération, y compris les hôpitaux, la Police armée populaire et les organisations de mobilisation nationale.
En raison des restrictions américaines sur les puces, DeepSeek a affiné ses algorithmes pour maximiser l'efficacité computationnelle, tirant parti du matériel plus ancien et réduisant la consommation d'énergie. L'entreprise s'est également étendue en Afrique, offrant des solutions d'IA plus abordables et moins énergivores. DeepSeek a renforcé les modèles linguistiques africains et généré des startups, par exemple à Nairobi. Avec les services de stockage et de cloud computing de Huawei, l'impact sur la scène technologique en Afrique subsaharienne est considérable, offrant une souveraineté des données locale et une flexibilité par rapport aux plateformes d'IA occidentales.
Hébergement Cloud et Adoption
En raison de son cadre à poids ouverts, les modèles DeepSeek ont été hébergés nativement par des fournisseurs cloud, y compris Microsoft Azure et Perplexity AI. Cela a facilité un accès large aux modèles, permettant aux développeurs de les intégrer dans diverses applications. L'approche à poids ouverts a également permis un réglage fin et une personnalisation par des tiers, contribuant à l'adoption rapide du modèle.
La publication de DeepSeek-R1 a été comparée à des moments historiques de la technologie où des innovations disruptives ont remodelé les marchés. Elle a souligné le potentiel des entreprises non américaines à mener le développement de l'IA, remettant en question la domination des géants technologiques américains. L'événement a également soulevé des questions sur la viabilité à long terme des modèles d'IA à source fermée, alors que les alternatives open-source continuent de s'améliorer.
Perspectives Futures
Après le choc du marché, DeepSeek a continué à développer et à publier de nouveaux modèles. En février 2026, Anthropic a accusé DeepSeek d'utiliser des milliers de comptes frauduleux pour générer des millions de conversations avec Claude afin d'entraîner ses propres LLM. En avril 2026, les investisseurs ont commencé des discussions avec DeepSeek pour un tour de financement de 300 millions de dollars, ce qui porterait l'entreprise à une valorisation totale de 10 milliards de dollars. DeepSeek a complété un tour de série A en mai 2026 recevant 7 milliards de dollars américains, atteignant une valorisation post-money de 52 milliards de dollars américains. En juillet 2026, Bloomberg et le Financial Times ont rapporté que l'entreprise avait commencé des préparatifs pour une introduction en bourse, potentiellement cotée dès 2027. Le même mois, elle a commencé des discussions visant une valorisation pré-money de 70 milliards de dollars américains.
La publication de DeepSeek-R1 en janvier 2025 reste un événement marquant dans l'histoire de intelligence artificielle, illustrant le rythme rapide de l'innovation et l'interconnexion des marchés technologiques et financiers. L'événement a suscité une conversation mondiale sur l'efficacité de l'IA, le développement open-source et les dimensions géopolitiques de l'avancement de l'IA.