En janvier 2025, DeepSeek, une entreprise chinoise d'intelligence artificielle basée à Hangzhou, a publié son modèle de raisonnement à poids ouverts, DeepSeek-R1. Cette publication a déclenché une vente massive mondiale d'actions, affectant particulièrement les valeurs technologiques, et a suscité une réévaluation généralisée du paysage concurrentiel de l'industrie de l'IA et des hypothèses d'investissement. L'événement a mis en lumière les progrès rapides des laboratoires d'IA chinois et le potentiel de développement de modèles plus efficaces et moins coûteux.
DeepSeek, fondée en juillet 2023 par Liang Wenfeng, est détenue et financée par High-Flyer, un fonds spéculatif chinois. L'entreprise se concentre sur le développement de grands modèles de langage (LLM) à poids ouverts, partageant publiquement les paramètres des modèles tout en gardant les données d'entraînement propriétaires. DeepSeek-R1, lancé en parallèle d'un chatbot éponyme, a démontré des capacités de raisonnement avancées comparables aux principaux modèles occidentaux, mais pour une fraction du coût d'entraînement rapporté. Cette réalisation a remis en question les notions dominantes selon lesquelles l'IA de pointe nécessitait des ressources informatiques massives et des dépenses en capital énormes.
Impact sur le marché
Le 27 janvier 2025, la publication de DeepSeek-R1 a provoqué une forte baisse des valeurs technologiques mondiales. Nvidia, un fabricant leader de GPU, a vu son cours chuter d'environ 17 %, effaçant environ 589 milliards de dollars de valeur marchande, la plus grande perte en une seule journée pour une entreprise dans l'histoire du marché boursier américain. D'autres fabricants de puces et entreprises liées à l'IA, notamment AMD, Broadcom et TSMC, ont également subi des baisses significatives. La vente s'est étendue aux marchés européens et asiatiques, avec des indices tels que le Nikkei 225 et le Nasdaq Composite, axé sur la technologie, enregistrant des baisses notables.
La réaction du marché a été motivée par les inquiétudes des investisseurs selon lesquelles les méthodes d'entraînement efficaces de DeepSeek pourraient réduire la demande de matériel d'IA coûteux, en particulier les GPU haut de gamme. DeepSeek aurait entraîné R1 en utilisant environ 2 048 GPU Nvidia H800 sur deux mois, pour un coût d'environ 5,6 millions de dollars, une fraction des centaines de millions dépensés par des laboratoires occidentaux comme OpenAI et Google DeepMind. Cela a soulevé des questions sur la durabilité des dépenses en capital massives des principaux fournisseurs de cloud et entreprises d'IA.
Réévaluation de l'industrie
La publication a incité à une réévaluation des stratégies de développement de l'IA dans toute l'industrie. Des dirigeants de grandes entreprises technologiques, notamment Microsoft et Alphabet, ont publiquement reconnu les réalisations de DeepSeek et les implications pour l'efficacité de l'IA. Certains analystes ont suggéré que l'événement pourrait accélérer l'adoption de modèles à poids ouverts et stimuler l'innovation dans l'optimisation des modèles plutôt que dans l'augmentation brute du calcul.
Le succès de DeepSeek a été attribué à plusieurs innovations techniques, notamment l'utilisation de apprentissage par renforcement (RL) pour améliorer les capacités de raisonnement, et la mise en œuvre d'architectures mixture-of-experts (MoE) qui n'activent qu'un sous-ensemble de paramètres par jeton, réduisant la charge de calcul. L'entreprise a également affiné ses algorithmes d'entraînement pour maximiser l'efficacité sur du matériel plus ancien, en partie en raison des restrictions d'exportation américaines sur les puces avancées vers la Chine.
Contexte de DeepSeek
DeepSeek a été établie comme entreprise indépendante le 17 juillet 2023, issue du laboratoire de recherche sur l'intelligence artificielle générale (AGI) de High-Flyer, annoncé le 14 avril 2023. High-Flyer, cofondée par Liang Wenfeng en juin 2015, utilisait l'apprentissage profond basé sur GPU pour le trading d'actions depuis le 21 octobre 2016. L'entreprise a construit son premier cluster de calcul, Fire-Flyer, en 2019, puis a construit Fire-Flyer 2, un cluster plus grand avec 5 000 GPU Nvidia A100, achevé en 2021.
La stratégie de recrutement de DeepSeek met l'accent sur les compétences plutôt que sur l'expérience, recrutant de nombreux jeunes diplômés et des personnes issues de domaines non informatiques pour élargir les connaissances des modèles. L'entreprise a déclaré se concentrer sur la recherche et n'avoir aucun plan de commercialisation immédiat, ce qui lui permet de bénéficier de certaines exemptions réglementaires en Chine.
Innovations techniques
DeepSeek-R1 est un modèle de raisonnement qui utilise un pipeline d'entraînement en plusieurs étapes. Il emploie apprentissage par renforcement pour améliorer le raisonnement en chaîne de pensée, et utilise un ajustement supervisé (SFT) avec des données organisées. L'architecture du modèle intègre des couches attention multi-têtes et mixture-of-experts, permettant une mise à l'échelle efficace. DeepSeek a également introduit une approche novatrice du RL qui évite le besoin d'un modèle de récompense séparé, utilisant des récompenses basées sur des règles pour les tâches avec des réponses vérifiables.
L'infrastructure d'entraînement, connue sous le nom de Fire-Flyer 2, consiste en une architecture logicielle et matérielle co-conçue. Elle utilise des GPU Nvidia avec des interconnexions de 200 Gbps et une topologie réseau de deux arbres en éventail pour une bande passante de bisection élevée. La pile logicielle comprend 3FS (Fire-Flyer File System), un système de fichiers parallèle distribué optimisé pour les lectures aléatoires asynchrones, et hfreduce, une bibliothèque pour la communication asynchrone.
Paysage concurrentiel
La publication de DeepSeek-R1 a intensifié la concurrence dans l'industrie de l'IA, en particulier entre les entreprises américaines et chinoises. Elle a démontré que les laboratoires chinois pouvaient obtenir des résultats de pointe malgré les restrictions matérielles. L'approche à poids ouverts de DeepSeek contraste avec les modèles fermés de OpenAI et Anthropic, et a été adoptée par certains développeurs occidentaux pour sa transparence et sa personnalisation.
Les principaux fournisseurs de cloud, notamment microsoft-azure et Perplexity AI, ont commencé à héberger nativement les modèles DeepSeek, les intégrant davantage dans l'écosystème mondial de l'IA. L'événement a également suscité des discussions sur la sécurité de l'IA et les contrôles à l'exportation, certains décideurs politiques appelant à des réglementations plus strictes sur les modèles à poids ouverts.
Implications à long terme
Le choc du marché a servi de signal d'alarme pour les investisseurs et les entreprises technologiques, mettant en évidence le potentiel d'innovation disruptive provenant de sources inattendues. Il a souligné l'importance de l'efficacité algorithmique et la possibilité d'atteindre des performances élevées avec moins de ressources. Au début de 2025, les effets à long terme sur la demande de matériel d'IA et la structure de l'industrie restaient incertains, mais l'événement a marqué un tournant dans la course mondiale à l'IA.
L'ascension de DeepSeek a également soulevé des questions géopolitiques, car les chercheurs de l'entreprise ont des affiliations avec des laboratoires militaires chinois, et son chatbot a été adopté par l'Armée populaire de libération pour des rôles non combattants depuis mars 2025. Ces développements ont ajouté une couche de complexité au paysage international de l'IA.
Conclusion
La publication de DeepSeek-R1 et le choc de marché qui a suivi ont représenté un moment charnière dans l'histoire de l'intelligence artificielle. Cela a démontré que les modèles à poids ouverts pouvaient rivaliser avec les systèmes propriétaires, a remis en question les hypothèses sur la nécessité d'un calcul massif et a remodelé les attentes des investisseurs. L'événement a accéléré les discussions sur l'efficacité de l'IA, la collaboration open-source et l'équilibre mondial du pouvoir en IA, avec des implications qui ont continué à se dérouler tout au long de 2025.