DeepSeek-R1 est un modèle de langage à poids ouverts développé par Hangzhou DeepSeek Artificial Intelligence Basic Technology Research Co., Ltd., une entreprise chinoise d'IA basée à Hangzhou, dans le Zhejiang. Publié le 20 janvier 2025, le modèle a démontré des capacités de raisonnement avancées pour une fraction du coût d'entraînement des modèles occidentaux comparables, provoquant une réaction significative sur le marché. En quelques jours, l'action de Nvidia a chuté fortement, et les valeurs technologiques mondiales ont subi une vente massive alors que les investisseurs réévaluaient le paysage concurrentiel de intelligence artificielle et la demande en unités de traitement graphique (GPU) coûteuses.
La publication de DeepSeek-R1 a été remarquable non seulement pour ses réalisations techniques, mais aussi pour ses implications stratégiques. Le modèle a été mis à disposition sous une licence à poids ouverts, permettant aux chercheurs et aux développeurs d'accéder à ses paramètres, bien que les données d'entraînement n'aient pas été divulguées. Cette ouverture contrastait avec les approches propriétaires des principaux laboratoires d'IA américains et soulignait les progrès rapides des entreprises chinoises d'IA malgré les contrôles à l'exportation des puces avancées par les États-Unis. Cet événement est devenu un jalon dans la course mondiale à l'IA, mettant en évidence à la fois les gains d'efficacité possibles grâce à l'innovation algorithmique et la sensibilité du marché aux changements dans les chaînes d'approvisionnement de l'IA.
Contexte
DeepSeek a été fondée en juillet 2023 par Liang Wenfeng, un passionné d'IA et cofondateur de High-Flyer, un fonds spéculatif chinois. L'entreprise est issue des recherches antérieures de High-Flyer sur l'apprentissage profond pour le trading financier. En 2023, High-Flyer avait construit une infrastructure de calcul substantielle, comprenant des grappes de GPU Nvidia, qui a fourni une base pour le développement des modèles de DeepSeek. La mission de DeepSeek se concentrait sur l'avancement des grands modèles de langage avec un accent sur la recherche plutôt que sur la commercialisation immédiate. L'entreprise a recruté des chercheurs des meilleures universités chinoises et, de manière inhabituelle, de domaines non liés à l'informatique tels que la poésie et les mathématiques avancées, visant à élargir les connaissances et les capacités des modèles.
Les modèles de DeepSeek sont à poids ouverts, ce qui signifie que les paramètres entraînés sont partagés publiquement, mais les données d'entraînement ne sont pas sous licence ouverte. Depuis janvier 2025, DeepSeek a publié ses modèles sous des licences de logiciels libres et open source. Cette approche a facilité l'adoption par des tiers, y compris des fournisseurs de cloud comme Microsoft Azure et Perplexity AI, qui hébergent les modèles DeepSeek nativement. La stratégie de l'entreprise lui a également permis de naviguer dans certaines réglementations chinoises sur l'IA visant les technologies destinées aux consommateurs, car son accent sur la recherche et la distribution ouverte réduisait l'exposition directe aux consommateurs.
Développement et entraînement
L'infrastructure d'entraînement de DeepSeek a évolué à partir des grappes de calcul antérieures de High-Flyer. La première grappe, Fire-Flyer, a été construite en 2019 avec 1 100 GPU interconnectés à 200 Gbit/s, pour un coût de 200 millions de yuans. Elle a été retirée après 1,5 an. Une deuxième grappe, Fire-Flyer 2, a commencé sa construction en 2021 avec un budget de 1 milliard de yuans et comprenait 5 000 GPU A100 PCIe dans 625 nœuds. En 2022, son taux d'utilisation de la capacité dépassait 96 %, totalisant 56,74 millions d'heures GPU, avec 27 % de la capacité soutenant le calcul scientifique externe. La grappe utilisait une architecture logicielle et matérielle co-conçue, y compris le système de fichiers Fire-Flyer (3FS) pour des lectures aléatoires asynchrones efficaces et la bibliothèque hfreduce pour la communication asynchrone.
DeepSeek-R1 a été entraîné en utilisant une combinaison de réglage fin supervisé et d'apprentissage par renforcement, avec un accent sur les tâches de raisonnement. Le modèle employait une architecture Transformer (architecture) et incorporait des techniques telles que attention multi-têtes et réseaux résiduels. Le processus d'entraînement mettait l'accent sur l'efficacité computationnelle, en tirant parti de matériel plus ancien et de raffinements algorithmiques pour réduire la consommation d'énergie et les coûts. Cette efficacité était un facteur clé de l'impact du modèle sur le marché, car elle démontrait que des modèles d'IA performants pouvaient être développés sans accès aux puces les plus récentes et les plus coûteuses.
Publication et caractéristiques techniques
DeepSeek-R1 a été publié le 20 janvier 2025, accompagné d'un chatbot éponyme. Le modèle a montré de fortes performances sur des benchmarks de raisonnement, de mathématiques et de codage, rivalisant ou dépassant certains modèles propriétaires des laboratoires américains. Sa nature à poids ouverts permettait aux chercheurs d'inspecter et d'affiner le modèle, favorisant une communauté de développeurs. La publication comprenait plusieurs versions, avec le modèle phare et des variantes distillées plus petites conçues pour un déploiement plus large.
Un aspect notable de DeepSeek-R1 était sa méthodologie d'entraînement, qui incorporait apprentissage par renforcement à partir de retours d'IA (RLAIF) pour améliorer les chaînes de raisonnement. Le modèle était conçu pour générer des solutions étape par étape, améliorant son interprétabilité et sa précision sur des tâches complexes. De plus, DeepSeek utilisait des techniques comme échantillonnage top-p et réglage de la température pour contrôler la diversité des sorties. L'efficacité du modèle était en partie attribuée à des innovations dans élagage de modèles et augmentation de données, qui réduisaient la charge computationnelle sans sacrifier les performances.
Impact sur le marché
Suite à la publication de DeepSeek-R1, les marchés financiers mondiaux ont connu une réaction significative. Le 27 janvier 2025, le cours de l'action de Nvidia a chuté d'environ 17 %, effaçant des centaines de milliards de dollars de valeur marchande. La vente massive s'est étendue à d'autres entreprises technologiques, y compris AMD, Broadcom et TSMC, alors que les investisseurs craignaient que la demande en GPU haut de gamme ne diminue si les modèles d'IA pouvaient être entraînés plus efficacement. Le secteur technologique plus large, y compris Microsoft (AI) et Alphabet Inc., a également connu des baisses, reflétant des préoccupations concernant les pressions concurrentielles et le potentiel de réduction des dépenses en infrastructure d'IA.
La réaction du marché a été motivée par plusieurs facteurs. Les performances de DeepSeek-R1 suggéraient que des capacités d'IA de pointe pouvaient être atteintes avec moins de ressources computationnelles, sapant l'hypothèse selon laquelle des grappes massives de GPU étaient un prérequis pour une IA avancée. De plus, la disponibilité à poids ouverts du modèle menaçait les avantages propriétaires des entreprises d'IA américaines, potentiellement en commoditisant la technologie de l'IA. Les analystes ont noté que la vente massive était également une réponse aux implications géopolitiques, car une entreprise chinoise démontrait une parité technologique malgré les contrôles à l'exportation des États-Unis.
Réactions de l'industrie
Les leaders de l'industrie et les experts ont offert des réponses variées à DeepSeek-R1. Certains ont loué l'efficacité et l'approche ouverte du modèle, le considérant comme une force de démocratisation dans l'IA. D'autres ont exprimé des préoccupations concernant la sécurité nationale et le potentiel de mauvaise utilisation, étant donné les poids ouverts du modèle. En février 2026, Anthropic a accusé DeepSeek d'utiliser des milliers de comptes frauduleux pour générer des millions de conversations avec Claude, son propre modèle d'IA, afin d'entraîner les LLM de DeepSeek. Cette allégation a mis en évidence les tensions concurrentielles entre les entreprises d'IA américaines et chinoises.
Le succès de DeepSeek a également suscité des discussions sur l'efficacité des contrôles à l'exportation des États-Unis. L'entreprise aurait acquis 10 000 GPU A100 de Nvidia avant que les restrictions ne soient renforcées, et ses progrès continus suggéraient que l'innovation algorithmique pouvait partiellement compenser les limitations matérielles. Certains observateurs ont appelé à une augmentation des investissements dans la recherche nationale en IA, tandis que d'autres préconisaient des politiques d'exportation plus nuancées.
Contexte plus large
La publication de DeepSeek-R1 a eu lieu dans un paysage d'IA en évolution rapide. Les principaux acteurs comme OpenAI, Anthropic et Google DeepMind développaient des modèles de plus en plus capables, mais leur nature propriétaire limitait l'examen externe. L'approche à poids ouverts de DeepSeek offrait une alternative, permettant une vérification et une adaptation indépendantes. Le modèle avait également des implications pour l'accessibilité de l'IA dans les régions en développement, car son efficacité et sa licence ouverte rendaient son déploiement possible sur du matériel moins puissant.
L'expansion de DeepSeek en Afrique, offrant des solutions d'IA abordables et économes en énergie, faisait partie de cette tendance plus large. L'entreprise collaborait avec des startups locales et des fournisseurs de cloud, tels que Huawei, pour améliorer les modèles de langage africains et soutenir la souveraineté des données locales. Cela contrastait avec les plateformes d'IA occidentales, qui exigeaient souvent une infrastructure substantielle et soulevaient des préoccupations en matière de confidentialité des données.
Conséquences
Dans les mois suivant la publication, DeepSeek a continué à développer sa technologie et à étendre sa présence. L'entreprise a annoncé des plans pour un tour de financement de série A en mai 2026, levant 7 milliards de dollars américains à une valorisation post-money de 52 milliards de dollars américains. Des rapports sur une introduction en bourse potentielle dès 2027 ont émergé en juillet 2026, avec des discussions visant une valorisation pré-money de 70 milliards de dollars américains. Ces développements signalaient la confiance des investisseurs dans la trajectoire de DeepSeek, malgré la turbulence antérieure du marché.
La chute de l'action de Nvidia et la vente massive des valeurs technologiques sont devenues une étude de cas sur la manière dont les percées en IA peuvent perturber les marchés financiers. Cela a souligné l'importance de surveiller les avancées technologiques et leur potentiel à remodeler la dynamique de l'industrie. Pour DeepSeek, l'événement a solidifié sa réputation en tant qu'acteur majeur dans la course mondiale à l'IA, défiant la domination des géants technologiques américains et provoquant une réévaluation des stratégies d'investissement en IA dans le monde entier.