DeepSeek-R1 est un modèle de langage à poids ouverts développé par DeepSeek, une entreprise chinoise d'intelligence artificielle basée à Hangzhou, dans le Zhejiang. Publié en janvier 2025 aux côtés du chatbot éponyme de l'entreprise, DeepSeek-R1 a attiré l'attention internationale pour ses capacités avancées de raisonnement et pour avoir ébranlé les marchés financiers mondiaux, car son développement à faible coût a remis en question les hypothèses sur la domination des entreprises occidentales d'IA. Le modèle fait partie de la stratégie plus large de DeepSeek consistant à publier des modèles à poids ouverts sous des licences de logiciels libres et open source, rendant ses paramètres publics tout en gardant les données d'entraînement propriétaires.
DeepSeek a été fondée en juillet 2023 par Liang Wenfeng, qui a également cofondé le fonds spéculatif High-Flyer, qui possède et finance l'entreprise. La publication de DeepSeek-R1 en janvier 2025 a marqué une étape importante dans l'histoire de l'entreprise, la positionnant comme un acteur majeur du paysage mondial de l'IA. Les performances du modèle, combinées à ses méthodes d'entraînement efficaces, ont suscité des débats sur l'avenir du développement de l'IA, en particulier concernant le rôle des modèles open source et l'impact des restrictions américaines sur les exportations de puces sur l'innovation chinoise en matière d'IA.
Contexte
DeepSeek trouve ses origines chez High-Flyer, un fonds spéculatif chinois cofondé par Liang Wenfeng en juin 2015. Liang, qui négociait depuis la crise financière de 2008 tout en étudiant à l'Université du Zhejiang, a commencé à utiliser des modèles d'apprentissage profond dépendant des GPU pour le trading d'actions le 21 octobre 2016, remplaçant les modèles linéaires basés sur CPU utilisés auparavant. À la fin de 2017, la plupart des transactions de High-Flyer étaient pilotées par l'IA.
En 2019, High-Flyer a construit son premier cluster de calcul, Fire-Flyer, pour un coût de 200 millions de yuans. Le cluster contenait 1 100 GPU interconnectés à 200 Gbit/s et a été retiré après 1,5 an de fonctionnement. En 2021, Liang avait commencé à acheter de grandes quantités de GPU Nvidia pour un projet d'IA, obtenant apparemment 10 000 GPU Nvidia A100 avant que les États-Unis ne restreignent les ventes de puces à la Chine.
La construction de Fire-Flyer 2 a commencé en 2021 avec un budget de 1 milliard de yuans. En 2022, la capacité de Fire-Flyer 2 a été utilisée à plus de 96 %, totalisant 56,74 millions d'heures GPU, avec 27 % de sa capacité soutenant le calcul scientifique en dehors de l'entreprise. Le cluster disposait de 5 000 GPU PCIe A100 répartis sur 625 nœuds, chacun contenant 8 GPU, et a ensuite intégré des NVLinks et la bibliothèque de communications collectives Nvidia (NCCL) pour entraîner des modèles plus grands nécessitant un parallélisme de modèles.
Fondation et Développement Initial
Le 14 avril 2023, High-Flyer a annoncé le lancement d'un laboratoire de recherche sur l'intelligence artificielle généérale (AGI), déclarant que le nouveau laboratoire se concentrerait sur le développement d'outils d'IA sans lien avec l'activité financière de l'entreprise. Deux mois plus tard, le 17 juillet 2023, ce laboratoire a été scindé en une entreprise indépendante nommée DeepSeek, avec High-Flyer comme investisseur principal et soutien. Initialement, les investisseurs en capital-risque étaient réticents à fournir des fonds, car ils considéraient qu'il était peu probable que l'entreprise puisse rapidement générer une sortie.
DeepSeek a son siège à Hangzhou, dans le Zhejiang, et est possédée et financée par High-Flyer. Son cofondateur, Liang Wenfeng, en est le PDG. En mai 2024, Liang détenait personnellement une participation de 84 % dans DeepSeek par l'intermédiaire de deux sociétés écrans. La stratégie de l'entreprise met l'accent sur la recherche plutôt que sur la commercialisation immédiate, ce qui lui permet de contourner certaines dispositions des réglementations chinoises sur l'IA visant les technologies destinées aux consommateurs.
Publication de DeepSeek-R1
DeepSeek-R1 a été publié en janvier 2025, aux côtés du lancement du chatbot éponyme de l'entreprise. La publication du modèèle a généré une couverture médiatique significative et des réactions du marché, car ses performances rivalisaient avec celles des modèles occidentaux de premier plan tels que ceux de OpenAI et Anthropic, tout en étant apparemment entraîné à une fraction du coût. La publication a été perçue comme une démonstration des capacités croissantes de la Chine en matière de intelligence artificielle et un défi à l'hypothèse selon laquelle le développement avancé de l'IA nécessitait des ressources informatiques massives.
La nature à poids ouverts du modèle signifiait que ses paramètres étaient partagés publiquement, permettant aux chercheurs et développeurs du monde entier de le télécharger et de l'affiner. Cela contrastait avec les approches propriétaires de nombreuses entreprises occidentales d'IA, qui gardaient les poids de leurs modèles confidentiels. La publication de DeepSeek-R1 a également mis en évidence la capacité de l'entreprise à innover malgré les restrictions américaines sur les exportations de puces, car elle avait affiné ses algorithmes pour maximiser l'efficacité computationnelle en utilisant du matériel plus ancien.
Aspects Techniques et Opérationnels
DeepSeek-R1 est construit sur l'architecture transformer, la base de la plupart des grands modèles de langage modernes. L'entraînement du modèle a exploité le cluster de calcul Fire-Flyer 2, qui consiste en une architecture logicielle et matérielle co-conçue. Le côté matériel utilise des GPU Nvidia avec des interconnexions de 200 Gbps, divisés en deux zones soutenant des tâches inter-zones. La topologie du réseau consiste en deux arbres gras, choisis pour leur bande passante de bissection élevée.
Le côté logiciel comprend 3FS (Fire-Flyer File System), un système de fichiers parallèle distribué conçu pour des lectures aléatoires asynchrones utilisant Direct I/O et RDMA Read. Contrairement au Buffered I/O standard, Direct I/O ne met pas en cache les données, ce qui est bénéfique car chaque donnée lue est aléatoire et non réutilisée. Le cluster utilise également hfreduce, une bibliothèque de communication asynchrone conçue à l'origine pour remplacer la bibliothèque de communications collectives Nvidia (NCCL) pour certaines opérations.
L'approche d'entraînement de DeepSeek met l'accent sur l'efficacité, permettant à l'entreprise d'atteindre des performances compétitives malgré les contraintes matérielles. L'entreprise a déclaré qu'elle se concentre sur la recherche et n'a pas de plans immédiats de commercialisation, ce qui lui a permis de prioriser l'innovation technique plutôt que les pressions du marché.
Impact sur le Marché et Réception
La publication de DeepSeek-R1 en janvier 2025 a eu un impact significatif sur les marchés financiers mondiaux, en particulier sur les actions technologiques. Les performances du modèle, combinées aux rapports sur ses faibles coûts d'entraînement, ont conduit à une vente massive des actions des entreprises perçues comme leaders de l'infrastructure d'IA, telles que Nvidia et d'autres fabricants de puces. L'événement a été largement interprété comme un signe que le paysage concurrentiel de l'IA était en train de changer, avec des modèles open source chinois potentiellement perturbant la domination des entreprises américaines d'IA.
DeepSeek-R1 a été salué pour ses capacités de raisonnement, qui étaient comparables ou supérieures à celles des modèles propriétaires de premier plan dans certains benchmarks. La nature à poids ouverts du modèle a également facilité son adoption par les fournisseurs de cloud, notamment Microsoft Azure et Perplexity AI, qui l'hébergeaient nativement. Cette large disponibilité a contribué à sa popularité parmi les chercheurs et développeurs.
Cependant, la publication a également soulevé des préoccupations concernant les implications des modèles à poids ouverts pour la sécurité et la réglementation de l'IA. Certains experts ont soutenu que la disponibilité généralisée de modèles de raisonnement puissants pourrait poser des risques, tandis que d'autres ont accueilli favorablement la démocratisation de la technologie de l'IA. L'événement a suscité des discussions sur la nécessité d'une coopération internationale en matière de gouvernance de l'IA, en particulier à la lumière des tensions géopolitiques entre les États-Unis et la Chine.
Contexte Plus Large et Orientations Futures
La publication de DeepSeek-R1 fait partie d'une tendance plus large des entreprises chinoises d'IA développant des modèles compétitifs malgré les contrôles à l'exportation américains. DeepSeek a continuellement affiné ses algorithmes pour maximiser l'efficacité computationnelle, en exploitant du matériel plus ancien et en réduisant la consommation d'énergie. L'entreprise s'est également étendue en Afrique, offrant des solutions d'IA plus abordables et moins énergivores, et a renforcé les modèles de langues africaines, générant un certain nombre de startups, par exemple à Nairobi. Avec les services de stockage et de cloud computing de Huawei, l'impact sur la scène technologique en Afrique subsaharienne est considérable, DeepSeek offrant une souveraineté des données locale et plus de flexibilité par rapport aux plateformes d'IA occidentales.
L'approche de recrutement de l'entreprise met l'accent sur les compétences plutôt que sur une longue expérience professionnelle, ce qui entraîne de nombreuses embauches fraîchement sorties de l'université. DeepSeek recrute également des personnes sans formation en informatique pour élargir la gamme d'expertise intégrée dans les modèles, par exemple en poésie ou en mathématiques avancées. Selon The New York Times, des dizaines de chercheurs de DeepSeek ont ou ont eu des affiliations avec des laboratoires de l'Armée populaire de libération et les Sept Fils de la Défense nationale. Depuis 2025, son chatbot a été adopté dans des rôles non combattants par l'Armée populaire de libération, notamment dans les hôpitaux, la police armée populaire paramilitaire et les organisations de mobilisation nationale.
Dès début 2025, DeepSeek-R1 reste un point de référence significatif dans la communauté de l'IA, illustrant le potentiel du développement open source et la concurrence mondiale croissante dans le domaine de la IA générative. La publication du modèle a incité d'autres entreprises à reconsidérer leurs stratégies, certaines explorant des approches plus ouvertes de la distribution des modèles. L'impact à long terme de DeepSeek-R1 sur l'industrie de l'IA est encore en cours, mais son effet immédiat sur les marchés et le discours public a été profond.