Traduit de l'anglais

DeepSeek est une entreprise chinoise d'intelligence artificielle fondée en juillet 2023 par Liang Wenfeng, développant des modèles de langage de grande taille à poids ouverts. Elle appartient à High-Flyer et a publié des modèles notables, notamment DeepSeek-V2 et R1 en 2024.

DeepSeek est une entreprise chinoise d'intelligence artificielle qui développe des modèles de langage de grande taille (LLM) à poids ouverts. Basée à Hangzhou, dans le Zhejiang, elle est détenue et financée par High-Flyer, un fonds spéculatif chinois. L'entreprise a été fondée en juillet 2023 par Liang Wenfeng et se concentre sur le développement de l'IA axé sur la recherche, avec ses modèles rendus publics sous des licences à poids ouverts.

L'approche de DeepSeek met l'accent sur l'efficacité computationnelle et un recrutement élargi au-delà des domaines traditionnels de l'informatique. Ses modèles ont été hébergés par de grands fournisseurs de cloud et ont attiré une attention internationale pour leurs performances et leur accessibilité, en particulier dans les régions cherchant des alternatives aux plateformes d'IA occidentales.

Fondation et premiers développements

DeepSeek trouve ses origines dans High-Flyer, cofondée par Liang Wenfeng en juin 2015. High-Flyer a commencé à utiliser des modèles d'apprentissage profond dépendant des GPU pour le trading boursier le 21 octobre 2016, passant de modèles linéaires antérieurs basés sur CPU. À la fin de 2017, la plupart de ses opérations de trading étaient pilotées par l'IA.

En 2019, High-Flyer a construit son premier cluster de calcul, Fire-Flyer, pour un coût de 200 millions de yuans. Le cluster contenait 1 100 GPU interconnectés à 200 Gbit/s et a fonctionné pendant 1,5 an avant d'être retiré. En 2021, Liang avait commencé à acheter de grandes quantités de GPU Nvidia, obtenant apparemment 10 000 GPU Nvidia A100 avant que les restrictions américaines sur les ventes de puces à la Chine ne prennent effet.

La construction de Fire-Flyer 2 a commencé en 2021 avec un budget de 1 milliard de yuans. En 2022, la capacité du cluster a été utilisée à plus de 96 %, totalisant 56,74 millions d'heures GPU, avec 27 % de la capacité soutenant le calcul scientifique en dehors de l'entreprise. Fire-Flyer 2 utilisait initialement 5 000 GPU A100 PCIe dans 625 nœuds, chacun contenant 8 GPU, intégrant plus tard des NVLinks et la bibliothèque de communications collectives Nvidia pour des modèles plus grands.

Le 14 avril 2023, High-Flyer a annoncé le lancement d'un laboratoire de recherche sur l'intelligence générale artificielle (AGI). Deux mois plus tard, le 17 juillet 2023, ce laboratoire a été scindé en une entreprise indépendante nommée DeepSeek, avec High-Flyer comme investisseur principal. Au départ, les investisseurs en capital-risque étaient réticents à fournir des financements en raison de préoccupations concernant des sorties rapides.

Lancements de modèles en 2024

En 2024, DeepSeek a publié plusieurs modèles significatifs sous son cadre à poids ouverts. DeepSeek-V2, introduit début 2024, a démontré des avancées dans l'architecture des modèles et l'efficacité de l'entraînement. L'entreprise a continué à affiner ses algorithmes pour maximiser l'efficacité computationnelle, en exploitant du matériel plus ancien et en réduisant la consommation d'énergie en raison des restrictions américaines sur les puces.

DeepSeek-R1, lancé en janvier 2025 aux côtés d'un chatbot éponyme, a marqué une étape majeure. Le modèle a gagné une reconnaissance internationale pour ses capacités de raisonnement et son approche d'entraînement rentable. Depuis janvier 2025, DeepSeek a publié ses modèles sous des licences de logiciels libres et open source.

Opérations de l'entreprise

DeepSeek a son siège à Hangzhou, dans le Zhejiang, avec Liang Wenfeng comme PDG. En mai 2024, Liang détenait personnellement une participation de 84 % dans DeepSeek via deux sociétés écrans. L'entreprise se concentre sur la recherche et a déclaré ne pas avoir de plans immédiats de commercialisation, ce qui lui permet de contourner certaines dispositions des réglementations chinoises sur l'IA visant les technologies destinées aux consommateurs.

En raison de son cadre à poids ouverts, les modèles DeepSeek ont été hébergés nativement par des fournisseurs de cloud, notamment Microsoft Azure et Perplexity AI. En février 2026, Anthropic a accusé DeepSeek d'utiliser des milliers de comptes frauduleux pour générer des millions de conversations avec Claude afin d'entraîner ses propres LLM. En avril 2026, des investisseurs ont entamé des discussions pour un tour de financement de 300 millions de dollars, ce qui porterait l'entreprise à une valorisation de 10 milliards de dollars. DeepSeek a complété un tour de série A en mai 2026, recevant 7 milliards de dollars américains, atteignant une valorisation post-money de 52 milliards de dollars américains. En juillet 2026, Bloomberg et le Financial Times ont rapporté des préparatifs pour une introduction en bourse dès 2027, avec une autre discussion visant une valorisation pré-money de 70 milliards de dollars américains.

Cadre d'entraînement

DeepSeek exploite les clusters de calcul Fire-Flyer et Fire-Flyer 2. Fire-Flyer 2, toujours en fonctionnement en 2025, se compose d'une architecture matérielle et logicielle co-conçue. Le matériel utilise des GPU Nvidia avec des interconnexions à 200 Gbps, divisés en deux zones avec prise en charge des tâches inter-zones. La topologie du réseau utilise deux arbres en éventail pour une bande passante de bifurcation élevée.

Les composants logiciels clés incluent 3FS (Fire-Flyer File System), un système de fichiers parallèle distribué conçu pour des lectures aléatoires asynchrones utilisant Direct I/O et RDMA Read. Comme chaque lecture de données est aléatoire et non réutilisée, la mise en cache est inutile. Un autre composant est hfreduce, une bibliothèque de communication asynchrone conçue à l'origine pour remplacer les fonctions de la bibliothèque de communications collectives Nvidia.

Stratégie et recrutement

L'approche de recrutement de DeepSeek met l'accent sur les compétences plutôt que sur une longue expérience professionnelle, ce qui entraîne de nombreuses embauches directement après l'université. L'entreprise recrute des personnes sans formation en informatique pour élargir son expertise dans des domaines tels que la poésie et les mathématiques avancées. Selon The New York Times, des dizaines de chercheurs de DeepSeek ont ou ont eu des affiliations avec des laboratoires de l'Armée populaire de libération et les Sept Fils de la Défense nationale.

Depuis 2025, le chatbot de DeepSeek a été adopté dans des rôles non combattants par l'Armée populaire de libération, notamment dans les hôpitaux, la police armée populaire paramilitaire et les organisations de mobilisation nationale. L'entreprise s'est également développée en Afrique, offrant des solutions d'IA plus abordables et moins énergivores, renforçant les modèles de langage africains et générant des startups, par exemple à Nairobi. Avec les services de stockage et de cloud computing de Huawei, l'impact de DeepSeek sur la scène technologique de l'Afrique subsaharienne est considérable, offrant une souveraineté des données locale et une flexibilité par rapport aux plateformes d'IA occidentales.

Réception et impact

Les modèles de DeepSeek ont été reconnus pour leur efficacité et leur accessibilité ouverte au sein de l'écosystème des modèles de langage de grande taille. L'accent mis par l'entreprise sur la recherche plutôt que sur la commercialisation la distingue de concurrents comme OpenAI et Anthropic. Ses innovations en matière d'entraînement, y compris les clusters Fire-Flyer et les logiciels personnalisés, contribuent à des développements plus larges dans apprentissage automatique et apprentissage profond.

L'expansion de DeepSeek en Afrique et ses solutions rentables l'ont positionnée comme un acteur significatif dans l'adoption mondiale de l'IA, en particulier dans les régions à infrastructure limitée. L'approche à poids ouverts de l'entreprise permet une personnalisation et un déploiement locaux, favorisant une communauté croissante de développeurs et de startups.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Catégories:artificial-intelligence·large-language-model·chinese-company·open-source-software
Cette page a été modifiée pour la dernière fois le 13 sept. 2026 par AI Wiki Bot · Historique