Liang Wenfeng est un entrepreneur chinois et fondateur de DeepSeek, un laboratoire de recherche en IA qui a attiré l'attention internationale au début de 2025 après avoir publié un modèle de raisonnement qui égalait les principaux systèmes occidentaux pour une fraction minime du coût d'entraînement rapporté.
Liang a été formé en ingénierie électronique et de l'information ainsi qu'en ingénierie de l'information et de la communication en Chine avant de cofonder High-Flyer, un fonds spéculatif quantitatif qui utilisait des techniques d'apprentissage automatique pour le trading automatisé. L'investissement précoce de High-Flyer dans l'infrastructure GPU pour ses modèles de trading a donné à l'équipe de Liang des ressources informatiques internes exceptionnellement solides et un talent d'ingénierie, qu'il a réorientés vers la recherche générale en IA lorsqu'il a fondé DeepSeek en 2023 en tant qu'effort dérivé financé par le fonds.
DeepSeek-R1 et le choc du marché
DeepSeek a publié une série de grands modèles de langage à poids ouverts tout au long de 2023 et 2024, mais le profil de l'entreprise a changé radicalement en janvier 2025 avec la publication de DeepSeek-R1, un modèle de raisonnement entraîné avec un apprentissage par renforcement à grande échelle qui performait de manière compétitive avec le o1 d'OpenAI sur des benchmarks de mathématiques et de codage. DeepSeek a publié un rapport technique décrivant un coût d'entraînement bien inférieur aux estimations de l'industrie pour des modèles de pointe comparables, et a publié les poids du modèle ouvertement, permettant aux développeurs du monde entier de le télécharger et de l'exécuter. L'annonce a déclenché le choc DeepSeek, une vente massive d'actions liées à l'IA, y compris NVIDIA, alors que les investisseurs remettaient en question les hypothèses sur la quantité de dépenses en infrastructure de calcul réellement nécessaire pour les progrès de l'IA de pointe.
Approche technique
Les modèles de DeepSeek sous Liang ont fait un usage intensif d'architectures mixture d'experts et de techniques d'entraînement axées sur l'efficacité pour réduire les coûts de calcul, et l'entreprise a publié des articles techniques remarquablement détaillés par rapport aux laboratoires occidentaux, qui divulguaient de moins en moins leurs méthodes d'entraînement à mesure que la concurrence s'intensifiait. Liang a accordé peu d'interviews publiques, mais dans celles qu'il a données, il a décrit la mission de DeepSeek comme poursuivant la recherche sur les capacités d'IA générale pour elle-même plutôt que pour des produits commerciaux à court terme.
Réception
Le profil public discret de Liang, contrastant avec la proéminence des dirigeants occidentaux de l'IA, a suscité une curiosité médiatique significative après la publication de DeepSeek-R1, et les médias d'État chinois ainsi que les responsables ont mis en avant l'entreprise comme preuve de la capacité de la Chine en IA malgré les contrôles à l'exportation américains sur les puces avancées. Les commentateurs occidentaux ont débattu de la question de savoir si les coûts d'entraînement rapportés par DeepSeek étaient pleinement représentatifs de l'investissement total, tout en convenant largement que la publication avait accéléré l'intérêt pour les techniques d'entraînement et d'inférence efficaces à l'échelle de l'industrie.