DeepSeek, una empresa china de inteligencia artificial con sede en Hangzhou, lanzó su modelo de lenguaje de gran tamaño de pesos abiertos DeepSeek-R1 en enero de 2025. El lanzamiento provocó una caída significativa en las acciones tecnológicas globales, ya que los inversores reevaluaron el panorama competitivo del desarrollo de la IA y la necesidad de gastos de capital masivos. El evento impulsó un amplio debate en la industria sobre la eficiencia del entrenamiento de IA y la viabilidad de los modelos de código abierto.
DeepSeek es una subsidiaria de High-Flyer, un fondo de cobertura chino cofundado por Liang Wenfeng. La empresa se centra en desarrollar modelos de pesos abiertos, lo que significa que los parámetros del modelo se comparten públicamente, aunque los datos de entrenamiento no están licenciados abiertamente. Desde enero de 2025, DeepSeek ha lanzado sus modelos bajo licencias de software libre y de código abierto. El enfoque de la empresa enfatiza la investigación sobre la comercialización inmediata, lo que le permite sortear ciertas disposiciones regulatorias.
Antecedentes
DeepSeek fue fundada en julio de 2023, tras el establecimiento de un laboratorio de investigación de inteligencia artificial general (AGI) por parte de High-Flyer en abril de 2023. El laboratorio se escindió en una empresa independiente dos meses después, con High-Flyer como su principal inversor. Liang Wenfeng, que había estado operando desde la crisis financiera de 2008, cofundó High-Flyer en junio de 2015. El fondo de cobertura comenzó a utilizar modelos de aprendizaje profundo dependientes de GPU para el comercio de acciones en octubre de 2016, pasando de modelos lineales basados en CPU.
Los orígenes de DeepSeek están arraigados en la infraestructura informática de High-Flyer. En 2019, la empresa construyó su primer clúster informático, Fire-Flyer, con un coste de 200 millones de yuanes. El clúster contenía 1.100 GPU interconectadas a 200 Gbit/s y se retiró después de 1,5 años. Para 2021, Liang había comenzado a adquirir grandes cantidades de GPU de Nvidia, supuestamente obteniendo 10.000 GPU Nvidia A100 antes de que las restricciones estadounidenses sobre las ventas de chips a China entraran en vigor.
Fire-Flyer 2
La construcción de Fire-Flyer 2 comenzó en 2021 con un presupuesto de 1.000 millones de yuanes. Para 2022, su capacidad se utilizó en más del 96%, totalizando 56,74 millones de horas de GPU. El clúster tenía 5.000 GPU A100 PCIe en 625 nodos, cada uno con 8 GPU. Inicialmente, usaba PCIe en lugar de la versión DGX de la A100 porque los modelos entrenados podían caber dentro de una sola VRAM de GPU de 40 GB, requiriendo solo paralelismo de datos. Más tarde, incorporó NVLinks y la Biblioteca de Comunicaciones Colectivas de Nvidia (NCCL) para entrenar modelos más grandes que requerían paralelismo de modelos.
Fire-Flyer 2 sigue en funcionamiento a partir de 2025. Presenta una arquitectura de software y hardware co-diseñada. El hardware utiliza GPU de Nvidia con interconexiones de 200 Gbps, divididas en dos zonas con dos árboles de grasa para un alto ancho de banda de bisección. El software incluye 3FS (Sistema de Archivos Fire-Flyer), un sistema de archivos paralelo distribuido diseñado para lecturas aleatorias asíncronas, utilizando E/S Directa y Lectura RDMA. También incluye hfreduce, una biblioteca para comunicación asíncrona.
Lanzamiento de DeepSeek-R1
DeepSeek-R1 se lanzó en enero de 2025 junto con un chatbot homónimo. El modelo demostró un rendimiento competitivo en tareas de razonamiento, supuestamente rivalizando con los principales modelos de OpenAI y otras empresas occidentales de IA. Su naturaleza de pesos abiertos permitió a desarrolladores e investigadores inspeccionar y modificar el modelo, fomentando una adopción y experimentación rápidas.
El lanzamiento tuvo repercusiones financieras inmediatas. El día del anuncio, las principales acciones tecnológicas experimentaron fuertes caídas. Nvidia, un fabricante líder de GPU, vio caer significativamente su valor de mercado, ya que los inversores cuestionaron si la alta demanda de chips de IA persistiría si los modelos pudieran entrenarse de manera más eficiente. Otras empresas en la cadena de suministro de IA, incluidas AMD, TSMC y Broadcom, también enfrentaron ventas masivas. El shock del mercado se atribuyó a la capacidad de DeepSeek para lograr un alto rendimiento con costos computacionales relativamente más bajos, desafiando la suposición de que las inversiones masivas en computación eran necesarias para la IA de vanguardia.
Impacto en el Mercado y Reevaluación de la Industria
El lanzamiento de DeepSeek-R1 provocó una amplia reevaluación de las estrategias de IA en toda la industria. Analistas y ejecutivos comenzaron a cuestionar la sostenibilidad de los enormes gastos de capital de empresas como OpenAI, Anthropic y Google DeepMind. El evento destacó el potencial de los modelos de código abierto para alterar las ofertas propietarias, ya que el modelo de DeepSeek estaba disponible gratuitamente, reduciendo las barreras de entrada para actores más pequeños.
En respuesta, algunas empresas aceleraron sus propios esfuerzos de eficiencia, centrándose en mejoras algorítmicas y optimización de hardware. El incidente también intensificó los debates sobre los controles de exportación de chips avanzados de Estados Unidos, ya que el éxito de DeepSeek demostró que las empresas chinas podían lograr resultados competitivos a pesar de las restricciones. El shock del mercado se consideró una llamada de atención para los inversores, que anteriormente habían asumido que el liderazgo en IA estaba vinculado al acceso al hardware más avanzado.
Operaciones y Estrategia de la Empresa
DeepSeek tiene su sede en Hangzhou, Zhejiang, y es propiedad y está financiada por High-Flyer. Liang Wenfeng actúa como CEO, con una participación del 84% a través de dos sociedades instrumentales a partir de mayo de 2024. La empresa se centra en la investigación y ha declarado que no tiene planes inmediatos de comercialización. Esta postura le permite eludir ciertas disposiciones de las regulaciones de IA de China dirigidas a tecnologías orientadas al consumidor.
El enfoque de contratación de DeepSeek enfatiza las habilidades sobre la experiencia laboral extensa, lo que resulta en muchas contrataciones recién salidas de la universidad. La empresa también recluta a personas sin formación en informática para ampliar la gama de experiencia incorporada en los modelos, como poesía o matemáticas avanzadas. Según The New York Times, docenas de investigadores de DeepSeek tienen o han tenido afiliaciones con laboratorios del Ejército Popular de Liberación y los Siete Hijos de la Defensa Nacional. Desde 2025, su chatbot ha sido adoptado en roles no combatientes por el Ejército Popular de Liberación, incluidos hospitales, la Policía Armada Popular y organizaciones de movilización nacional.
Debido a las restricciones de chips de Estados Unidos, DeepSeek ha refinado sus algoritmos para maximizar la eficiencia computacional, aprovechando hardware más antiguo y reduciendo el consumo de energía. La empresa también se ha expandido a África, ofreciendo soluciones de IA más asequibles y menos intensivas en energía. DeepSeek ha reforzado los modelos de idiomas africanos y ha generado startups, por ejemplo en Nairobi. Junto con los servicios de almacenamiento y computación en la nube de Huawei, el impacto en la escena tecnológica del África subsahariana es considerable, ofreciendo soberanía de datos local y flexibilidad en comparación con las plataformas de IA occidentales.
Alojamiento en la Nube y Adopción
Debido a su marco de pesos abiertos, los modelos de DeepSeek han sido alojados de forma nativa por proveedores de nube, incluidos Microsoft Azure y Perplexity AI. Esto ha facilitado un acceso generalizado a los modelos, permitiendo a los desarrolladores integrarlos en diversas aplicaciones. El enfoque de pesos abiertos también ha permitido el ajuste fino y la personalización por parte de terceros, contribuyendo a la rápida adopción del modelo.
El lanzamiento de DeepSeek-R1 se ha comparado con momentos históricos en la tecnología donde innovaciones disruptivas remodelaron los mercados. Subrayó el potencial de las empresas no estadounidenses para liderar en el desarrollo de IA, desafiando el dominio de los gigantes tecnológicos estadounidenses. El evento también planteó preguntas sobre la viabilidad a largo plazo de los modelos de IA de código cerrado, ya que las alternativas de código abierto continúan mejorando.
Perspectivas Futuras
Tras el shock del mercado, DeepSeek continuó desarrollando y lanzando nuevos modelos. En febrero de 2026, Anthropic acusó a DeepSeek de usar miles de cuentas fraudulentas para generar millones de conversaciones con Claude para entrenar sus propios LLM. En abril de 2026, los inversores comenzaron discusiones con DeepSeek para una ronda de financiación de 300 millones de dólares, lo que llevaría a la empresa a una valoración total de 10.000 millones de dólares. DeepSeek completó una ronda Serie A en mayo de 2026 recibiendo 7.000 millones de dólares, alcanzando una valoración post-money de 52.000 millones de dólares. En julio de 2026, Bloomberg y el Financial Times informaron que la empresa había comenzado los preparativos para una OPI, con una posible cotización ya en 2027. El mismo mes, comenzó discusiones dirigidas a una valoración pre-money de 70.000 millones de dólares.
El lanzamiento de DeepSeek-R1 en enero de 2025 sigue siendo un evento histórico en la historia de la inteligencia artificial, ilustrando el rápido ritmo de innovación y la interconexión de los mercados tecnológicos y financieros. El evento provocó una conversación global sobre la eficiencia de la IA, el desarrollo de código abierto y las dimensiones geopolíticas del avance de la IA.