En enero de 2025, DeepSeek, una empresa china de inteligencia artificial con sede en Hangzhou, lanzó su modelo de razonamiento de pesos abiertos, DeepSeek-R1. El lanzamiento provocó una importante caída global de las acciones, afectando particularmente a las acciones tecnológicas, y llevó a una reevaluación generalizada del panorama competitivo y los supuestos de inversión de la industria de la IA. El evento destacó el rápido progreso de los laboratorios chinos de IA y el potencial para un desarrollo de modelos más eficiente y de menor costo.
DeepSeek, fundada en julio de 2023 por Liang Wenfeng, es propiedad y está financiada por High-Flyer, un fondo de cobertura chino. La empresa se centra en desarrollar modelos de lenguaje grandes (LLM) de pesos abiertos, compartiendo los parámetros del modelo públicamente mientras mantiene los datos de entrenamiento propietarios. DeepSeek-R1, lanzado junto con un chatbot homónimo, demostró capacidades de razonamiento avanzadas comparables a los principales modelos occidentales, pero a una fracción del costo de entrenamiento reportado. Este logro desafió las nociones predominantes de que la IA de vanguardia requería recursos computacionales masivos y grandes gastos de capital.
Impacto en el Mercado
El 27 de enero de 2025, el lanzamiento de DeepSeek-R1 causó una fuerte caída en las acciones tecnológicas globales. Nvidia, un fabricante líder de GPU, vio caer el precio de sus acciones aproximadamente un 17%, eliminando alrededor de 589 mil millones de dólares en valor de mercado, la mayor pérdida diaria para cualquier empresa en la historia del mercado de valores de EE. UU. Otros fabricantes de chips y empresas relacionadas con la IA, incluyendo AMD, Broadcom y TSMC, también experimentaron caídas significativas. La venta se extendió a los mercados europeos y asiáticos, con índices como el Nikkei 225 y el Nasdaq Composite, con alto peso tecnológico, cayendo notablemente.
La reacción del mercado fue impulsada por las preocupaciones de los inversores de que los métodos de entrenamiento eficientes de DeepSeek podrían reducir la demanda de hardware de IA costoso, particularmente GPU de alta gama. DeepSeek supuestamente entrenó a R1 usando alrededor de 2,048 GPU Nvidia H800 durante dos meses, a un costo de aproximadamente 5.6 millones de dólares, una fracción de los cientos de millones gastados por laboratorios occidentales como OpenAI y Google DeepMind. Esto planteó preguntas sobre la sostenibilidad de los grandes gastos de capital de los principales proveedores de nube y empresas de IA.
Reevaluación de la Industria
El lanzamiento llevó a una reevaluación de las estrategias de desarrollo de IA en toda la industria. Ejecutivos de grandes empresas tecnológicas, incluyendo Microsoft y Alphabet, reconocieron públicamente los logros de DeepSeek y las implicaciones para la eficiencia de la IA. Algunos analistas sugirieron que el evento podría acelerar la adopción de modelos de pesos abiertos y fomentar la innovación en la optimización de modelos en lugar del escalado bruto de cómputo.
El éxito de DeepSeek se atribuyó a varias innovaciones técnicas, incluyendo el uso de aprendizaje por refuerzo (RL) para mejorar las capacidades de razonamiento, y la implementación de arquitecturas mezcla de expertos (MoE) que activan solo un subconjunto de parámetros por token, reduciendo la carga computacional. La empresa también refinó sus algoritmos de entrenamiento para maximizar la eficiencia en hardware más antiguo, en parte debido a las restricciones de exportación de EE. UU. sobre chips avanzados a China.
Antecedentes de DeepSeek
DeepSeek se estableció como una empresa independiente el 17 de julio de 2023, escindida del laboratorio de investigación de inteligencia artificial general (AGI) de High-Flyer, que se había anunciado el 14 de abril de 2023. High-Flyer, cofundada por Liang Wenfeng en junio de 2015, había estado utilizando aprendizaje profundo basado en GPU para el comercio de acciones desde el 21 de octubre de 2016. La empresa construyó su primer clúster de cómputo, Fire-Flyer, en 2019, y luego construyó Fire-Flyer 2, un clúster más grande con 5,000 GPU Nvidia A100, completado en 2021.
La estrategia de contratación de DeepSeek enfatiza las habilidades sobre la experiencia, reclutando a muchos graduados recientes e individuos de campos no relacionados con la informática para ampliar el conocimiento de los modelos. La empresa ha declarado que se centra en la investigación y no tiene planes de comercialización inmediatos, lo que le permite operar bajo ciertas exenciones regulatorias en China.
Innovaciones Técnicas
DeepSeek-R1 es un modelo de razonamiento que utiliza un pipeline de entrenamiento de múltiples etapas. Emplea aprendizaje por refuerzo para mejorar el razonamiento de cadena de pensamiento, y utiliza ajuste fino supervisado (SFT) con datos curados. La arquitectura del modelo incorpora capas de atención de múltiples cabezas y mezcla de expertos, permitiendo un escalado eficiente. DeepSeek también introdujo un enfoque novedoso para RL que evita la necesidad de un modelo de recompensa separado, utilizando recompensas basadas en reglas para tareas con respuestas verificables.
La infraestructura de entrenamiento, conocida como Fire-Flyer 2, consiste en una arquitectura de software y hardware co-diseñada. Utiliza GPU Nvidia con interconexiones de 200 Gbps y una topología de red de dos árboles gordos para un alto ancho de banda de bisección. La pila de software incluye 3FS (Fire-Flyer File System), un sistema de archivos paralelo distribuido optimizado para lecturas aleatorias asíncronas, y hfreduce, una biblioteca para comunicación asíncrona.
Panorama Competitivo
El lanzamiento de DeepSeek-R1 intensificó la competencia en la industria de la IA, particularmente entre empresas estadounidenses y chinas. Demostró que los laboratorios chinos podían lograr resultados de vanguardia a pesar de las restricciones de hardware. El enfoque de pesos abiertos de DeepSeek contrasta con los modelos cerrados de OpenAI y Anthropic, y ha sido adoptado por algunos desarrolladores occidentales por su transparencia y personalización.
Los principales proveedores de nube, incluyendo microsoft-azure y Perplexity AI, comenzaron a alojar modelos de DeepSeek de forma nativa, integrándolos aún más en el ecosistema global de IA. El evento también provocó discusiones sobre la seguridad de la IA y los controles de exportación, con algunos responsables políticos pidiendo regulaciones más estrictas sobre los modelos de pesos abiertos.
Implicaciones a Largo Plazo
El shock del mercado sirvió como una llamada de atención para inversores y empresas tecnológicas, destacando el potencial de innovación disruptiva de fuentes inesperadas. Subrayó la importancia de la eficiencia algorítmica y la posibilidad de lograr un alto rendimiento con menos recursos. A principios de 2025, los efectos a largo plazo sobre la demanda de hardware de IA y la estructura de la industria seguían siendo inciertos, pero el evento marcó un punto de inflexión en la carrera global de IA.
El ascenso de DeepSeek también planteó cuestiones geopolíticas, ya que los investigadores de la empresa tienen afiliaciones con laboratorios militares chinos, y su chatbot ha sido adoptado por el Ejército Popular de Liberación para roles no combatientes desde marzo de 2025. Estos desarrollos añadieron una capa de complejidad al panorama internacional de la IA.
Conclusión
El lanzamiento de DeepSeek-R1 y el posterior shock del mercado representaron un momento pivotal en la historia de la inteligencia artificial. Demostró que los modelos de pesos abiertos podían rivalizar con los sistemas propietarios, desafió los supuestos sobre la necesidad de cómputo masivo y reformó las expectativas de los inversores. El evento aceleró las discusiones sobre la eficiencia de la IA, la colaboración de código abierto y el equilibrio global del poder de la IA, con implicaciones que continuaron desarrollándose a lo largo de 2025.