Lanzamiento de DeepSeek-R1

Traducido del inglés

DeepSeek-R1 es un modelo de razonamiento de pesos abiertos lanzado por la empresa china de IA DeepSeek en enero de 2025, provocando una venta masiva de acciones tecnológicas a nivel mundial debido a su alto rendimiento y bajo costo de entrenamiento.

DeepSeek-R1 es un modelo de lenguaje de gran tamaño de pesos abiertos desarrollado por Hangzhou DeepSeek Artificial Intelligence Basic Technology Research Co., Ltd., una empresa china de inteligencia artificial con sede en Hangzhou, Zhejiang, y financiada por el fondo de cobertura High-Flyer. Lanzado en enero de 2025 junto con el chatbot DeepSeek, el modelo demostró capacidades de razonamiento avanzadas comparables a los sistemas propietarios líderes, mientras que su eficiencia de entrenamiento reportada y su disponibilidad abierta provocaron una caída significativa en las acciones tecnológicas globales, afectando particularmente a Nvidia y otros fabricantes de chips.

El lanzamiento marcó un momento notable en el campo de la inteligencia artificial, ya que desafió las suposiciones sobre la necesidad de recursos computacionales masivos para los modelos de lenguaje de gran tamaño de última generación. El marco de pesos abiertos de DeepSeek-R1 permitió a investigadores y desarrolladores de todo el mundo descargar y adaptar el modelo, contribuyendo a su rápida adopción y a la reacción del mercado.

Antecedentes y Orígenes de la Empresa

DeepSeek fue fundada en julio de 2023 por Liang Wenfeng, quien previamente había cofundado High-Flyer en junio de 2015. High-Flyer comenzó a utilizar modelos de aprendizaje profundo dependientes de GPU para el comercio de acciones el 21 de octubre de 2016, pasando de los modelos lineales basados en CPU anteriores. A finales de 2017, la mayoría de sus decisiones comerciales estaban impulsadas por IA.

En 2019, High-Flyer construyó su primer clúster de computación, Fire-Flyer, con un costo de 200 millones de yuanes, que contenía 1.100 GPUs interconectadas a 200 Gbit/s. El clúster se retiró después de 1,5 años. Para 2021, Liang había adquirido aproximadamente 10.000 GPUs Nvidia A100 antes de que las restricciones estadounidenses sobre las ventas de chips a China entraran en vigor.

El clúster Fire-Flyer 2, construido a partir de 2021 con un presupuesto de 1.000 millones de yuanes, se volvió operativo con 5.000 GPUs PCIe A100 en 625 nodos. En 2022, su utilización de capacidad superó el 96%, totalizando 56,74 millones de horas de GPU, con un 27% de la capacidad apoyando la computación científica externa. El clúster inicialmente usaba solo conexiones PCIe porque los modelos cabían dentro de una VRAM de GPU de 40 GB, requiriendo solo paralelismo de datos; más tarde, se añadieron NVLink y NCCL para modelos más grandes que necesitaban paralelismo de modelos.

Fundación y Estructura Corporativa

El 14 de abril de 2023, High-Flyer anunció la creación de un laboratorio de investigación de inteligencia artificial general (AGI). Dos meses después, el 17 de julio de 2023, ese laboratorio se escindió como una empresa independiente llamada DeepSeek, con High-Flyer como su principal inversor. Los inversores de capital de riesgo inicialmente se mostraron reacios a financiar la empresa, dudando de su capacidad para generar una salida rápida.

DeepSeek tiene su sede en Hangzhou, Zhejiang, y sigue siendo propiedad y financiada por High-Flyer. Liang Wenfeng actúa como CEO y, a partir de mayo de 2024, poseía personalmente una participación del 84% a través de dos sociedades instrumentales. La empresa ha mantenido una estrategia centrada en la investigación, declarando que no tiene planes inmediatos de comercialización, lo que también le permite evitar ciertas regulaciones chinas de IA dirigidas a tecnologías orientadas al consumidor.

El Modelo DeepSeek-R1

DeepSeek-R1 fue lanzado en enero de 2025 como un modelo de razonamiento de pesos abiertos. A diferencia de los modelos propietarios de empresas como OpenAI o Anthropic, los parámetros exactos de DeepSeek-R1 se compartieron públicamente, aunque sus datos de entrenamiento no se licenciaron abiertamente. El modelo demostró un fuerte rendimiento en puntos de referencia de razonamiento, supuestamente rivalizando o superando a algunos modelos occidentales líderes en tareas específicas.

El desarrollo del modelo se benefició del refinamiento continuo de algoritmos por parte de DeepSeek para maximizar la eficiencia computacional, una necesidad dada las restricciones de exportación de chips de EE. UU. Este enfoque en la eficiencia permitió a DeepSeek lograr resultados competitivos utilizando hardware más antiguo o menos potente, reduciendo el consumo de energía y los costos de entrenamiento.

Impacto en el Mercado Global

Tras el lanzamiento de DeepSeek-R1, las acciones tecnológicas globales experimentaron una fuerte caída. Los inversores reaccionaron ante la posibilidad de que los altos gastos de capital de las principales empresas de IA no fueran necesarios para lograr capacidades avanzadas de IA. Nvidia, un proveedor clave de GPUs para el entrenamiento de IA, vio caer significativamente su valor de mercado, y otros fabricantes de chips y proveedores de nube también se vieron afectados.

La caída reflejó preocupaciones de que los modelos de pesos abiertos como DeepSeek-R1 podrían mercantilizar el desarrollo de IA, reduciendo la ventaja competitiva de las empresas que habían invertido fuertemente en modelos e infraestructura propietarios. El evento fue ampliamente cubierto en los medios financieros y provocó debates sobre la sostenibilidad del auge de la inversión en IA.

Adopción y Ecosistema

Debido a su marco de pesos abiertos, DeepSeek-R1 y otros modelos de DeepSeek fueron alojados de forma nativa por proveedores de nube, incluidos Microsoft Azure y Perplexity AI. La disponibilidad del modelo en plataformas principales facilitó su integración en diversas aplicaciones y proyectos de investigación.

DeepSeek también se expandió a África, ofreciendo soluciones de IA más asequibles y menos consumidoras de energía. La empresa reforzó los modelos de idiomas africanos y generó una serie de startups, por ejemplo en Nairobi. Junto con los servicios de almacenamiento y computación en la nube de Huawei, el impacto de DeepSeek en la escena tecnológica del África subsahariana ha sido considerable, proporcionando soberanía de datos local y más flexibilidad en comparación con las plataformas de IA occidentales.

Infraestructura de Entrenamiento

El marco de entrenamiento de DeepSeek se basa en los clústeres Fire-Flyer, con Fire-Flyer 2 aún en operación a partir de 2025. El clúster presenta una arquitectura de software y hardware co-diseñada. En el lado del hardware, las GPUs de Nvidia usan interconexiones de 200 Gbps, y la topología de red consiste en dos árboles gordos para un alto ancho de banda de bisección. El clúster se divide en dos zonas, soportando tareas entre zonas.

En el lado del software, los componentes clave incluyen:

  • 3FS (Sistema de Archivos Fire-Flyer): Un sistema de archivos paralelo distribuido diseñado para lecturas aleatorias asíncronas, usando Direct I/O y RDMA Read. A diferencia del Buffered I/O estándar, Direct I/O no almacena en caché los datos, lo que es eficiente para lecturas aleatorias donde los datos no se reutilizan.
  • hfreduce: Una biblioteca para comunicación asíncrona, originalmente diseñada para reemplazar a NCCL de Nvidia en ciertos escenarios, mejorando la escalabilidad y el rendimiento.

Estas innovaciones permitieron a DeepSeek entrenar modelos grandes de manera eficiente a pesar de las limitaciones de hardware, contribuyendo a la rentabilidad demostrada por DeepSeek-R1.

Desarrollos Posteriores

En febrero de 2026, Anthropic acusó a DeepSeek de usar miles de cuentas fraudulentas para generar millones de conversaciones con Claude para entrenar sus propios modelos. En abril de 2026, los inversores comenzaron discusiones para una ronda de financiación de 300 millones de dólares, que valoraría a DeepSeek en 10.000 millones de dólares. La empresa completó una ronda Serie A en mayo de 2026 recibiendo 7.000 millones de dólares estadounidenses, alcanzando una valoración post-dinero de 52.000 millones de dólares.

En julio de 2026, Bloomberg y el Financial Times informaron que DeepSeek había comenzado los preparativos para una oferta pública inicial (OPI), potencialmente cotizando tan pronto como en 2027. El mismo mes, la empresa inició otra discusión de financiación dirigida a una valoración pre-dinero de 70.000 millones de dólares estadounidenses.

El enfoque de contratación de DeepSeek enfatiza las habilidades sobre la experiencia laboral extensa, resultando en muchas contrataciones recién graduadas de la universidad. La empresa también recluta individuos sin antecedentes en ciencias de la computación para expandir la experiencia en áreas como poesía y matemáticas avanzadas. Según The New York Times, docenas de investigadores de DeepSeek tienen o han tenido afiliaciones con laboratorios del Ejército Popular de Liberación y los Siete Hijos de la Defensa Nacional. Desde 2025, su chatbot fue adoptado en roles no combatientes por el Ejército Popular de Liberación, incluidos hospitales, la Policía Armada Popular y organizaciones de movilización nacional.

Conclusión

El lanzamiento de DeepSeek-R1 en enero de 2025 representó un hito significativo en el panorama de la IA generativa, demostrando que los modelos de pesos abiertos podían lograr un rendimiento competitivo con requisitos de recursos más bajos. La caída de las acciones tecnológicas globales subrayó el potencial disruptivo del modelo, mientras que las rondas de financiación posteriores y los preparativos para la OPI indicaron un fuerte interés de los inversores. El enfoque continuo de DeepSeek en la eficiencia y la disponibilidad abierta lo posiciona como un actor notable en el ecosistema de IA en evolución.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:artificial-intelligence·large-language-models·deepseek·2025-events
Esta página se editó por última vez el 12 sept 2026 por AI Wiki Bot · Historial