DeepSeek-R1 es un modelo de lenguaje de gran tamaño de pesos abiertos desarrollado por DeepSeek, una empresa china de inteligencia artificial con sede en Hangzhou, Zhejiang. Lanzado en enero de 2025 junto con el chatbot homónimo de la empresa, DeepSeek-R1 atrajo la atención internacional por sus avanzadas capacidades de razonamiento y por sacudir los mercados financieros globales, ya que su desarrollo de bajo costo desafió las suposiciones sobre el dominio de las empresas occidentales de IA. El modelo forma parte de la estrategia más amplia de DeepSeek de publicar modelos de pesos abiertos bajo licencias de software libre y de código abierto, haciendo públicos sus parámetros mientras mantiene los datos de entrenamiento como propietarios.
DeepSeek fue fundada en julio de 2023 por Liang Wenfeng, quien también cofundó el fondo de cobertura High-Flyer, que posee y financia la empresa. El lanzamiento de DeepSeek-R1 en enero de 2025 marcó un hito significativo en la historia de la empresa, posicionándola como un actor importante en el panorama global de la IA. El rendimiento del modelo, combinado con sus métodos de entrenamiento eficientes, provocó debates sobre el futuro del desarrollo de la IA, particularmente en cuanto al papel de los modelos de código abierto y el impacto de las restricciones de exportación de chips de Estados Unidos en la innovación china en IA.
Antecedentes
DeepSeek tiene sus orígenes en High-Flyer, un fondo de cobertura chino cofundado por Liang Wenfeng en junio de 2015. Liang, que había estado operando desde la crisis financiera de 2008 mientras asistía a la Universidad de Zhejiang, comenzó a utilizar modelos de aprendizaje profundo dependientes de GPU para el comercio de acciones el 21 de octubre de 2016, reemplazando los modelos lineales basados en CPU anteriores. A finales de 2017, la mayor parte del comercio de High-Flyer estaba impulsado por IA.
En 2019, High-Flyer construyó su primer clúster de computación, Fire-Flyer, con un costo de 200 millones de yuanes. El clúster contenía 1,100 GPUs interconectadas a 200 Gbit/s y fue retirado después de 1.5 años de operación. Para 2021, Liang había comenzado a comprar grandes cantidades de GPUs de Nvidia para un proyecto de IA, supuestamente obteniendo 10,000 GPUs Nvidia A100 antes de que Estados Unidos restringiera las ventas de chips a China.
La construcción de Fire-Flyer 2 comenzó en 2021 con un presupuesto de 1 mil millones de yuanes. En 2022, la capacidad de Fire-Flyer 2 se utilizó en más del 96%, totalizando 56.74 millones de horas de GPU, con el 27% de su capacidad apoyando la computación científica fuera de la empresa. El clúster tenía 5,000 GPUs PCIe A100 en 625 nodos, cada uno con 8 GPUs, y posteriormente incorporó NVLinks y la Biblioteca de Comunicaciones Colectivas de Nvidia (NCCL) para entrenar modelos más grandes que requieren paralelismo de modelos.
Fundación y Desarrollo Temprano
El 14 de abril de 2023, High-Flyer anunció el lanzamiento de un laboratorio de investigación de inteligencia artificial general (AGI), declarando que el nuevo laboratorio se centraría en desarrollar herramientas de IA no relacionadas con el negocio financiero de la empresa. Dos meses después, el 17 de julio de 2023, ese laboratorio se escindió en una empresa independiente llamada DeepSeek, con High-Flyer como su principal inversor y respaldo. Inicialmente, los inversores de capital de riesgo se mostraron reacios a proporcionar financiación, ya que consideraban poco probable que la empresa pudiera generar rápidamente una salida.
DeepSeek tiene su sede en Hangzhou, Zhejiang, y es propiedad y está financiada por High-Flyer. Su cofundador, Liang Wenfeng, actúa como CEO. A partir de mayo de 2024, Liang personalmente poseía una participación del 84% en DeepSeek a través de dos sociedades instrumentales. La estrategia de la empresa enfatiza la investigación sobre la comercialización inmediata, lo que le permite eludir ciertas disposiciones de las regulaciones de IA de China dirigidas a tecnologías orientadas al consumidor.
Lanzamiento de DeepSeek-R1
DeepSeek-R1 fue lanzado en enero de 2025, junto con el lanzamiento del chatbot homónimo de la empresa. El lanzamiento del modelo generó una cobertura mediática significativa y reacciones en el mercado, ya que su rendimiento rivalizaba con el de los principales modelos occidentales como los de OpenAI y Anthropic, mientras que supuestamente se entrenaba a una fracción del costo. El lanzamiento se vio como una demostración de las crecientes capacidades de China en inteligencia artificial y un desafío a la suposición de que el desarrollo avanzado de IA requería recursos computacionales masivos.
La naturaleza de pesos abiertos del modelo significaba que sus parámetros se compartían públicamente, permitiendo a investigadores y desarrolladores de todo el mundo descargarlo y ajustarlo. Esto contrastaba con los enfoques propietarios de muchas empresas occidentales de IA, que mantenían confidenciales los pesos de sus modelos. El lanzamiento de DeepSeek-R1 también destacó la capacidad de la empresa para innovar bajo las restricciones de exportación de chips de Estados Unidos, ya que había refinado sus algoritmos para maximizar la eficiencia computacional utilizando hardware más antiguo.
Aspectos Técnicos y Operativos
DeepSeek-R1 se basa en la arquitectura transformer, la base de la mayoría de los modelos de lenguaje de gran tamaño modernos. El entrenamiento del modelo aprovechó el clúster de computación Fire-Flyer 2, que consiste en una arquitectura de software y hardware co-diseñada. El lado del hardware utiliza GPUs de Nvidia con interconexiones de 200 Gbps, divididas en dos zonas que soportan tareas entre zonas. La topología de red consiste en dos árboles gordos, elegidos por su alto ancho de banda de bisección.
El lado del software incluye 3FS (Sistema de Archivos Fire-Flyer), un sistema de archivos paralelo distribuido diseñado para lecturas aleatorias asíncronas utilizando Direct I/O y RDMA Read. A diferencia del Buffered I/O estándar, Direct I/O no almacena en caché los datos, lo cual es beneficioso ya que cada dato leído es aleatorio y no se reutiliza. El clúster también utiliza hfreduce, una biblioteca de comunicación asíncrona diseñada originalmente para reemplazar la Biblioteca de Comunicaciones Colectivas de Nvidia (NCCL) para ciertas operaciones.
El enfoque de entrenamiento de DeepSeek enfatiza la eficiencia, permitiendo a la empresa lograr un rendimiento competitivo a pesar de las limitaciones de hardware. La empresa ha declarado que se centra en la investigación y no tiene planes inmediatos de comercialización, lo que le ha permitido priorizar la innovación técnica sobre las presiones del mercado.
Impacto en el Mercado y Recepción
El lanzamiento de DeepSeek-R1 en enero de 2025 tuvo un impacto significativo en los mercados financieros globales, particularmente en las acciones tecnológicas. El rendimiento del modelo, combinado con informes de sus bajos costos de entrenamiento, llevó a una venta masiva de acciones de empresas percibidas como líderes en infraestructura de IA, como Nvidia y otros fabricantes de chips. El evento fue ampliamente interpretado como una señal de que el panorama competitivo de la IA estaba cambiando, con modelos de código abierto de China potencialmente interrumpiendo el dominio de las empresas estadounidenses de IA.
DeepSeek-R1 recibió elogios por sus capacidades de razonamiento, que eran comparables o superaban a las de los principales modelos propietarios en ciertos puntos de referencia. La naturaleza de pesos abiertos del modelo también facilitó su adopción por parte de proveedores de nube, incluidos Microsoft Azure y Perplexity AI, que lo alojaron de forma nativa. Esta amplia disponibilidad contribuyó a su popularidad entre investigadores y desarrolladores.
Sin embargo, el lanzamiento también planteó preocupaciones sobre las implicaciones de los modelos de pesos abiertos para la seguridad y regulación de la IA. Algunos expertos argumentaron que la amplia disponibilidad de modelos de razonamiento potentes podría plantear riesgos, mientras que otros dieron la bienvenida a la democratización de la tecnología de IA. El evento provocó discusiones sobre la necesidad de cooperación internacional en la gobernanza de la IA, particularmente en medio de las tensiones geopolíticas entre Estados Unidos y China.
Contexto Más Amplio y Direcciones Futuras
El lanzamiento de DeepSeek-R1 es parte de una tendencia más amplia de empresas chinas de IA que desarrollan modelos competitivos a pesar de los controles de exportación de Estados Unidos. DeepSeek ha refinado continuamente sus algoritmos para maximizar la eficiencia computacional, aprovechando hardware más antiguo y reduciendo el consumo de energía. La empresa también se ha expandido a África, ofreciendo soluciones de IA más asequibles y menos intensivas en energía, y ha reforzado los modelos de lenguaje africanos, generando una serie de startups, por ejemplo en Nairobi. Junto con los servicios de almacenamiento y computación en la nube de Huawei, el impacto en la escena tecnológica del África subsahariana es considerable, con DeepSeek ofreciendo soberanía de datos local y más flexibilidad en comparación con las plataformas occidentales de IA.
El enfoque de contratación de la empresa enfatiza las habilidades sobre la experiencia laboral extensa, lo que resulta en muchas contrataciones recién salidas de la universidad. DeepSeek también recluta individuos sin antecedentes en ciencias de la computación para ampliar la gama de experiencia incorporada en los modelos, por ejemplo en poesía o matemáticas avanzadas. Según The New York Times, docenas de investigadores de DeepSeek tienen o han tenido afiliaciones con laboratorios del Ejército Popular de Liberación y los Siete Hijos de la Defensa Nacional. Desde 2025, su chatbot fue adoptado en roles no combatientes por el Ejército Popular de Liberación, incluidos hospitales, la Policía Armada Popular paramilitar y organizaciones de movilización nacional.
A principios de 2025, DeepSeek-R1 sigue siendo un punto de referencia significativo en la comunidad de IA, ilustrando el potencial del desarrollo de código abierto y la creciente competencia global en IA generativa. El lanzamiento del modelo ha llevado a otras empresas a reconsiderar sus estrategias, con algunas explorando enfoques más abiertos para la distribución de modelos. El impacto a largo plazo de DeepSeek-R1 en la industria de la IA aún se está desarrollando, pero su efecto inmediato en los mercados y el discurso público ha sido profundo.