DeepSeek es una empresa china de inteligencia artificial que desarrolla modelos de lenguaje de gran tamaño (LLM) de peso abierto. Con sede en Hangzhou, Zhejiang, es propiedad y está financiada por High-Flyer, un fondo de cobertura chino. La empresa fue fundada en julio de 2023 por Liang Wenfeng y se centra en el desarrollo de IA orientado a la investigación, con sus modelos disponibles públicamente bajo licencias de peso abierto.
El enfoque de DeepSeek enfatiza la eficiencia computacional y la contratación amplia más allá de los campos tradicionales de la informática. Sus modelos han sido alojados por los principales proveedores de nube y han ganado atención internacional por su rendimiento y accesibilidad, particularmente en regiones que buscan alternativas a las plataformas de IA occidentales.
Fundación e Historia Temprana
DeepSeek tiene sus orígenes en High-Flyer, cofundada por Liang Wenfeng en junio de 2015. High-Flyer comenzó a usar modelos de aprendizaje profundo dependientes de GPU para el comercio de acciones el 21 de octubre de 2016, pasando de los modelos lineales anteriores basados en CPU. A finales de 2017, la mayoría de sus operaciones comerciales estaban impulsadas por IA.
En 2019, High-Flyer construyó su primer clúster de computación, Fire-Flyer, con un costo de 200 millones de yuanes. El clúster contenía 1,100 GPUs interconectadas a 200 Gbit/s y operó durante 1.5 años antes de ser retirado. Para 2021, Liang había comenzado a comprar grandes cantidades de GPUs de Nvidia, obteniendo supuestamente 10,000 GPUs Nvidia A100 antes de que las restricciones de Estados Unidos sobre las ventas de chips a China entraran en vigor.
La construcción de Fire-Flyer 2 comenzó en 2021 con un presupuesto de 1 billón de yuanes. En 2022, la capacidad del clúster se utilizó en más del 96%, totalizando 56.74 millones de horas de GPU, con un 27% de la capacidad apoyando la computación científica fuera de la empresa. Fire-Flyer 2 inicialmente usó 5,000 GPUs PCIe A100 en 625 nodos, cada uno con 8 GPUs, incorporando posteriormente NVLinks y la Biblioteca de Comunicaciones Colectivas de Nvidia para modelos más grandes.
El 14 de abril de 2023, High-Flyer anunció el lanzamiento de un laboratorio de investigación de inteligencia artificial general (AGI). Dos meses después, el 17 de julio de 2023, ese laboratorio se escindió en una empresa independiente llamada DeepSeek, con High-Flyer como su inversor principal. Inicialmente, los inversores de capital de riesgo se mostraron reacios a proporcionar financiación debido a preocupaciones sobre salidas rápidas.
Lanzamientos de Modelos en 2024
En 2024, DeepSeek lanzó varios modelos significativos bajo su marco de peso abierto. DeepSeek-V2, presentado a principios de 2024, demostró avances en la arquitectura de modelos y la eficiencia del entrenamiento. La empresa continuó refinando sus algoritmos para maximizar la eficiencia computacional, aprovechando hardware más antiguo y reduciendo el consumo de energía debido a las restricciones de chips de Estados Unidos.
DeepSeek-R1, lanzado en enero de 2025 junto con un chatbot homónimo, marcó un hito importante. El modelo ganó reconocimiento internacional por sus capacidades de razonamiento y su enfoque de entrenamiento rentable. Desde enero de 2025, DeepSeek ha lanzado sus modelos bajo licencias de software libre y de código abierto.
Operaciones de la Empresa
DeepSeek tiene su sede en Hangzhou, Zhejiang, con Liang Wenfeng como CEO. A mayo de 2024, Liang poseía personalmente una participación del 84% en DeepSeek a través de dos sociedades instrumentales. La empresa se centra en la investigación y ha declarado que no tiene planes inmediatos de comercialización, lo que le permite eludir ciertas disposiciones de las regulaciones de IA de China dirigidas a tecnologías orientadas al consumidor.
Debido a su marco de peso abierto, los modelos de DeepSeek han sido alojados de forma nativa por proveedores de nube como Microsoft Azure y Perplexity AI. En febrero de 2026, Anthropic acusó a DeepSeek de usar miles de cuentas fraudulentas para generar millones de conversaciones con Claude para entrenar sus propios LLM. En abril de 2026, los inversores comenzaron discusiones para una ronda de financiación de 300 millones de dólares, lo que llevaría a la empresa a una valoración de 10 mil millones de dólares. DeepSeek completó una ronda Serie A en mayo de 2026 recibiendo 7 mil millones de dólares, alcanzando una valoración post-money de 52 mil millones de dólares. En julio de 2026, Bloomberg y el Financial Times informaron sobre preparativos para una OPI tan pronto como en 2027, con otra discusión dirigida a una valoración pre-money de 70 mil millones de dólares.
Marco de Entrenamiento
DeepSeek opera los clústeres de computación Fire-Flyer y Fire-Flyer 2. Fire-Flyer 2, aún en operación a partir de 2025, consiste en una arquitectura de software y hardware co-diseñada. El hardware usa GPUs de Nvidia con interconexiones de 200 Gbps, dividido en dos zonas con soporte de tareas entre zonas. La topología de red usa dos árboles de grasa para un alto ancho de banda de bisección.
Los componentes clave de software incluyen 3FS (Sistema de Archivos Fire-Flyer), un sistema de archivos paralelo distribuido diseñado para lecturas aleatorias asíncronas usando I/O Directo y Lectura RDMA. Dado que cada lectura de datos es aleatoria y no se reutiliza, el almacenamiento en caché no es necesario. Otro componente es hfreduce, una biblioteca de comunicación asíncrona diseñada originalmente para reemplazar las funciones de la Biblioteca de Comunicaciones Colectivas de Nvidia.
Estrategia y Contratación
El enfoque de contratación de DeepSeek enfatiza las habilidades sobre la experiencia laboral extensa, lo que resulta en muchas contrataciones recién salidas de la universidad. La empresa recluta individuos sin antecedentes en informática para expandir la experiencia en áreas como poesía y matemáticas avanzadas. Según The New York Times, docenas de investigadores de DeepSeek tienen o han tenido afiliaciones con laboratorios del Ejército Popular de Liberación y los Siete Hijos de la Defensa Nacional.
Desde 2025, el chatbot de DeepSeek fue adoptado en roles no combatientes por el Ejército Popular de Liberación, incluidos hospitales, la policía armada popular paramilitar y organizaciones de movilización nacional. La empresa también se ha expandido a África, ofreciendo soluciones de IA más asequibles y menos consumidoras de energía, fortaleciendo los modelos de lenguaje africanos y generando startups, por ejemplo en Nairobi. Junto con los servicios de almacenamiento y computación en la nube de Huawei, el impacto de DeepSeek en la escena tecnológica del África subsahariana es considerable, ofreciendo soberanía de datos local y flexibilidad en comparación con las plataformas de IA occidentales.
Recepción e Impacto
Los modelos de DeepSeek han sido reconocidos por su eficiencia y accesibilidad abierta dentro del ecosistema de modelos de lenguaje de gran tamaño. El enfoque de la empresa en la investigación sobre la comercialización la distingue de competidores como OpenAI y Anthropic. Sus innovaciones en entrenamiento, incluidos los clústeres Fire-Flyer y el software personalizado, contribuyen a desarrollos más amplios en aprendizaje automático y aprendizaje profundo.
La expansión de DeepSeek en África y sus soluciones rentables la han posicionado como un actor significativo en la adopción global de IA, particularmente en regiones con infraestructura limitada. El enfoque de peso abierto de la empresa permite la personalización y el despliegue local, fomentando una comunidad creciente de desarrolladores y startups.