DeepSeek-V3 es un modelo de lenguaje de gran tamaño desarrollado por DeepSeek, una empresa china de inteligencia artificial con sede en Hangzhou, Zhejiang. Lanzado en diciembre de 2024, el modelo utiliza una arquitectura de mezcla de expertos (MoE) con 671 mil millones de parámetros en total, de los cuales 37 mil millones se activan por token. Fue diseñado para competir con modelos propietarios de OpenAI, Anthropic y Google DeepMind, mientras se publicaba como un modelo de pesos abiertos, lo que significa que sus parámetros se comparten públicamente, aunque los datos de entrenamiento no están licenciados abiertamente.
El lanzamiento de DeepSeek-V3 marcó un hito significativo en el panorama de la IA generativa, demostrando que modelos de alto rendimiento podían entrenarse eficientemente en hardware más antiguo, en parte debido a las restricciones de Estados Unidos sobre la exportación de chips avanzados a China. La publicación del modelo se acompañó de informes técnicos y pesos abiertos, lo que permitió a investigadores y desarrolladores usarlo y ajustarlo, contribuyendo a su rápida adopción en diversas aplicaciones.
Antecedentes
DeepSeek fue fundada en julio de 2023 por Liang Wenfeng, quien también cofundó High-Flyer, un fondo de cobertura chino que inicialmente se centró en el comercio impulsado por IA. Los orígenes de la empresa se remontan a la inversión de High-Flyer en clústeres de computación basados en GPU, comenzando con Fire-Flyer en 2019, que contenía 1,100 GPUs interconectadas a 200 Gbit/s. Para 2021, High-Flyer había adquirido 10,000 GPUs Nvidia A100 antes de que las restricciones de exportación de Estados Unidos entraran en vigor, lo que permitió la construcción de Fire-Flyer 2, un clúster más grande con 5,000 GPUs PCIe A100 en 625 nodos.
La misión de DeepSeek es avanzar en la investigación de inteligencia artificial general, con un enfoque en modelos de pesos abiertos. La empresa recluta investigadores de las principales universidades chinas y contrata de campos no tradicionales, como la poesía y las matemáticas avanzadas, para ampliar las capacidades del modelo. Este enfoque, combinado con una estrategia centrada en la investigación, ha permitido a DeepSeek innovar en la arquitectura de modelos y la eficiencia del entrenamiento.
Arquitectura del modelo
DeepSeek-V3 emplea una arquitectura de mezcla de expertos, un diseño que divide el modelo en múltiples subredes especializadas, o expertos, y activa solo un subconjunto para cada entrada. Este enfoque reduce el costo computacional mientras mantiene una alta capacidad. El modelo tiene 671 mil millones de parámetros, pero solo 37 mil millones están activos por token, lo que permite una inferencia y un entrenamiento eficientes.
La arquitectura incorpora innovaciones como la atención latente de múltiples cabezas y el equilibrio de carga sin pérdida auxiliar, que mejoran la estabilidad del entrenamiento y el rendimiento. Estas técnicas se basan en trabajos anteriores en modelos transformadores y atención de múltiples cabezas, lo que permite a DeepSeek-V3 manejar contextos largos y tareas de razonamiento complejas de manera efectiva.
Entrenamiento e infraestructura
DeepSeek-V3 se entrenó en Fire-Flyer 2, un clúster de computación codiseñado con software y hardware personalizados. El clúster utiliza GPUs Nvidia con interconexiones de 200 Gbps y una topología de red de árbol graso para un alto ancho de banda de bisección. La pila de software incluye 3FS, un sistema de archivos paralelo distribuido optimizado para lecturas aleatorias asíncronas, y hfreduce, una biblioteca para comunicación asíncrona.
Entrenar un modelo de esta escala requirió recursos computacionales significativos. DeepSeek informó que Fire-Flyer 2 se había utilizado a más del 96% de capacidad en 2022, totalizando 56.74 millones de horas de GPU. El diseño del clúster enfatiza la eficiencia, usando inicialmente GPUs PCIe A100 debido a que los modelos cabían dentro de 40 GB de VRAM, incorporando más tarde NVLinks y NCCL para modelos más grandes que requieren paralelismo de modelos.
El proceso de entrenamiento probablemente utilizó técnicas como variantes de optimizador Adam, programas de tasa de aprendizaje y recorte de gradientes para garantizar la estabilidad. El enfoque de DeepSeek en la eficiencia algorítmica le permitió entrenar modelos competitivos a pesar de las limitaciones de hardware, una estrategia que se ha señalado como una respuesta a las restricciones de chips de Estados Unidos.
Rendimiento y puntos de referencia
DeepSeek-V3 demostró un rendimiento competitivo en varios puntos de referencia, rivalizando con modelos de código cerrado de OpenAI y Google DeepMind. En evaluaciones internas, logró resultados sólidos en comprensión del lenguaje natural, generación de código y razonamiento matemático. Por ejemplo, se informó que superaba a modelos como GPT-4o en ciertas tareas de codificación, aunque la verificación independiente fue limitada en el lanzamiento.
La naturaleza de pesos abiertos del modelo permitió a la comunidad investigadora probar y validar sus capacidades, lo que llevó a una adopción generalizada en entornos académicos y comerciales. Su eficiencia y rendimiento lo hicieron particularmente atractivo para organizaciones con recursos computacionales limitados.
Lanzamiento y recepción
El lanzamiento de DeepSeek-V3 en diciembre de 2024 fue recibido con una atención significativa en la comunidad de IA. Se consideró un punto de prueba de que los modelos de pesos abiertos podían desafiar a los sistemas propietarios, generando debates sobre el futuro del desarrollo de la IA. El modelo fue alojado por proveedores de nube como Azure y Perplexity AI, lo que lo hizo accesible a una amplia audiencia.
Los críticos señalaron que el enfoque de pesos abiertos de DeepSeek, aunque transparente en cuanto a los parámetros, no divulgaba los datos de entrenamiento, lo que planteaba preguntas sobre la procedencia de los datos y posibles sesgos. Además, los vínculos de la empresa con High-Flyer y las afiliaciones de sus investigadores con instituciones de defensa chinas atrajeron escrutinio, aunque DeepSeek declaró que su enfoque está en la investigación.
Impacto y legado
DeepSeek-V3 influyó en desarrollos posteriores en el campo de la IA, incluido el lanzamiento de DeepSeek-R1 en enero de 2025, que incorporó capacidades de razonamiento. El modelo también contribuyó a la tendencia más amplia de IA eficiente, alentando a otras empresas a optimizar para un menor consumo de recursos.
El lanzamiento tuvo implicaciones geopolíticas, destacando la capacidad de las empresas chinas para innovar a pesar de los controles de exportación. También impulsó discusiones sobre la democratización de la IA, ya que los modelos de pesos abiertos permiten un acceso más amplio a tecnología avanzada.
Direcciones futuras
Después de DeepSeek-V3, DeepSeek continuó lanzando modelos bajo licencias de código abierto, expandiendo su cartera. La estrategia de la empresa de centrarse en la investigación y la eficiencia la posiciona como un actor clave en el panorama global de la IA. A partir de 2025, Fire-Flyer 2 seguía operativo, apoyando la investigación y el desarrollo en curso.
La expansión de DeepSeek en África, ofreciendo soluciones de IA asequibles y energéticamente eficientes, indica su ambición de llegar a mercados desatendidos. Los futuros lanzamientos de la empresa probablemente se basarán en las innovaciones introducidas con DeepSeek-V3, influyendo potencialmente en la próxima generación de modelos de lenguaje de gran tamaño.