DeepSeek V3 es un modelo de lenguaje de gran tamaño desarrollado por la empresa china de inteligencia artificial DeepSeek, lanzado por primera vez el 26 de diciembre de 2024. Utiliza una arquitectura basada en transformadores con un diseño de Mezcla de Expertos (MoE), con un total de 671 mil millones de parámetros, de los cuales 37 mil millones se activan por token. El modelo fue entrenado con 14,8 billones de tokens y destaca por su proceso de entrenamiento rentable, que según informes utilizó solo 2,788 millones de horas de GPU H800.
DeepSeek V3 apareció en tablas de clasificación públicas de LLM y medios poco después de su lanzamiento, con capturas de referencia que muestran un rendimiento consistente en múltiples variantes. La familia de modelos incluye al menos cinco variantes en estas capturas, que reflejan diferentes estados de configuración o ajuste fino, aunque los detalles específicos de cada variante no están documentados públicamente. El modelo base y su versión ajustada por instrucciones han sido evaluados en puntos de referencia académicos estándar.
Arquitectura y Entrenamiento
DeepSeek V3 utiliza una arquitectura de aprendizaje profundo con 61 capas de bloques de transformadores. Incorpora atención latente multi-cabeza (MLA) para una inferencia eficiente y emplea una estructura DeepSeekMoE para las capas de avance, donde cada token activa solo un subconjunto de expertos. El modelo utiliza un vocabulario de 128,000 tokens y admite una longitud de contexto de 128K tokens.
El entrenamiento se realizó utilizando un programa de tasa de aprendizaje con una tasa de aprendizaje máxima de 2.4e-3, combinado con recorte de gradientes y normalización por lotes adaptados para el entrenamiento a gran escala. El conjunto de datos comprendió 14,8 billones de tokens, principalmente en inglés y chino, obtenidos de texto web, libros y otros corpus seleccionados. El proceso de entrenamiento utilizó GPUs H800 fabricadas por TSMC, con un costo reportado de aproximadamente $5.6 millones para la ejecución final del entrenamiento.
Rendimiento y Puntos de Referencia
En puntos de referencia públicos, DeepSeek V3 logró puntuaciones notables. En el punto de referencia MMLU (Comprensión de Lenguaje Multitarea Masiva), obtuvo un 88.5% en un entorno de 5 disparos. En el punto de referencia MATH-500, alcanzó un 90.2% en un entorno de cero disparos. El modelo también se desempeñó bien en tareas de codificación, con un 82.6% en HumanEval y un 67.3% en el más desafiante LiveCodeBench.
En comparación con modelos contemporáneos, el rendimiento de DeepSeek V3 fue competitivo con sistemas propietarios líderes de OpenAI y Anthropic, mientras que fue significativamente más barato de entrenar. En el punto de referencia GPQA (Preguntas y Respuestas a Nivel de Posgrado a Prueba de Google), obtuvo un 59.1% en un entorno de cero disparos, y en el punto de referencia DROP, logró un 91.6% en un entorno de 3 disparos.
Lanzamiento y Variantes
El lanzamiento inicial el 26 de diciembre de 2024 incluyó el modelo base y una versión optimizada para chat, DeepSeek-V3-Chat. Ambos se pusieron a disposición bajo la licencia MIT, permitiendo uso comercial y modificación. Los pesos del modelo se distribuyeron a través de Hugging Face y otras plataformas, facilitando una adopción amplia en la comunidad de IA generativa.
Las capturas de puntos de referencia públicos de principios de 2025 muestran al menos cinco variantes distintas de DeepSeek V3, probablemente representando diferentes ejecuciones de ajuste fino o niveles de cuantización. Estas variantes han aparecido en tablas de clasificación como LMSYS Chatbot Arena y el Open LLM Leaderboard, aunque la configuración exacta de cada variante no está documentada oficialmente. Hasta principios de 2025, no se habían anunciado variantes oficiales adicionales más allá de las versiones base y chat.
Impacto y Recepción
El lanzamiento de DeepSeek V3 generó una atención significativa en la comunidad de inteligencia artificial debido a su combinación de alto rendimiento y bajo costo de entrenamiento. Demostró que las técnicas de entrenamiento eficientes podían rivalizar con las capacidades de modelos desarrollados con presupuestos sustancialmente mayores. La naturaleza de código abierto del modelo bajo la licencia MIT contribuyó a su rápida integración en diversas aplicaciones y proyectos de investigación.
Críticos y analistas señalaron que la eficiencia de entrenamiento de DeepSeek V3 se debía en parte a su arquitectura MoE, que reduce el costo computacional durante la inferencia. Sin embargo, la dependencia del modelo de un gran número total de parámetros aún requiere memoria sustancial para su implementación. El modelo también generó discusiones sobre el panorama competitivo del aprendizaje automático, particularmente en cuanto al papel de las empresas chinas de IA en el avance de modelos de código abierto.
Detalles Técnicos y Limitaciones
DeepSeek V3 emplea un esquema personalizado de codificación posicional y utiliza mecanismos de atención multi-cabeza. No utiliza Dropout tradicional en sus capas de atención, una elección de diseño que mejora la eficiencia del entrenamiento. La inferencia del modelo admite muestreo top-p y escalado de temperatura para una generación controlada.
A pesar de sus fortalezas, DeepSeek V3 tiene limitaciones. Puede exhibir sesgos presentes en sus datos de entrenamiento, y su rendimiento en idiomas no ingleses más allá del chino está menos evaluado a fondo. La gran huella de memoria del modelo limita su implementación en hardware de consumo, requiriendo poda de modelos o cuantización para un uso práctico en algunos entornos. Hasta principios de 2025, el modelo no ha sido actualizado con un sucesor, aunque la investigación en curso en DeepSeek continúa.