DeepSeek V3.1 es una familia de modelos de lenguaje de gran tamaño desarrollada por la empresa china de inteligencia artificial DeepSeek. Lanzada en 2025, es la sucesora de DeepSeek V3, que se había presentado a finales de 2024. La familia V3.1 incluye cuatro variantes que han aparecido en clasificaciones públicas de LLM y medios, aunque la empresa no ha publicado especificaciones técnicas detalladas para todas ellas. Los modelos están diseñados para tareas generales de generación de texto, razonamiento y codificación, y están disponibles bajo una licencia de código abierto.
El desarrollo de DeepSeek V3.1 se basa en la arquitectura Transformer (architecture), utilizando específicamente un diseño de Mezcla de Expertos (MoE) que activa solo un subconjunto de parámetros por token, mejorando la eficiencia computacional. La familia de modelos forma parte de la tendencia más amplia en IA generativa hacia sistemas cada vez más grandes y capaces, compitiendo con ofertas de OpenAI, Anthropic y Google DeepMind. DeepSeek ha posicionado V3.1 como una alternativa rentable, con costos de entrenamiento e inferencia significativamente más bajos que muchos de sus homólogos occidentales.
Arquitectura y Entrenamiento
DeepSeek V3.1 emplea una red neuronal con una arquitectura de Mezcla de Expertos, donde cada token es procesado por un pequeño número de módulos expertos. Este diseño reduce el costo computacional por token mientras mantiene una alta capacidad del modelo. El modelo base, DeepSeek V3, tenía 671 mil millones de parámetros totales con 37 mil millones activados por token; V3.1 probablemente sigue una estructura similar, aunque los recuentos exactos de parámetros para las nuevas variantes no se han divulgado oficialmente. Los modelos se entrenan utilizando técnicas de aprendizaje profundo, incluido el ajuste fino supervisado y el aprendizaje por refuerzo con retroalimentación humana (RLHF), para alinear las salidas con las preferencias humanas.
Los datos de entrenamiento para V3.1 incluyen un gran corpus de texto multilingüe, con un enfoque en inglés y chino. La empresa no ha revelado detalles específicos sobre el tamaño o la composición del conjunto de datos, pero se sabe que DeepSeek utiliza una combinación de datos web públicos y fuentes propietarias. El proceso de entrenamiento aprovecha clústeres de GPU, y DeepSeek ha publicado investigaciones sobre la optimización de la eficiencia del entrenamiento, incluido el uso de entrenamiento de precisión mixta FP8.
Variantes y Puntos de Referencia
Se han identificado cuatro variantes de DeepSeek V3.1 en capturas de puntos de referencia públicos, que probablemente difieren en el recuento de parámetros o el ajuste fino. Estas variantes se han evaluado en puntos de referencia estándar de LLM, como MMLU (conocimiento), HumanEval (generación de código) y MATH (razonamiento matemático). Por ejemplo, una variante supuestamente logra una puntuación del 88.5% en MMLU, superando el 86.2% del V3 original en la misma prueba. En HumanEval, una variante obtiene un 82.3%, en comparación con el 78.1% del V3. Estas puntuaciones colocan a V3.1 entre los modelos de peso abierto con mejor rendimiento, aunque los números específicos varían según la variante y la configuración de evaluación.
En clasificaciones de medios, como la puntuación Elo de LMArena (Chatbot Arena), las variantes de DeepSeek V3.1 han logrado puntuaciones Elo en el rango de 1300-1400, comparables a modelos propietarios como GPT-4o y Claude 3.5 Sonnet. Sin embargo, las puntuaciones Elo exactas están sujetas a cambios a medida que se recopilan más votos de usuarios. Los modelos también muestran un fuerte rendimiento en tareas de codificación, con una variante que logra una puntuación pass@1 del 75.4% en el punto de referencia SWE-bench, que prueba problemas reales de ingeniería de software.
Lanzamiento y Disponibilidad
DeepSeek V3.1 se lanzó a principios de 2025, con las primeras variantes apareciendo en la API de la empresa y como descargas de código abierto. Los modelos se distribuyen bajo la licencia MIT, lo que permite uso comercial y de investigación. DeepSeek ha puesto los pesos del modelo a disposición en Hugging Face, y el código para la inferencia se proporciona en GitHub. La empresa también ofrece una API con precios significativamente más bajos que los modelos comparables de OpenAI o Anthropic - por ejemplo, los tokens de entrada se cobran a $0.27 por millón, y los tokens de salida a $1.10 por millón, a partir de la fecha de lanzamiento.
El lanzamiento fue acompañado por un informe técnico que detalla la metodología de entrenamiento y los resultados de evaluación, aunque algunos detalles específicos, como el número exacto de tokens de entrenamiento, se omiten. DeepSeek también ha publicado un artículo sobre el uso de atención de múltiples cabezas y codificación posicional en la arquitectura del modelo, contribuyendo a la literatura académica más amplia sobre aprendizaje automático.
Recepción e Impacto
El lanzamiento de DeepSeek V3.1 generó una atención significativa en la comunidad de IA debido a su rendimiento competitivo a una fracción del costo de los modelos propietarios. Fue ampliamente discutido en redes sociales y en la prensa tecnológica, con algunos comentaristas señalando que demuestra el rápido progreso de las empresas chinas de IA. La naturaleza de código abierto del modelo ha facilitado su adopción en investigación e industria, y se ha integrado en varias herramientas y plataformas de terceros.
Sin embargo, algunos expertos han planteado preocupaciones sobre la falta de transparencia en cuanto a los datos de entrenamiento y los posibles sesgos. DeepSeek no ha publicado una ficha de modelo detallada, y no se han realizado auditorías independientes. A partir de 2025, el modelo aún está en desarrollo activo, y se esperan futuras actualizaciones.
Comparación con Predecesores
DeepSeek V3.1 mejora a V3 en varias áreas clave, incluidos el razonamiento, la codificación y la comprensión multilingüe. La empresa informa que V3.1 logra una mejora promedio del 2.3% en 12 puntos de referencia estándar en comparación con V3. Por ejemplo, en el punto de referencia MMLU, V3.1 obtiene un 88.5% frente al 86.2% del V3, y en el punto de referencia HumanEval, obtiene un 82.3% frente al 78.1%. Las mejoras se atribuyen a mejores datos de entrenamiento, un ajuste fino más refinado y ajustes arquitectónicos.
A diferencia de V3, que tenía un solo modelo, V3.1 es una familia de variantes, lo que permite a los usuarios elegir un modelo que equilibre rendimiento y uso de recursos. Este enfoque es similar al de otros proveedores, como OpenAI con GPT-4o y GPT-4o mini, aunque las variantes de DeepSeek son todas de peso abierto. El lanzamiento de V3.1 también incluye un tokenizador y una longitud de contexto actualizados, con soporte para hasta 128K tokens, igualando las capacidades de los modelos líderes.
Direcciones Futuras
DeepSeek continúa iterando en su familia de modelos, y se espera que V3.1 sea seguido por más actualizaciones. La empresa ha insinuado trabajo en capacidades multimodales, lo que permitiría al modelo procesar imágenes y audio además de texto. A partir de 2025, no se ha anunciado una fecha oficial de lanzamiento para un V4, pero el rápido ritmo de desarrollo sugiere que nuevas versiones aparecerán dentro del año. El impacto de los modelos de DeepSeek en el panorama más amplio de la IA sigue siendo un tema de interés, particularmente en el contexto de la competencia global en inteligencia artificial.