DeepSeek-R1 enero de 2025

Traducido del inglés

DeepSeek-R1, un modelo de lenguaje grande de pesos abiertos lanzado por la empresa china de IA DeepSeek el 20 de enero de 2025, provocó una venta masiva global en el sector tecnológico y una fuerte caída en el precio de las acciones de Nvidia.

DeepSeek-R1 es un modelo de lenguaje de gran tamaño de pesos abiertos desarrollado por Hangzhou DeepSeek Artificial Intelligence Basic Technology Research Co., Ltd., una empresa china de inteligencia artificial con sede en Hangzhou, Zhejiang. Lanzado el 20 de enero de 2025, el modelo demostró capacidades avanzadas de razonamiento a una fracción del costo de entrenamiento de modelos occidentales comparables, lo que provocó una reacción significativa en el mercado. En cuestión de días, las acciones de Nvidia cayeron bruscamente y las acciones tecnológicas en todo el mundo experimentaron una liquidación mientras los inversores reevaluaban el panorama competitivo de la inteligencia artificial y la demanda de unidades de procesamiento gráfico (GPU) costosas.

El lanzamiento de DeepSeek-R1 fue notable no solo por sus logros técnicos, sino también por sus implicaciones estratégicas. El modelo se puso a disposición bajo una licencia de pesos abiertos, lo que permitió a investigadores y desarrolladores acceder a sus parámetros, aunque los datos de entrenamiento no se divulgaron. Esta apertura contrastó con los enfoques propietarios de los principales laboratorios de IA estadounidenses y subrayó el rápido progreso de las empresas chinas de IA a pesar de los controles de exportación de chips de Estados Unidos. El evento se convirtió en un hito en la carrera global de la IA, destacando tanto las ganancias de eficiencia posibles mediante la innovación algorítmica como la sensibilidad del mercado a los cambios en las cadenas de suministro de IA.

Antecedentes

DeepSeek fue fundada en julio de 2023 por Liang Wenfeng, un entusiasta de la IA y cofundador de High-Flyer, un fondo de cobertura chino. La empresa surgió de la investigación previa de High-Flyer sobre aprendizaje profundo para el comercio financiero. Para 2023, High-Flyer había construido una infraestructura informática sustancial, incluidos clústeres de GPU de Nvidia, que proporcionaron una base para el desarrollo de modelos de DeepSeek. La misión de DeepSeek se centró en avanzar en los modelos de lenguaje de gran tamaño con un énfasis en la investigación más que en la comercialización inmediata. La empresa reclutó investigadores de las mejores universidades chinas y, de manera inusual, de campos no relacionados con la informática, como la poesía y las matemáticas avanzadas, con el objetivo de ampliar el conocimiento y las capacidades de los modelos.

Los modelos de DeepSeek son de pesos abiertos, lo que significa que los parámetros entrenados se comparten públicamente, pero los datos de entrenamiento no están licenciados abiertamente. Desde enero de 2025, DeepSeek ha lanzado sus modelos bajo licencias de software libre y de código abierto. Este enfoque ha facilitado la adopción por parte de terceros, incluidos proveedores de nube como Microsoft Azure y Perplexity AI, que alojan modelos de DeepSeek de forma nativa. La estrategia de la empresa también le permitió sortear ciertas regulaciones chinas de IA dirigidas a tecnologías orientadas al consumidor, ya que su enfoque en la investigación y la distribución abierta redujo la exposición directa al consumidor.

Desarrollo y Entrenamiento

La infraestructura de entrenamiento de DeepSeek evolucionó a partir de los clústeres informáticos anteriores de High-Flyer. El primer clúster, Fire-Flyer, se construyó en 2019 con 1,100 GPU interconectadas a 200 Gbit/s, con un costo de 200 millones de yuanes. Fue retirado después de 1.5 años. Un segundo clúster, Fire-Flyer 2, comenzó su construcción en 2021 con un presupuesto de 1,000 millones de yuanes y comprendía 5,000 GPU PCIe A100 en 625 nodos. Para 2022, su utilización de capacidad superaba el 96%, totalizando 56.74 millones de horas de GPU, con el 27% de la capacidad apoyando la computación científica externa. El clúster utilizó una arquitectura de software y hardware co-diseñada, incluido el Sistema de Archivos Fire-Flyer (3FS) para lecturas aleatorias asíncronas eficientes y la biblioteca hfreduce para comunicación asíncrona.

DeepSeek-R1 se entrenó utilizando una combinación de ajuste fino supervisado y aprendizaje por refuerzo, con un enfoque en tareas de razonamiento. El modelo empleó una arquitectura Transformer (architecture) e incorporó técnicas como atención de múltiples cabezas y redes residuales. El proceso de entrenamiento enfatizó la eficiencia computacional, aprovechando hardware más antiguo y refinamientos algorítmicos para reducir el consumo de energía y el costo. Esta eficiencia fue un factor clave en el impacto del modelo en el mercado, ya que demostró que se podían desarrollar modelos de IA de alto rendimiento sin acceso a los chips más nuevos y costosos.

Lanzamiento y Características Técnicas

DeepSeek-R1 se lanzó el 20 de enero de 2025, junto con un chatbot homónimo. El modelo mostró un fuerte rendimiento en puntos de referencia de razonamiento, matemáticas y codificación, rivalizando o superando a algunos modelos propietarios de laboratorios estadounidenses. Su naturaleza de pesos abiertos permitió a los investigadores inspeccionar y ajustar el modelo, fomentando una comunidad de desarrolladores. El lanzamiento incluyó múltiples versiones, con el modelo insignia y variantes destiladas más pequeñas diseñadas para un despliegue más amplio.

Un aspecto notable de DeepSeek-R1 fue su metodología de entrenamiento, que incorporó aprendizaje por refuerzo a partir de retroalimentación de IA (RLAIF) para mejorar las cadenas de razonamiento. El modelo fue diseñado para generar soluciones paso a paso, mejorando su interpretabilidad y precisión en tareas complejas. Además, DeepSeek empleó técnicas como muestreo top-p y escalado de temperatura para controlar la diversidad de salida. La eficiencia del modelo se atribuyó en parte a innovaciones en poda de modelos y aumento de datos, que redujeron la carga computacional sin sacrificar el rendimiento.

Impacto en el Mercado

Tras el lanzamiento de DeepSeek-R1, los mercados financieros globales experimentaron una reacción significativa. El 27 de enero de 2025, el precio de las acciones de Nvidia cayó aproximadamente un 17%, borrando cientos de miles de millones de dólares en valor de mercado. La liquidación se extendió a otras empresas tecnológicas, incluidas AMD, Broadcom y TSMC, ya que los inversores temían que la demanda de GPU de alta gama pudiera disminuir si los modelos de IA pudieran entrenarse de manera más eficiente. El sector tecnológico en general, incluidos Microsoft (AI) y Alphabet Inc., también experimentó caídas, reflejando preocupaciones sobre las presiones competitivas y el potencial de una menor inversión en infraestructura de IA.

La reacción del mercado fue impulsada por varios factores. El rendimiento de DeepSeek-R1 sugirió que las capacidades de IA de vanguardia podrían lograrse con menos recursos computacionales, socavando la suposición de que los clústeres masivos de GPU eran un requisito previo para la IA avanzada. Además, la disponibilidad de pesos abiertos del modelo amenazaba las ventajas propietarias de las empresas de IA estadounidenses, potencialmente mercantilizando la tecnología de IA. Los analistas señalaron que la liquidación también fue una respuesta a las implicaciones geopolíticas, ya que una empresa china demostró paridad tecnológica a pesar de los controles de exportación de Estados Unidos.

Reacciones de la Industria

Líderes y expertos de la industria ofrecieron respuestas variadas a DeepSeek-R1. Algunos elogiaron la eficiencia del modelo y su enfoque abierto, viéndolo como una fuerza democratizadora en la IA. Otros expresaron preocupaciones sobre la seguridad nacional y el potencial de uso indebido, dado los pesos abiertos del modelo. En febrero de 2026, Anthropic acusó a DeepSeek de utilizar miles de cuentas fraudulentas para generar millones de conversaciones con Claude, su propio modelo de IA, para entrenar los LLM de DeepSeek. Esta alegación destacó las tensiones competitivas entre las empresas de IA estadounidenses y chinas.

El éxito de DeepSeek también provocó discusiones sobre la efectividad de los controles de exportación de Estados Unidos. La empresa había adquirido supuestamente 10,000 GPU A100 de Nvidia antes de que se endurecieran las restricciones, y su progreso continuo sugirió que la innovación algorítmica podría compensar parcialmente las limitaciones de hardware. Algunos observadores pidieron una mayor inversión en investigación nacional de IA, mientras que otros abogaron por políticas de exportación más matizadas.

Contexto Más Amplio

El lanzamiento de DeepSeek-R1 ocurrió en medio de un panorama de IA en rápida evolución. Actores principales como OpenAI, Anthropic y Google DeepMind estaban desarrollando modelos cada vez más capaces, pero su naturaleza propietaria limitaba el escrutinio externo. El enfoque de pesos abiertos de DeepSeek ofreció una alternativa, permitiendo la verificación y adaptación independientes. El modelo también tuvo implicaciones para la accesibilidad de la IA en regiones en desarrollo, ya que su eficiencia y licencia abierta hicieron factible su despliegue en hardware menos potente.

La expansión de DeepSeek en África, ofreciendo soluciones de IA asequibles y energéticamente eficientes, fue parte de esta tendencia más amplia. La empresa colaboró con startups locales y proveedores de nube, como Huawei, para mejorar los modelos de lenguaje africanos y apoyar la soberanía de datos local. Esto contrastó con las plataformas de IA occidentales, que a menudo requerían una infraestructura sustancial y planteaban preocupaciones sobre la privacidad de los datos.

Consecuencias

En los meses posteriores al lanzamiento, DeepSeek continuó desarrollando su tecnología y expandiendo su presencia. La empresa anunció planes para una ronda de financiación Serie A en mayo de 2026, recaudando 7,000 millones de dólares estadounidenses con una valoración post-money de 52,000 millones de dólares. Informes de una posible OPI tan pronto como 2027 surgieron en julio de 2026, con discusiones dirigidas a una valoración pre-money de 70,000 millones de dólares. Estos desarrollos señalaron la confianza de los inversores en la trayectoria de DeepSeek, a pesar de la turbulencia anterior del mercado.

La caída de las acciones de Nvidia y la liquidación tecnológica se convirtieron en un caso de estudio sobre cómo los avances en IA pueden perturbar los mercados financieros. Subrayó la importancia de monitorear los avances tecnológicos y su potencial para remodelar la dinámica de la industria. Para DeepSeek, el evento solidificó su reputación como un actor importante en la carrera global de la IA, desafiando el dominio de los gigantes tecnológicos estadounidenses y provocando una reevaluación de las estrategias de inversión en IA en todo el mundo.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:artificial-intelligence·large-language-model·technology-event·market-impact
Esta página se editó por última vez el 13 sept 2026 por AI Wiki Bot · Historial