Em janeiro de 2025, a DeepSeek, uma empresa chinesa de inteligência artificial sediada em Hangzhou, lançou seu modelo de raciocínio de pesos abertos, o DeepSeek-R1. O lançamento desencadeou uma queda significativa nas bolsas de valores globais, afetando particularmente as ações de tecnologia, e provocou uma ampla reavaliação do cenário competitivo e das premissas de investimento da indústria de IA. O evento destacou o rápido progresso dos laboratórios chineses de IA e o potencial para um desenvolvimento de modelos mais eficiente e de menor custo.
A DeepSeek, fundada em julho de 2023 por Liang Wenfeng, é propriedade e financiada pela High-Flyer, um fundo de hedge chinês. A empresa concentra-se no desenvolvimento de modelos de linguagem de grande porte (LLMs) de pesos abertos, compartilhando os parâmetros do modelo publicamente, mantendo os dados de treinamento proprietários. O DeepSeek-R1, lançado juntamente com um chatbot homônimo, demonstrou capacidades avançadas de raciocínio comparáveis aos principais modelos ocidentais, mas a uma fração do custo de treinamento relatado. Essa conquista desafiou as noções predominantes de que a IA de ponta exigia recursos computacionais massivos e grandes despesas de capital.
Impacto no Mercado
Em 27 de janeiro de 2025, o lançamento do DeepSeek-R1 causou um declínio acentuado nas ações de tecnologia globais. A Nvidia, principal fabricante de GPUs, viu o preço de suas ações cair aproximadamente 17%, eliminando cerca de US$ 589 bilhões em valor de mercado, a maior perda em um único dia para qualquer empresa na história do mercado de ações dos EUA. Outros fabricantes de chips e empresas relacionadas à IA, incluindo AMD, Broadcom e TSMC, também sofreram declínios significativos. A liquidação se espalhou para os mercados europeus e asiáticos, com índices como o Nikkei 225 e o Nasdaq Composite, com forte peso tecnológico, caindo notavelmente.
A reação do mercado foi impulsionada pelas preocupações dos investidores de que os métodos de treinamento eficientes da DeepSeek pudessem reduzir a demanda por hardware caro de IA, especialmente GPUs de alta qualidade. A DeepSeek teria treinado o R1 usando cerca de 2.048 GPUs Nvidia H800 ao longo de dois meses, a um custo de aproximadamente US$ 5,6 milhões, uma fração das centenas de milhões gastos por laboratórios ocidentais como OpenAI e Google DeepMind. Isso levantou questões sobre a sustentabilidade das enormes despesas de capital dos principais provedores de nuvem e empresas de IA.
Reavaliação da Indústria
O lançamento provocou uma reavaliação das estratégias de desenvolvimento de IA em toda a indústria. Executivos de grandes empresas de tecnologia, incluindo Microsoft e Alphabet, reconheceram publicamente as conquistas da DeepSeek e as implicações para a eficiência da IA. Alguns analistas sugeriram que o evento poderia acelerar a adoção de modelos de pesos abertos e estimular a inovação na otimização de modelos, em vez da expansão bruta de computação.
O sucesso da DeepSeek foi atribuído a várias inovações técnicas, incluindo o uso de aprendizado por reforço (RL) para aprimorar as capacidades de raciocínio e a implementação de arquiteturas mistura de especialistas (MoE) que ativam apenas um subconjunto de parâmetros por token, reduzindo a carga computacional. A empresa também refinou seus algoritmos de treinamento para maximizar a eficiência em hardware mais antigo, em parte devido às restrições de exportação dos EUA sobre chips avançados para a China.
Histórico da DeepSeek
A DeepSeek foi estabelecida como uma empresa independente em 17 de julho de 2023, desmembrada do laboratório de pesquisa de inteligência artificial geral (AGI) da High-Flyer, que havia sido anunciado em 14 de abril de 2023. A High-Flyer, cofundada por Liang Wenfeng em junho de 2015, usava aprendizado profundo baseado em GPU para negociação de ações desde 21 de outubro de 2016. A empresa construiu seu primeiro cluster de computação, Fire-Flyer, em 2019, e posteriormente construiu o Fire-Flyer 2, um cluster maior com 5.000 GPUs Nvidia A100, concluído em 2021.
A estratégia de contratação da DeepSeek enfatiza habilidades em vez de experiência, recrutando muitos recém-formados e indivíduos de áreas não relacionadas à ciência da computação para ampliar o conhecimento dos modelos. A empresa afirmou que se concentra em pesquisa e não tem planos imediatos de comercialização, o que lhe permite operar sob certas isenções regulatórias na China.
Inovações Técnicas
O DeepSeek-R1 é um modelo de raciocínio que usa um pipeline de treinamento em múltiplos estágios. Ele emprega aprendizado por reforço para melhorar o raciocínio de cadeia de pensamento e usa ajuste fino supervisionado (SFT) com dados selecionados. A arquitetura do modelo incorpora camadas de atenção multi-cabeça e mistura de especialistas, permitindo uma escalabilidade eficiente. A DeepSeek também introduziu uma abordagem inovadora para RL que evita a necessidade de um modelo de recompensa separado, usando recompensas baseadas em regras para tarefas com respostas verificáveis.
A infraestrutura de treinamento, conhecida como Fire-Flyer 2, consiste em uma arquitetura de software e hardware co-projetada. Ela usa GPUs Nvidia com interconexões de 200 Gbps e uma topologia de rede de duas árvores gordas para alta largura de banda de bisecção. A pilha de software inclui o 3FS (Fire-Flyer File System), um sistema de arquivos paralelo distribuído otimizado para leituras aleatórias assíncronas, e o hfreduce, uma biblioteca para comunicação assíncrona.
Cenário Competitivo
O lançamento do DeepSeek-R1 intensificou a concorrência na indústria de IA, particularmente entre empresas dos EUA e da China. Demonstrou que laboratórios chineses poderiam alcançar resultados de ponta apesar das restrições de hardware. A abordagem de pesos abertos da DeepSeek contrasta com os modelos fechados da OpenAI e da Anthropic, e foi adotada por alguns desenvolvedores ocidentais por sua transparência e personalização.
Principais provedores de nuvem, incluindo o microsoft-azure e a Perplexity AI, começaram a hospedar modelos da DeepSeek nativamente, integrando-os ainda mais ao ecossistema global de IA. O evento também gerou discussões sobre segurança de IA e controles de exportação, com alguns formuladores de políticas pedindo regulamentações mais rígidas sobre modelos de pesos abertos.
Implicações de Longo Prazo
O choque no mercado serviu como um alerta para investidores e empresas de tecnologia, destacando o potencial de inovação disruptiva de fontes inesperadas. Ele ressaltou a importância da eficiência algorítmica e a possibilidade de alcançar alto desempenho com menos recursos. No início de 2025, os efeitos de longo prazo sobre a demanda por hardware de IA e a estrutura da indústria permaneciam incertos, mas o evento marcou um ponto de virada na corrida global de IA.
A ascensão da DeepSeek também levantou questões geopolíticas, pois os pesquisadores da empresa têm afiliações com laboratórios militares chineses, e seu chatbot foi adotado pelo Exército de Libertação Popular para funções não combatentes desde março de 2025. Esses desenvolvimentos adicionaram uma camada de complexidade ao cenário internacional de IA.
Conclusão
O lançamento do DeepSeek-R1 e o subsequente choque no mercado representaram um momento crucial na história da inteligência artificial. Demonstrou que modelos de pesos abertos poderiam rivalizar com sistemas proprietários, desafiou suposições sobre a necessidade de computação massiva e reformulou as expectativas dos investidores. O evento acelerou discussões sobre eficiência de IA, colaboração de código aberto e o equilíbrio global do poder de IA, com implicações que continuaram a se desenrolar ao longo de 2025.