DeepSeek-R1 é um modelo de linguagem de grande porte de pesos abertos desenvolvido pela Hangzhou DeepSeek Artificial Intelligence Basic Technology Research Co., Ltd., uma empresa chinesa de IA sediada em Hangzhou, Zhejiang, e financiada pelo fundo de hedge High-Flyer. Lançado em janeiro de 2025 juntamente com o chatbot DeepSeek, o modelo demonstrou capacidades avançadas de raciocínio comparáveis às dos principais sistemas proprietários, enquanto sua eficiência de treinamento relatada e disponibilidade aberta provocaram uma queda significativa nas ações de tecnologia globais, afetando particularmente a Nvidia e outros fabricantes de chips.
O lançamento marcou um momento notável no campo da inteligência artificial, pois desafiou suposições sobre a necessidade de recursos computacionais massivos para modelos de linguagem de grande porte de última geração. A estrutura de pesos abertos do DeepSeek-R1 permitiu que pesquisadores e desenvolvedores em todo o mundo baixassem e adaptassem o modelo, contribuindo para sua rápida adoção e para a reação do mercado.
Antecedentes e Origens da Empresa
A DeepSeek foi fundada em julho de 2023 por Liang Wenfeng, que havia cofundado a High-Flyer em junho de 2015. A High-Flyer começou a usar modelos de aprendizado profundo dependentes de GPU para negociação de ações em 21 de outubro de 2016, fazendo a transição de modelos lineares baseados em CPU. No final de 2017, a maioria de suas decisões de negociação era conduzida por IA.
Em 2019, a High-Flyer construiu seu primeiro cluster de computação, o Fire-Flyer, a um custo de 200 milhões de yuans, contendo 1.100 GPUs interconectadas a 200 Gbit/s. O cluster foi aposentado após 1,5 anos. Em 2021, Liang havia adquirido aproximadamente 10.000 GPUs Nvidia A100 antes que as restrições dos EUA sobre vendas de chips à China entrassem em vigor.
O cluster Fire-Flyer 2, construído a partir de 2021 com um orçamento de 1 bilhão de yuans, tornou-se operacional com 5.000 GPUs PCIe A100 em 625 nós. Em 2022, sua utilização de capacidade excedeu 96%, totalizando 56,74 milhões de horas de GPU, com 27% da capacidade apoiando computação científica externa. O cluster inicialmente usava apenas conexões PCIe porque os modelos cabiam na VRAM de 40 GB de uma única GPU, exigindo apenas paralelismo de dados; posteriormente, NVLink e NCCL foram adicionados para modelos maiores que necessitavam de paralelismo de modelo.
Fundação e Estrutura Corporativa
Em 14 de abril de 2023, a High-Flyer anunciou a criação de um laboratório de pesquisa em inteligência artificial geral (AGI). Dois meses depois, em 17 de julho de 2023, esse laboratório foi desmembrado como uma empresa independente chamada DeepSeek, com a High-Flyer como sua principal investidora. Investidores de capital de risco inicialmente relutaram em financiar o empreendimento, duvidando de sua capacidade de gerar um retorno rápido.
A DeepSeek tem sede em Hangzhou, Zhejiang, e permanece de propriedade e financiada pela High-Flyer. Liang Wenfeng atua como CEO e, a partir de maio de 2024, detinha pessoalmente uma participação de 84% por meio de duas empresas de fachada. A empresa manteve uma estratégia focada em pesquisa, declarando não ter planos imediatos de comercialização, o que também lhe permite evitar certas regulamentações chinesas de IA voltadas para tecnologias voltadas ao consumidor.
O Modelo DeepSeek-R1
O DeepSeek-R1 foi lançado em janeiro de 2025 como um modelo de raciocínio de pesos abertos. Ao contrário de modelos proprietários de empresas como OpenAI ou Anthropic, os parâmetros exatos do DeepSeek-R1 foram compartilhados publicamente, embora seus dados de treinamento não tenham sido licenciados abertamente. O modelo demonstrou forte desempenho em benchmarks de raciocínio, rivalizando ou excedendo, segundo relatos, alguns dos principais modelos ocidentais em tarefas específicas.
O desenvolvimento do modelo beneficiou-se do refinamento contínuo de algoritmos pela DeepSeek para maximizar a eficiência computacional, uma necessidade dada as restrições de exportação de chips dos EUA. Esse foco em eficiência permitiu que a DeepSeek alcançasse resultados competitivos usando hardware mais antigo ou menos potente, reduzindo o consumo de energia e os custos de treinamento.
Impacto no Mercado Global
Após o lançamento do DeepSeek-R1, as ações de tecnologia globais sofreram uma queda acentuada. Os investidores reagiram à possibilidade de que os altos gastos de capital das principais empresas de IA pudessem não ser necessários para alcançar capacidades avançadas de IA. A Nvidia, fornecedora chave de GPUs para treinamento de IA, viu seu valor de mercado cair significativamente, e outros fabricantes de chips e provedores de nuvem também foram afetados.
A queda refletiu preocupações de que modelos de pesos abertos como o DeepSeek-R1 pudessem comoditizar o desenvolvimento de IA, reduzindo a vantagem competitiva de empresas que investiram pesadamente em modelos e infraestrutura proprietários. O evento foi amplamente coberto pela mídia financeira e gerou debates sobre a sustentabilidade do boom de investimentos em IA.
Adoção e Ecossistema
Devido à sua estrutura de pesos abertos, o DeepSeek-R1 e outros modelos da DeepSeek foram hospedados nativamente por provedores de nuvem, incluindo Microsoft Azure e Perplexity AI. A disponibilidade do modelo em plataformas principais facilitou sua integração em vários aplicativos e projetos de pesquisa.
A DeepSeek também se expandiu para a África, oferecendo soluções de IA mais acessíveis e com menor consumo de energia. A empresa fortaleceu modelos de línguas africanas e gerou uma série de startups, por exemplo, em Nairóbi. Juntamente com os serviços de armazenamento e computação em nuvem da Huawei, o impacto da DeepSeek no cenário tecnológico da África subsaariana tem sido considerável, proporcionando soberania local de dados e mais flexibilidade em comparação com plataformas ocidentais de IA.
Infraestrutura de Treinamento
A estrutura de treinamento da DeepSeek depende dos clusters Fire-Flyer, com o Fire-Flyer 2 ainda em operação em 2025. O cluster apresenta arquitetura de software e hardware co-projetada. No lado do hardware, as GPUs Nvidia usam interconexões de 200 Gbps, e a topologia de rede consiste em duas árvores gordas para alta largura de banda de bissecção. O cluster é dividido em duas zonas, suportando tarefas entre zonas.
No lado do software, os componentes principais incluem:
- 3FS (Fire-Flyer File System): Um sistema de arquivos paralelo distribuído projetado para leituras aleatórias assíncronas, usando Direct I/O e RDMA Read. Ao contrário do Buffered I/O padrão, o Direct I/O não armazena dados em cache, o que é eficiente para leituras aleatórias onde os dados não são reutilizados.
- hfreduce: Uma biblioteca para comunicação assíncrona, originalmente projetada para substituir o NCCL da Nvidia em certos cenários, melhorando a escalabilidade e o desempenho.
Essas inovações permitiram que a DeepSeek treinasse modelos grandes de forma eficiente apesar das restrições de hardware, contribuindo para a relação custo-benefício demonstrada pelo DeepSeek-R1.
Desenvolvimentos Posteriores
Em fevereiro de 2026, a Anthropic acusou a DeepSeek de usar milhares de contas fraudulentas para gerar milhões de conversas com o Claude para treinar seus próprios modelos. Em abril de 2026, investidores iniciaram discussões para uma rodada de financiamento de US$ 300 milhões, que avaliaria a DeepSeek em US$ 10 bilhões. A empresa concluiu uma rodada Série A em maio de 2026 recebendo US$ 7 bilhões, alcançando uma avaliação pós-dinheiro de US$ 52 bilhões.
Em julho de 2026, a Bloomberg e o Financial Times relataram que a DeepSeek havia iniciado preparativos para uma oferta pública inicial (IPO), possivelmente listando já em 2027. No mesmo mês, a empresa iniciou outra discussão de financiamento visando uma avaliação pré-dinheiro de US$ 70 bilhões.
A abordagem de contratação da DeepSeek enfatiza habilidades em vez de longa experiência de trabalho, resultando em muitas contratações recém-saídas da universidade. A empresa também recruta indivíduos sem formação em ciência da computação para expandir a expertise em áreas como poesia e matemática avançada. De acordo com o The New York Times, dezenas de pesquisadores da DeepSeek têm ou tiveram afiliações com laboratórios do Exército de Libertação Popular e os Sete Filhos da Defesa Nacional. Desde 2025, seu chatbot foi adotado em funções não combatentes pelo Exército de Libertação Popular, incluindo hospitais, a Polícia Armada Popular e organizações de mobilização nacional.
Conclusão
O lançamento do DeepSeek-R1 em janeiro de 2025 representou um marco significativo no cenário da IA generativa, demonstrando que modelos de pesos abertos poderiam alcançar desempenho competitivo com requisitos de recursos menores. A queda nas ações de tecnologia globais destacou o potencial disruptivo do modelo, enquanto rodadas de financiamento subsequentes e preparativos para IPO indicaram forte interesse dos investidores. O foco contínuo da DeepSeek em eficiência e disponibilidade aberta a posiciona como um player notável no ecossistema de IA em evolução.