DeepSeek é uma empresa chinesa de inteligência artificial que desenvolve modelos de linguagem de grande porte (LLMs) de pesos abertos. Com sede em Hangzhou, Zhejiang, é propriedade e financiada pela High-Flyer, um fundo de hedge chinês. A empresa foi fundada em julho de 2023 por Liang Wenfeng e foca no desenvolvimento de IA orientado à pesquisa, com seus modelos disponibilizados publicamente sob licenças de pesos abertos.
A abordagem da DeepSeek enfatiza a eficiência computacional e o recrutamento amplo, além dos campos tradicionais da ciência da computação. Seus modelos foram hospedados por grandes provedores de nuvem e ganharam atenção internacional por seu desempenho e acessibilidade, especialmente em regiões que buscam alternativas às plataformas ocidentais de IA.
Fundação e História Inicial
A DeepSeek tem suas origens na High-Flyer, cofundada por Liang Wenfeng em junho de 2015. A High-Flyer começou a usar modelos de aprendizado profundo dependentes de GPU para negociação de ações em 21 de outubro de 2016, fazendo a transição de modelos lineares anteriores baseados em CPU. No final de 2017, a maior parte de suas operações de negociação era impulsionada por IA.
Em 2019, a High-Flyer construiu seu primeiro cluster de computação, o Fire-Flyer, a um custo de 200 milhões de yuans. O cluster continha 1.100 GPUs interconectadas a 200 Gbit/s e operou por 1,5 anos antes de ser desativado. Em 2021, Liang havia começado a comprar grandes quantidades de GPUs Nvidia, supostamente obtendo 10.000 GPUs Nvidia A100 antes que as restrições dos Estados Unidos sobre vendas de chips à China entrassem em vigor.
A construção do Fire-Flyer 2 começou em 2021 com um orçamento de 1 bilhão de yuans. Em 2022, a capacidade do cluster foi usada em mais de 96%, totalizando 56,74 milhões de horas de GPU, com 27% da capacidade apoiando a computação científica fora da empresa. O Fire-Flyer 2 inicialmente usou 5.000 GPUs A100 PCIe em 625 nós, cada um contendo 8 GPUs, incorporando posteriormente NVLinks e a Nvidia Collective Communications Library para modelos maiores.
Em 14 de abril de 2023, a High-Flyer anunciou o lançamento de um laboratório de pesquisa em inteligência artificial geral (AGI). Dois meses depois, em 17 de julho de 2023, esse laboratório foi transformado em uma empresa independente chamada DeepSeek, com a High-Flyer como sua principal investidora. Inicialmente, os investidores de capital de risco relutavam em fornecer financiamento devido a preocupações com saídas rápidas.
Lançamentos de Modelos em 2024
Em 2024, a DeepSeek lançou vários modelos significativos sob sua estrutura de pesos abertos. O DeepSeek-V2, introduzido no início de 2024, demonstrou avanços na arquitetura de modelos e na eficiência de treinamento. A empresa continuou refinando seus algoritmos para maximizar a eficiência computacional, aproveitando hardware mais antigo e reduzindo o consumo de energia devido às restrições de chips dos EUA.
O DeepSeek-R1, lançado em janeiro de 2025 junto com um chatbot homônimo, marcou um grande marco. O modelo ganhou reconhecimento internacional por suas capacidades de raciocínio e abordagem de treinamento econômica. Desde janeiro de 2025, a DeepSeek lançou seus modelos sob licenças de software livre e de código aberto.
Operações da Empresa
A DeepSeek tem sede em Hangzhou, Zhejiang, com Liang Wenfeng atuando como CEO. Em maio de 2024, Liang detinha pessoalmente uma participação de 84% na DeepSeek por meio de duas empresas de fachada. A empresa foca em pesquisa e declarou que não tem planos imediatos de comercialização, o que lhe permite contornar certas disposições das regulamentações de IA da China voltadas para tecnologias voltadas ao consumidor.
Devido à sua estrutura de pesos abertos, os modelos da DeepSeek foram hospedados nativamente por provedores de nuvem, incluindo Microsoft Azure e Perplexity AI. Em fevereiro de 2026, a Anthropic acusou a DeepSeek de usar milhares de contas fraudulentas para gerar milhões de conversas com o Claude para treinar seus próprios LLMs. Em abril de 2026, investidores iniciaram discussões para uma rodada de financiamento de US$ 300 milhões, o que levaria a empresa a uma avaliação de US$ 10 bilhões. A DeepSeek concluiu uma rodada da Série A em maio de 2026, recebendo US$ 7 bilhões, alcançando uma avaliação pós-dinheiro de US$ 52 bilhões. Em julho de 2026, a Bloomberg e o Financial Times relataram preparativos para um IPO já em 2027, com outra discussão visando uma avaliação pré-dinheiro de US$ 70 bilhões.
Estrutura de Treinamento
A DeepSeek opera os clusters de computação Fire-Flyer e Fire-Flyer 2. O Fire-Flyer 2, ainda em operação em 2025, consiste em uma arquitetura de software e hardware co-projetada. O hardware usa GPUs Nvidia com interconexões de 200 Gbps, divididas em duas zonas com suporte a tarefas entre zonas. A topologia de rede usa duas árvores gordas para alta largura de banda de bisecção.
Os principais componentes de software incluem o 3FS (Fire-Flyer File System), um sistema de arquivos paralelo distribuído projetado para leituras aleatórias assíncronas usando Direct I/O e RDMA Read. Como cada leitura de dados é aleatória e não reutilizada, o cache é desnecessário. Outro componente é o hfreduce, uma biblioteca de comunicação assíncrona originalmente projetada para substituir as funções da Nvidia Collective Communications Library.
Estratégia e Contratação
A abordagem de contratação da DeepSeek enfatiza habilidades em vez de longa experiência de trabalho, resultando em muitas contratações recém-saídas da universidade. A empresa recruta indivíduos sem formação em ciência da computação para expandir a experiência em áreas como poesia e matemática avançada. De acordo com o The New York Times, dezenas de pesquisadores da DeepSeek têm ou tiveram afiliações com laboratórios do Exército de Libertação Popular e com os Sete Filhos da Defesa Nacional.
Desde 2025, o chatbot da DeepSeek foi adotado em funções não combatentes pelo Exército de Libertação Popular, incluindo hospitais, a Polícia Armada Popular paramilitar e organizações de mobilização nacional. A empresa também se expandiu para a África, oferecendo soluções de IA mais acessíveis e menos intensivas em energia, fortalecendo modelos de linguagem africanos e gerando startups, por exemplo, em Nairóbi. Juntamente com os serviços de armazenamento e computação em nuvem da Huawei, o impacto da DeepSeek no cenário tecnológico da África subsaariana é considerável, oferecendo soberania de dados local e flexibilidade em comparação com as plataformas ocidentais de IA.
Recepção e Impacto
Os modelos da DeepSeek foram reconhecidos por sua eficiência e acessibilidade aberta dentro do ecossistema de modelos de linguagem de grande porte. O foco da empresa em pesquisa em vez de comercialização a distingue de concorrentes como OpenAI e Anthropic. Suas inovações de treinamento, incluindo os clusters Fire-Flyer e software personalizado, contribuem para desenvolvimentos mais amplos em aprendizado de máquina e aprendizado profundo.
A expansão da DeepSeek na África e suas soluções econômicas a posicionaram como um player significativo na adoção global de IA, especialmente em regiões com infraestrutura limitada. A abordagem de pesos abertos da empresa permite personalização e implantação locais, promovendo uma comunidade crescente de desenvolvedores e startups.