DeepSeek é uma empresa de pesquisa em inteligência artificial sediada em Hangzhou, China, fundada em 2023 por Liang Wenfeng, que também fundou e continuou financiando a empresa por meio da High-Flyer, um fundo de hedge quantitativo que ele cofundou em 2015. O negócio de negociação da High-Flyer já havia acumulado grandes estoques de hardware GPU (in AI) para negociação algorítmica, dando à DeepSeek uma base computacional incomum em comparação com startups típicas de IA, mesmo com as restrições de exportação dos EUA limitando o acesso de empresas chinesas aos chips NVIDIA mais avançados.
Modelos e o choque de janeiro de 2025
A DeepSeek lançou uma série de Open-weights models cada vez mais capazes, incluindo DeepSeek-V2 e V3, antes de publicar DeepSeek-R1 em janeiro de 2025, um Reasoning model treinado substancialmente com Reinforcement learning que igualou ou se aproximou do desempenho do OpenAI OpenAI o1 em vários conjuntos de testes de matemática e codificação, enquanto era lançado com pesos abertos e um artigo técnico descrevendo seu treinamento. A DeepSeek relatou custos de treinamento muito abaixo do que se acreditava que laboratórios ocidentais comparáveis gastavam, embora os números exatos e sua comparabilidade tenham sido contestados. O lançamento desencadeou o DeepSeek market shock, uma forte liquidação em ações relacionadas a IA, mais notavelmente uma perda recorde de valor de mercado em um único dia para a Nvidia, enquanto investidores reavaliavam as suposições sobre quanto poder computacional era necessário para alcançar o nível Frontier model.
Abordagem técnica
Os modelos da DeepSeek fizeram uso proeminente de arquiteturas Mixture of experts para melhorar a eficiência de treinamento e inferência, e a empresa publicou detalhes de otimizações de treinamento, incluindo abordagens para reduzir a sobrecarga de memória e comunicação, que foram amplamente estudadas por outros laboratórios. O pipeline de treinamento do DeepSeek-R1 foi notável por demonstrar que grandes ganhos em raciocínio do tipo Chain-of-thought poderiam emergir de aprendizado por reforço em tarefas verificáveis, sem depender extensivamente de dados rotulados por humanos RLHF, e a empresa lançou versões menores destiladas do modelo que podiam rodar em hardware muito mais modesto, acelerando a adoção por desenvolvedores externos por meio de plataformas como Hugging Face.
Recepção e contexto geopolítico
A ascensão da DeepSeek foi amplamente interpretada como evidência de que os controles de exportação dos EUA sobre chips avançados não impediram laboratórios chineses de alcançar a fronteira da IA, intensificando debates em Washington sobre a eficácia das restrições de hardware e adicionando urgência às discussões sobre AI governance e competição nacional, ao lado de laboratórios como o desenvolvedor do Qwen, Alibaba. Alguns analistas e laboratórios concorrentes questionaram aspectos dos custos de treinamento relatados pela DeepSeek e levantaram preocupações sobre a proveniência dos dados e possível destilação de saídas de modelos ocidentais fechados, alegações que a DeepSeek não abordou totalmente publicamente. O episódio, no entanto, estabeleceu a DeepSeek, ao lado de laboratórios como Mistral AI, como uma alternativa credível de pesos abertos aos maiores desenvolvedores americanos de modelos fechados.