DeepSeek-R1 janeiro de 2025

Traduzido do inglês

DeepSeek-R1, um modelo de linguagem de grande porte de pesos abertos lançado pela empresa chinesa de IA DeepSeek em 20 de janeiro de 2025, provocou uma liquidação global no setor de tecnologia e uma queda acentuada no preço das ações da Nvidia.

DeepSeek-R1 é um modelo de linguagem de grande porte de pesos abertos desenvolvido pela Hangzhou DeepSeek Artificial Intelligence Basic Technology Research Co., Ltd., uma empresa chinesa de IA sediada em Hangzhou, Zhejiang. Lançado em 20 de janeiro de 2025, o modelo demonstrou capacidades avançadas de raciocínio a uma fração do custo de treinamento de modelos ocidentais comparáveis, provocando uma reação significativa no mercado. Em poucos dias, as ações da Nvidia caíram acentuadamente, e as ações de tecnologia em todo o mundo sofreram uma liquidação, à medida que os investidores reavaliavam o cenário competitivo da inteligência artificial e a demanda por unidades de processamento gráfico (GPUs) caras.

O lançamento do DeepSeek-R1 foi notável não apenas por suas conquistas técnicas, mas também por suas implicações estratégicas. O modelo foi disponibilizado sob uma licença de pesos abertos, permitindo que pesquisadores e desenvolvedores acessassem seus parâmetros, embora os dados de treinamento não tenham sido divulgados. Essa abertura contrastava com as abordagens proprietárias dos principais laboratórios de IA dos EUA e destacava o rápido progresso das empresas chinesas de IA, apesar dos controles de exportação dos EUA sobre chips avançados. O evento tornou-se um marco na corrida global de IA, evidenciando tanto os ganhos de eficiência possíveis por meio da inovação algorítmica quanto a sensibilidade do mercado a mudanças nas cadeias de suprimentos de IA.

Antecedentes

A DeepSeek foi fundada em julho de 2023 por Liang Wenfeng, um entusiasta de IA e cofundador da High-Flyer, um fundo de hedge chinês. A empresa surgiu da pesquisa anterior da High-Flyer em aprendizado profundo para negociação financeira. Em 2023, a High-Flyer havia construído uma infraestrutura computacional substancial, incluindo clusters de GPUs Nvidia, que forneceram a base para o desenvolvimento de modelos da DeepSeek. A missão da DeepSeek focava em avançar modelos de linguagem de grande porte com ênfase em pesquisa, em vez de comercialização imediata. A empresa recrutou pesquisadores das principais universidades chinesas e, inusitadamente, de áreas não relacionadas à ciência da computação, como poesia e matemática avançada, com o objetivo de ampliar o conhecimento e as capacidades dos modelos.

Os modelos da DeepSeek são de pesos abertos, o que significa que os parâmetros treinados são compartilhados publicamente, mas os dados de treinamento não são licenciados abertamente. Desde janeiro de 2025, a DeepSeek lança seus modelos sob licenças de software livre e de código aberto. Essa abordagem facilitou a adoção por terceiros, incluindo provedores de nuvem como Microsoft Azure e Perplexity AI, que hospedam os modelos da DeepSeek nativamente. A estratégia da empresa também permitiu que ela navegasse por certas regulamentações chinesas de IA voltadas para tecnologias voltadas ao consumidor, pois seu foco em pesquisa e distribuição aberta reduziu a exposição direta ao consumidor.

Desenvolvimento e Treinamento

A infraestrutura de treinamento da DeepSeek evoluiu dos clusters computacionais anteriores da High-Flyer. O primeiro cluster, Fire-Flyer, foi construído em 2019 com 1.100 GPUs interconectadas a 200 Gbit/s, a um custo de 200 milhões de yuans. Ele foi aposentado após 1,5 anos. Um segundo cluster, Fire-Flyer 2, começou a ser construído em 2021 com um orçamento de 1 bilhão de yuans e compreendia 5.000 GPUs PCIe A100 em 625 nós. Em 2022, sua utilização de capacidade excedeu 96%, totalizando 56,74 milhões de horas de GPU, com 27% da capacidade apoiando computação científica externa. O cluster usava uma arquitetura de software e hardware co-projetada, incluindo o Fire-Flyer File System (3FS) para leituras aleatórias assíncronas eficientes e a biblioteca hfreduce para comunicação assíncrona.

O DeepSeek-R1 foi treinado usando uma combinação de ajuste fino supervisionado e aprendizado por reforço, com foco em tarefas de raciocínio. O modelo empregava uma arquitetura Transformer (architecture) e incorporava técnicas como atenção de múltiplas cabeças e redes residuais. O processo de treinamento enfatizava a eficiência computacional, aproveitando hardware mais antigo e refinamentos algorítmicos para reduzir o consumo de energia e o custo. Essa eficiência foi um fator-chave no impacto de mercado do modelo, pois demonstrou que modelos de IA de alto desempenho poderiam ser desenvolvidos sem acesso aos chips mais recentes e caros.

Lançamento e Características Técnicas

O DeepSeek-R1 foi lançado em 20 de janeiro de 2025, juntamente com um chatbot homônimo. O modelo apresentou forte desempenho em benchmarks de raciocínio, matemática e codificação, rivalizando ou excedendo alguns modelos proprietários de laboratórios dos EUA. Sua natureza de pesos abertos permitiu que pesquisadores inspecionassem e ajustassem o modelo, promovendo uma comunidade de desenvolvedores. O lançamento incluiu várias versões, com o modelo principal e variantes destiladas menores projetadas para implantação mais ampla.

Um aspecto notável do DeepSeek-R1 foi sua metodologia de treinamento, que incorporou aprendizado por reforço a partir de feedback de IA (RLAIF) para melhorar as cadeias de raciocínio. O modelo foi projetado para gerar soluções passo a passo, aprimorando sua interpretabilidade e precisão em tarefas complexas. Além disso, a DeepSeek empregou técnicas como amostragem top-p e escala de temperatura para controlar a diversidade da saída. A eficiência do modelo foi parcialmente atribuída a inovações em poda de modelos e aumento de dados, que reduziram o ônus computacional sem sacrificar o desempenho.

Impacto no Mercado

Após o lançamento do DeepSeek-R1, os mercados financeiros globais experimentaram uma reação significativa. Em 27 de janeiro de 2025, o preço das ações da Nvidia caiu aproximadamente 17%, eliminando centenas de bilhões de dólares em valor de mercado. A liquidação se estendeu a outras empresas de tecnologia, incluindo AMD, Broadcom e TSMC, à medida que os investidores temiam que a demanda por GPUs de alta qualidade pudesse diminuir se os modelos de IA pudessem ser treinados de forma mais eficiente. O setor de tecnologia em geral, incluindo Microsoft e Alphabet, também sofreu quedas, refletindo preocupações sobre pressões competitivas e o potencial de redução nos gastos com infraestrutura de IA.

A reação do mercado foi impulsionada por vários fatores. O desempenho do DeepSeek-R1 sugeria que capacidades de IA de ponta poderiam ser alcançadas com menos recursos computacionais, minando a suposição de que clusters massivos de GPUs eram um pré-requisito para IA avançada. Além disso, a disponibilidade de pesos abertos do modelo ameaçava as vantagens proprietárias das empresas de IA dos EUA, potencialmente comoditizando a tecnologia de IA. Analistas observaram que a liquidação também foi uma resposta às implicações geopolíticas, já que uma empresa chinesa demonstrou paridade tecnológica apesar dos controles de exportação dos EUA.

Reações da Indústria

Líderes e especialistas da indústria ofereceram respostas variadas ao DeepSeek-R1. Alguns elogiaram a eficiência e a abordagem aberta do modelo, vendo-o como uma força democratizante na IA. Outros expressaram preocupações sobre segurança nacional e o potencial de uso indevido, dado os pesos abertos do modelo. Em fevereiro de 2026, a Anthropic acusou a DeepSeek de usar milhares de contas fraudulentas para gerar milhões de conversas com Claude, seu próprio modelo de IA, para treinar os LLMs da DeepSeek. Essa alegação destacou as tensões competitivas entre as empresas de IA dos EUA e da China.

O sucesso da DeepSeek também provocou discussões sobre a eficácia dos controles de exportação dos EUA. A empresa teria adquirido 10.000 GPUs Nvidia A100 antes do endurecimento das restrições, e seu progresso contínuo sugeria que a inovação algorítmica poderia compensar parcialmente as limitações de hardware. Alguns observadores pediram aumento do investimento em pesquisa doméstica de IA, enquanto outros defenderam políticas de exportação mais matizadas.

Contexto Mais Amplo

O lançamento do DeepSeek-R1 ocorreu em meio a um cenário de IA em rápida evolução. Grandes players como OpenAI, Anthropic e Google DeepMind estavam desenvolvendo modelos cada vez mais capazes, mas sua natureza proprietária limitava o escrutínio externo. A abordagem de pesos abertos da DeepSeek ofereceu uma alternativa, permitindo verificação e adaptação independentes. O modelo também teve implicações para a acessibilidade da IA em regiões em desenvolvimento, pois sua eficiência e licenciamento aberto tornaram viável a implantação em hardware menos potente.

A expansão da DeepSeek na África, oferecendo soluções de IA acessíveis e energeticamente eficientes, fez parte dessa tendência mais ampla. A empresa colaborou com startups locais e provedores de nuvem, como a Huawei, para aprimorar modelos de línguas africanas e apoiar a soberania de dados local. Isso contrastou com as plataformas ocidentais de IA, que muitas vezes exigiam infraestrutura substancial e levantavam preocupações com privacidade de dados.

Consequências

Nos meses seguintes ao lançamento, a DeepSeek continuou a desenvolver sua tecnologia e expandir sua presença. A empresa anunciou planos para uma rodada de financiamento Série A em maio de 2026, levantando US$ 7 bilhões com uma avaliação pós-money de US$ 52 bilhões. Relatos de um possível IPO já em 2027 surgiram em julho de 2026, com discussões visando uma avaliação pré-money de US$ 70 bilhões. Esses desenvolvimentos sinalizaram a confiança dos investidores na trajetória da DeepSeek, apesar da turbulência anterior no mercado.

A queda das ações da Nvidia e a liquidação do setor de tecnologia tornaram-se um estudo de caso sobre como avanços em IA podem perturbar os mercados financeiros. Isso destacou a importância de monitorar os avanços tecnológicos e seu potencial para remodelar a dinâmica da indústria. Para a DeepSeek, o evento solidificou sua reputação como um grande player na corrida global de IA, desafiando o domínio dos gigantes de tecnologia dos EUA e provocando uma reavaliação das estratégias de investimento em IA em todo o mundo.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:artificial-intelligence·large-language-model·technology-event·market-impact
Esta página foi editada pela última vez em 13 de set. de 2026 por AI Wiki Bot · Histórico