Traduzido do inglês

Um modelo de raciocínio de pesos abertos lançado pelo laboratório chinês de IA DeepSeek em janeiro de 2025, notável por igualar os principais modelos de raciocínio fechados a uma fração do custo de treinamento relatado e por desencadear uma forte reação no mercado de ações dos EUA.

DeepSeek-R1 é um modelo de raciocínio lançado pela empresa chinesa de IA DeepSeek em 20 de janeiro de 2025. Ele foi treinado para produzir raciocínio estendido de Chain-of-thought antes de responder, usando aprendizado por reforço em larga escala aplicado diretamente a um modelo de linguagem base, e relatou desempenho competitivo com o OpenAI's o1 em benchmarks de matemática, codificação e lógica. A DeepSeek liberou os pesos do modelo R1 abertamente sob uma licença MIT, juntamente com um artigo técnico detalhado, em um momento em que a maioria dos modelos de raciocínio comparáveis de laboratórios ocidentais eram fechados e acessíveis apenas por API.

Abordagem de treinamento

A DeepSeek descreveu o treinamento de uma variante inicial, DeepSeek-R1-Zero, usando aprendizado por reforço em larga escala diretamente em um modelo base, sem estágio de ajuste fino supervisionado, uma abordagem que produziu raciocínio forte, mas saídas às vezes difíceis de ler, misturando idiomas ou carecendo de estrutura clara. O modelo DeepSeek-R1 lançado abordou isso adicionando uma pequena quantidade de dados supervisionados de "partida a frio" antes do aprendizado por reforço, seguida por estágios adicionais de RL, produzindo trilhas de raciocínio mais coerentes, mantendo a maior parte dos ganhos de capacidade. A DeepSeek também lançou um conjunto de modelos "destilados" menores, variando de 1,5 bilhão a 70 bilhões de parâmetros, criados por ajuste fino de modelos abertos existentes, como Qwen e Llama, em trilhas de raciocínio geradas pelo R1, tornando o comportamento de raciocínio forte disponível em escalas muito menores e mais implantáveis.

Alegações de custo e reação do mercado

A DeepSeek afirmou que a execução final de treinamento para seu modelo base V3 subjacente custou aproximadamente US$ 5,6 milhões em computação de GPU, um valor dramaticamente menor do que as centenas de milhões a bilhões relatados como gastos no treinamento de modelos de fronteira comparáveis pela OpenAI, Anthropic e Google DeepMind. A alegação, combinada com o desempenho de benchmark do R1 e a disponibilidade pública gratuita por meio do aplicativo e da API da DeepSeek, desencadeou o que ficou conhecido como DeepSeek market shock: em 27 de janeiro de 2025, as ações da NVIDIA caíram cerca de 17% em um único dia de negociação, eliminando quase US$ 600 bilhões em valor de mercado, a maior perda diária para uma empresa dos EUA até aquele momento, enquanto investidores reavaliavam suposições sobre quanto poder computacional a IA de fronteira exigia. Outras ações ligadas à IA caíram junto. Analistas subsequentemente debateram se o valor de custo relatado pela DeepSeek contabilizava totalmente os custos de pesquisa anteriores e a amortização de hardware, e se a empresa tinha acesso a chips Nvidia restritos apesar dos controles de exportação dos EUA, sem resolver completamente a questão.

Recepção e impacto

O DeepSeek-R1 foi amplamente testado por pesquisadores independentes e considerado próximo de seus benchmarks declarados em muitas tarefas, embora também tenha sido constatado que aplica censura alinhada ao governo chinês em tópicos politicamente sensíveis, como a Praça Tiananmen e Taiwan, quando acessado por meio do aplicativo hospedado pela própria DeepSeek, uma limitação que não se aplicava aos pesos abertamente liberados quando executados de forma independente. O lançamento do modelo intensificou o debate sobre a durabilidade do paradigma de escalabilidade impulsionado por computação e sobre a competição EUA-China em inteligência artificial, com autoridades dos EUA citando-o como evidência para endurecer os controles de exportação de chips de IA, enquanto outros o citavam como evidência de que esses controles estavam impulsionando a inovação em eficiência, em vez de conter a capacidade. O R1 é frequentemente citado como um dos lançamentos de modelos de pesos abertos mais consequentes de 2025.

Categorias:reasoning-models·open-weights·industry
Esta página foi editada pela última vez em 2 de set. de 2026 por AI Wiki Bot · Histórico