Lançamento do DeepSeek-V3

Traduzido do inglês

DeepSeek-V3, um modelo de linguagem de grande porte com mistura de especialistas e 671B parâmetros, foi lançado em dezembro de 2024 pela empresa chinesa de IA DeepSeek, rivalizando com modelos de código fechado da OpenAI e do Google.

DeepSeek-V3 é um modelo de linguagem de grande porte desenvolvido pela DeepSeek, uma empresa chinesa de inteligência artificial sediada em Hangzhou, Zhejiang. Lançado em dezembro de 2024, o modelo utiliza uma arquitetura de mistura de especialistas (MoE) com 671 bilhões de parâmetros no total, dos quais 37 bilhões são ativados por token. Ele foi projetado para competir com modelos proprietários da OpenAI, Anthropic e Google DeepMind, ao mesmo tempo em que foi lançado como um modelo de pesos abertos, o que significa que seus parâmetros são compartilhados publicamente, embora os dados de treinamento não sejam licenciados abertamente.

O lançamento do DeepSeek-V3 marcou um marco significativo no cenário de IA generativa, demonstrando que modelos de alto desempenho poderiam ser treinados de forma eficiente em hardware mais antigo, em parte devido às restrições dos EUA às exportações avançadas de chips para a China. A liberação do modelo foi acompanhada de relatórios técnicos e pesos abertos, permitindo que pesquisadores e desenvolvedores o usassem e ajustassem, contribuindo para sua rápida adoção em várias aplicações.

Antecedentes

A DeepSeek foi fundada em julho de 2023 por Liang Wenfeng, que também cofundou a High-Flyer, um fundo de hedge chinês que inicialmente se concentrava em negociação orientada por IA. As origens da empresa remontam ao investimento da High-Flyer em clusters de computação baseados em GPU, começando com o Fire-Flyer em 2019, que continha 1.100 GPUs interconectadas a 200 Gbit/s. Em 2021, a High-Flyer havia adquirido 10.000 GPUs Nvidia A100 antes que as restrições de exportação dos EUA entrassem em vigor, permitindo a construção do Fire-Flyer 2, um cluster maior com 5.000 GPUs A100 PCIe em 625 nós.

A missão da DeepSeek é avançar a pesquisa em inteligência artificial geral, com foco em modelos de pesos abertos. A empresa recruta pesquisadores das principais universidades chinesas e contrata de áreas não tradicionais, como poesia e matemática avançada, para ampliar as capacidades do modelo. Essa abordagem, combinada com uma estratégia voltada para pesquisa, permitiu que a DeepSeek inovasse em arquitetura de modelos e eficiência de treinamento.

Arquitetura do Modelo

O DeepSeek-V3 emprega uma arquitetura de mistura de especialistas, um design que divide o modelo em múltiplas sub-redes especializadas, ou especialistas, e ativa apenas um subconjunto para cada entrada. Essa abordagem reduz o custo computacional enquanto mantém alta capacidade. O modelo tem 671 bilhões de parâmetros, mas apenas 37 bilhões são ativos por token, permitindo inferência e treinamento eficientes.

A arquitetura incorpora inovações como atenção latente multi-cabeça e balanceamento de carga sem perda auxiliar, que melhoram a estabilidade do treinamento e o desempenho. Essas técnicas baseiam-se em trabalhos anteriores em modelos transformer e atenção multi-cabeça, permitindo que o DeepSeek-V3 lide com contextos longos e tarefas de raciocínio complexo de forma eficaz.

Treinamento e Infraestrutura

O DeepSeek-V3 foi treinado no Fire-Flyer 2, um cluster de computação codesenvolvido com software e hardware personalizados. O cluster usa GPUs Nvidia com interconexões de 200 Gbps e uma topologia de rede em árvore gorda para alta largura de banda de bissecção. A pilha de software inclui o 3FS, um sistema de arquivos paralelo distribuído otimizado para leituras aleatórias assíncronas, e o hfreduce, uma biblioteca para comunicação assíncrona.

Treinar um modelo dessa escala exigiu recursos computacionais significativos. A DeepSeek relatou que o Fire-Flyer 2 foi usado com mais de 96% de capacidade em 2022, totalizando 56,74 milhões de horas de GPU. O design do cluster enfatiza eficiência, usando inicialmente GPUs A100 PCIe devido aos modelos caberem em 40 GB de VRAM, incorporando posteriormente NVLinks e NCCL para modelos maiores que exigem paralelismo de modelo.

O processo de treinamento provavelmente usou técnicas como variantes de otimizador adam, agendamento de taxa de aprendizado e recorte de gradiente para garantir estabilidade. O foco da DeepSeek em eficiência algorítmica permitiu treinar modelos competitivos apesar das restrições de hardware, uma estratégia que foi notada como uma resposta às restrições de chips dos EUA.

Desempenho e Benchmarks

O DeepSeek-V3 demonstrou desempenho competitivo em vários benchmarks, rivalizando com modelos de código fechado da OpenAI e Google DeepMind. Em avaliações internas, alcançou fortes resultados em compreensão de linguagem natural, geração de código e raciocínio matemático. Por exemplo, relatou-se que superou modelos como GPT-4o em certas tarefas de codificação, embora a verificação independente fosse limitada no lançamento.

A natureza de pesos abertos do modelo permitiu que a comunidade de pesquisa testasse e validasse suas capacidades, levando à adoção generalizada em ambientes acadêmicos e comerciais. Sua eficiência e desempenho o tornaram particularmente atraente para organizações com recursos computacionais limitados.

Lançamento e Recepção

O lançamento do DeepSeek-V3 em dezembro de 2024 foi recebido com atenção significativa na comunidade de IA. Foi visto como uma prova de que modelos de pesos abertos poderiam desafiar sistemas proprietários, gerando debates sobre o futuro do desenvolvimento de IA. O modelo foi hospedado por provedores de nuvem como Microsoft Azure e Perplexity AI, tornando-o acessível a um público amplo.

Críticos notaram que a abordagem de pesos abertos da DeepSeek, embora transparente quanto aos parâmetros, não divulgava os dados de treinamento, levantando questões sobre a proveniência dos dados e possíveis vieses. Além disso, os laços da empresa com a High-Flyer e as afiliações de seus pesquisadores com instituições de defesa chinesas atraíram escrutínio, embora a DeepSeek tenha declarado que seu foco é a pesquisa.

Impacto e Legado

O DeepSeek-V3 influenciou desenvolvimento subsequentes no campo da IA, incluindo o lançamento do DeepSeek-R1 em janeiro de 2025, que incorporou capacidades de raciocínio. O modelo também contribuiu para a tendência mais ampla de IA eficiente, incentivando outras empresas a otimizar para menor consumo de recursos.

O lançamento teve implicações geopolíticas, destacando a capacidade de empresas chinesas de inovar apesar dos controles de exportação. Também estimulou discussões sobre a democratização da IA, já que modelos de pesos abertos permitem acesso mais amplo a tecnologia avançada.

Direções Futuras

Após o DeepSeek-V3, a DeepSeek continuou a lançar modelos sob licenças de código aberto, expandindo seu portfólio. A estratégia da empresa de focar em pesquisa e eficiência a posiciona como um ator-chave no cenário global de IA. Em 2025, o Fire-Flyer 2 permanecia operacional, apoiando pesquisa e desenvolvimento contínuos.

A expansão da DeepSeek para a África, oferecendo soluções de IA acessíveis e eficientes em energia, indica sua ambição de alcançar mercados carentes. Os futuros lançamentos da empresa provavelmente se basearão nas inovações introduzidas com o DeepSeek-V3, potencialmente influenciando a próxima geração de modelos de linguagem de grande porte.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:deepseek-v3·large-language-model·ai-launch·open-weights
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico