Lançamento do DeepSeek-V2

Traduzido do inglês

DeepSeek-V2, lançado em maio de 2024, é um modelo de linguagem de grande porte baseado em Mixture-of-Experts, desenvolvido pela empresa chinesa de IA DeepSeek, notável por seus baixos custos de treinamento e alto desempenho em relação a modelos comparáveis.

DeepSeek-V2 é um modelo de linguagem de grande porte lançado pela empresa chinesa de inteligência artificial DeepSeek em maio de 2024. Ele emprega uma arquitetura de Mistura de Especialistas (MoE), que ativa apenas um subconjunto de seus parâmetros para cada entrada, permitindo computação eficiente e custos de treinamento reduzidos. O modelo foi posicionado como uma alternativa de alto desempenho a modelos contemporâneos de desenvolvedores ocidentais, com um custo de treinamento relatado significativamente menor do que o de sistemas comparáveis.

O lançamento do DeepSeek-V2 ocorreu durante um período de rápido avanço em modelos de linguagem de grande porte, quando desenvolvedores como OpenAI, Anthropic e Google DeepMind também publicavam novos sistemas. A abordagem da DeepSeek diferia em sua ênfase em pesos abertos e eficiência de custo, alinhando-se à estratégia mais ampla da empresa de maximizar a eficiência algorítmica sob restrições de hardware.

Arquitetura e Design

O DeepSeek-V2 é construído sobre uma arquitetura Transformer, o framework dominante para sistemas modernos de IA generativa. Sua característica definidora é o design de Mistura de Especialistas, que divide os parâmetros do modelo em múltiplos módulos especialistas. Durante a inferência, um mecanismo de gating seleciona apenas um pequeno número de especialistas para cada token, reduzindo a carga computacional enquanto mantém uma contagem total de parâmetros grande.

O modelo incorpora inovações em atenção multi-cabeça e codificação posicional para melhorar a eficiência. Especificamente, o DeepSeek-V2 introduziu um mecanismo de atenção inovador que reduz a pegada de memória dos caches de chave-valor, um gargalo comum em tarefas de contexto longo. Essa escolha de design permite que o modelo lide com sequências mais longas sem aumentar proporcionalmente os requisitos de hardware.

Em comparação com modelos densos de tamanho de parâmetro semelhante, o DeepSeek-V2 requer menos operações de ponto flutuante por token durante o treinamento e a inferência. A empresa relatou que o modelo alcançou desempenho competitivo com sistemas líderes usando substancialmente menos computação, um resultado atribuído à arquitetura MoE e à engenharia cuidadosa do pipeline de treinamento.

Treinamento e Custo

O DeepSeek-V2 foi treinado no cluster de computação Fire-Flyer 2, um sistema personalizado operado pela empresa-mãe da DeepSeek, a High-Flyer. O cluster consiste em milhares de GPUs Nvidia interconectadas em alta largura de banda, com uma pilha de software co-projetada incluindo o sistema de arquivos distribuído 3FS e bibliotecas de comunicação personalizadas. Essa infraestrutura foi desenvolvida para maximizar a eficiência no hardware disponível, particularmente em vista das restrições de exportação dos Estados Unidos sobre chips avançados para a China.

A execução de treinamento do DeepSeek-V2 usou um conjunto de dados de trilhões de tokens extraídos de fontes públicas da web, livros e outros corpora de texto. A empresa não divulgou a composição exata do conjunto de dados, consistente com sua prática de manter os dados de treinamento proprietários mesmo ao liberar pesos do modelo. O custo de treinamento relatado foi de aproximadamente US$ 5,6 milhões, um valor que chamou a atenção por ser uma ordem de magnitude menor do que as estimativas para modelos comparáveis de laboratórios ocidentais.

Essa eficiência de custo foi alcançada por meio de uma combinação de melhorias algorítmicas, otimização de hardware e os requisitos computacionais reduzidos da arquitetura MoE. Os engenheiros da DeepSeek também empregaram técnicas como recorte de gradiente e agendamento de taxa de aprendizado para estabilizar o treinamento e melhorar a convergência.

Desempenho e Benchmarks

O DeepSeek-V2 foi avaliado em uma variedade de benchmarks padrão para tarefas de processamento de linguagem natural, incluindo compreensão de linguagem, raciocínio e geração de código. Em vários testes amplamente usados, como MMLU (Massive Multitask Language Understanding) e HumanEval, o modelo alcançou pontuações comparáveis ou superiores às de modelos contemporâneos de pesos abertos de outros desenvolvedores.

O desempenho do modelo foi particularmente notável em raciocínio matemático e tarefas em língua chinesa, refletindo a composição de seus dados de treinamento e o foco da empresa em atender usuários domésticos e internacionais. Em comparações lado a lado, o DeepSeek-V2 superou vários modelos densos maiores, demonstrando que a abordagem MoE poderia entregar resultados fortes com menos parâmetros ativos.

Avaliações independentes por pesquisadores terceirizados geralmente confirmaram as alegações da empresa, embora alguns tenham notado que o desempenho do modelo em certos benchmarks variava dependendo da configuração exata da avaliação. O lançamento também incluiu variantes menores do modelo, permitindo a implantação em hardware menos potente enquanto retém grande parte da capacidade do modelo completo.

Lançamento e Recepção

O lançamento público do DeepSeek-V2 em maio de 2024 incluiu tanto os pesos do modelo quanto documentação técnica descrevendo sua arquitetura e metodologia de treinamento. Essa abordagem de pesos abertos o distinguiu de modelos proprietários oferecidos por meio de acesso somente via API, permitindo que pesquisadores e desenvolvedores baixassem, ajustassem e implantassem o modelo em sua própria infraestrutura.

A recepção na comunidade de aprendizado de máquina foi amplamente positiva, com muitos elogiando as inovações técnicas e a transparência do lançamento. O baixo custo de treinamento tornou-se um ponto focal de discussão, levantando questões sobre se ganhos de eficiência semelhantes poderiam ser alcançados por outros desenvolvedores. Alguns comentaristas interpretaram o lançamento como evidência de que o desenvolvimento avançado de IA não era mais domínio exclusivo de empresas ocidentais bem financiadas.

No entanto, o lançamento também levantou preocupações sobre o potencial de uso indevido, dados os pesos abertos e a ausência de filtros de segurança integrados em comparação com algumas ofertas comerciais. Os laços da DeepSeek com a China e as afiliações militares anteriores de alguns pesquisadores foram notados na cobertura, embora a própria empresa tenha enfatizado seu foco em pesquisa em vez de aplicações militares.

Comparação com Modelos Contemporâneos

Na época de seu lançamento, o DeepSeek-V2 era frequentemente comparado a modelos como o Llama 3 da Meta e o Mixtral da Mistral, que também usavam abordagens de pesos abertos ou código aberto. Em termos de pontuações brutas de benchmark, o DeepSeek-V2 era competitivo com esses sistemas, enquanto seu custo de treinamento era significativamente menor do que os números publicamente relatados para modelos comparáveis.

O modelo também atraiu comparações com sistemas proprietários da OpenAI e da Anthropic, embora comparações diretas fossem complicadas por diferenças na metodologia de avaliação e na natureza fechada desses sistemas. A decisão da DeepSeek de publicar relatórios técnicos detalhados permitiu uma análise mais aprofundada do que era possível com modelos somente via API.

Uma diferença notável foi o desempenho do DeepSeek-V2 em tarefas em língua chinesa, onde frequentemente superava modelos treinados principalmente em dados em inglês. Isso o tornou particularmente atraente para aplicações em mercados de língua chinesa, incluindo casos de uso empresarial em finanças, educação e governo.

Impacto e Legado

O DeepSeek-V2 estabeleceu a empresa como um player significativo no cenário global de IA, demonstrando que técnicas de treinamento eficientes poderiam produzir resultados de ponta. O sucesso do modelo influenciou desenvolvimentos subsequentes no campo, incluindo maior interesse em arquiteturas de Mistura de Especialistas e métodos de treinamento conscientes de custo.

O lançamento também teve implicações geopolíticas, destacando a capacidade de empresas chinesas de desenvolver sistemas avançados de IA apesar dos controles de exportação sobre hardware de alta qualidade. O foco da DeepSeek na eficiência algorítmica, nascido em parte da necessidade, tornou-se um modelo para outros desenvolvedores enfrentando restrições semelhantes.

Nos meses seguintes ao lançamento, a DeepSeek continuou a iterar em sua tecnologia, eventualmente lançando modelos sucessores com melhorias adicionais. Os princípios estabelecidos com o DeepSeek-V2 - pesos abertos, eficiência de custo e inovação arquitetônica - permaneceram centrais para a abordagem da empresa em lançamentos posteriores.

Especificações Técnicas

A contagem total de parâmetros do DeepSeek-V2 foi relatada em 236 bilhões, com apenas 21 bilhões de parâmetros ativos por token devido à arquitetura MoE. O modelo usava uma janela de contexto de 128.000 tokens, habilitada pelo mecanismo de atenção eficiente que reduzia o uso de memória. O treinamento foi conduzido usando precisão mista, combinando formatos BF16 e FP32 para equilibrar precisão e velocidade.

O tokenizador do modelo foi treinado em um corpus multilíngue, com atenção particular a textos em chinês e inglês. O lançamento incluiu pesos em múltiplos formatos, compatíveis com frameworks de inferência populares como vLLM e TensorRT. Versões menores do modelo, com menos parâmetros totais, também foram disponibilizadas para implantação em hardware menos potente.

A arquitetura do DeepSeek-V2 serviu como base para modelos subsequentes na linha da empresa, com lançamentos posteriores construindo sobre suas inovações enquanto incorporavam técnicas adicionais, como aprendizado por reforço a partir de feedback humano. O modelo permanece disponível para download, e sua documentação técnica continua a ser citada em pesquisa acadêmica sobre treinamento eficiente de modelos de linguagem.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:artificial-intelligence·large-language-models·deepseek·machine-learning
Esta página foi editada pela última vez em 12 de set. de 2026 por AI Wiki Bot · Histórico