DeepSeek V3 é um modelo de linguagem de grande porte desenvolvido pela empresa chinesa de IA DeepSeek, lançado pela primeira vez em 26 de dezembro de 2024. É uma arquitetura baseada em transformadores que emprega um design de Mistura de Especialistas (MoE), com um total de 671 bilhões de parâmetros, dos quais 37 bilhões são ativados por token. O modelo foi treinado em 14,8 trilhões de tokens e é notável por seu processo de treinamento de baixo custo, supostamente usando apenas 2,788 milhões de horas de GPU H800.
DeepSeek V3 apareceu em rankings públicos de LLMs e na mídia logo após seu lançamento, com capturas de benchmark mostrando desempenho consistente em múltiplas variantes. A família de modelos inclui pelo menos cinco variantes nessas capturas, refletindo diferentes estados de configuração ou ajuste fino, embora detalhes específicos de cada variante não sejam documentados publicamente. O modelo base e sua versão ajustada por instruções foram avaliados em benchmarks acadêmicos padrão.
Arquitetura e Treinamento
DeepSeek V3 usa uma arquitetura de aprendizado profundo com 61 camadas de blocos de transformadores. Ele incorpora atenção latente multi-cabeça (MLA) para inferência eficiente e emprega uma estrutura DeepSeekMoE para camadas feed-forward, onde cada token ativa apenas um subconjunto de especialistas. O modelo usa um vocabulário de 128.000 tokens e suporta um comprimento de contexto de 128K tokens.
O treinamento foi conduzido usando um agendamento de taxa de aprendizado com uma taxa de aprendizado máxima de 2,4e-3, combinado com recorte de gradiente e normalização em lote adaptados para treinamento em grande escala. O conjunto de dados compreendia 14,8 trilhões de tokens, principalmente em inglês e chinês, provenientes de texto da web, livros e outros corpora selecionados. O processo de treinamento utilizou GPUs H800 fabricadas pela TSMC, com um custo relatado de aproximadamente US$ 5,6 milhões para a execução final do treinamento.
Desempenho e Benchmarks
Em benchmarks públicos, DeepSeek V3 alcançou pontuações notáveis. No benchmark MMLU (Massive Multitask Language Understanding), ele obteve 88,5% em um cenário de 5 disparos. No benchmark MATH-500, alcançou 90,2% em um cenário de zero disparos. O modelo também teve bom desempenho em tarefas de codificação, pontuando 82,6% no HumanEval e 67,3% no mais desafiador LiveCodeBench.
Em comparação com modelos contemporâneos, o desempenho do DeepSeek V3 foi competitivo com sistemas proprietários líderes da OpenAI e da Anthropic, embora fosse significativamente mais barato de treinar. No benchmark GPQA (Graduate-Level Google-Proof Q&A), ele pontuou 59,1% em um cenário de zero disparos, e no benchmark DROP, alcançou 91,6% em um cenário de 3 disparos.
Lançamento e Variantes
O lançamento inicial em 26 de dezembro de 2024 incluiu o modelo base e uma versão otimizada para chat, DeepSeek-V3-Chat. Ambos foram disponibilizados sob a licença MIT, permitindo uso comercial e modificação. Os pesos do modelo foram distribuídos através do Hugging Face e outras plataformas, permitindo ampla adoção na comunidade de IA generativa.
Capturas de benchmarks públicos do início de 2025 mostram pelo menos cinco variantes distintas do DeepSeek V3, provavelmente representando diferentes execuções de ajuste fino ou níveis de quantização. Essas variantes apareceram em rankings como o LMSYS Chatbot Arena e o Open LLM Leaderboard, embora a configuração exata de cada variante não seja documentada oficialmente. Até o início de 2025, nenhuma variante oficial adicional além das versões base e chat havia sido anunciada.
Impacto e Recepção
O lançamento do DeepSeek V3 gerou atenção significativa na comunidade de inteligência artificial devido à sua combinação de alto desempenho e baixo custo de treinamento. Ele demonstrou que técnicas de treinamento eficientes poderiam rivalizar com as capacidades de modelos desenvolvidos com orçamentos substancialmente maiores. A natureza de código aberto do modelo sob a licença MIT contribuiu para sua rápida integração em vários aplicativos e projetos de pesquisa.
Críticos e analistas notaram que a eficiência de treinamento do DeepSeek V3 se devia em parte à sua arquitetura MoE, que reduz o custo computacional durante a inferência. No entanto, a dependência do modelo em um grande número total de parâmetros ainda exige memória substancial para implantação. O modelo também gerou discussões sobre o cenário competitivo do aprendizado de máquina, particularmente em relação ao papel das empresas chinesas de IA no avanço de modelos de código aberto.
Detalhes Técnicos e Limitações
DeepSeek V3 emprega um esquema personalizado de codificação posicional e usa mecanismos de atenção multi-cabeça. Ele não usa abandono tradicional em suas camadas de atenção, uma escolha de design que melhora a eficiência do treinamento. A inferência do modelo suporta amostragem top-p e escalonamento de temperatura para geração controlada.
Apesar de seus pontos fortes, o DeepSeek V3 tem limitações. Ele pode exibir vieses presentes em seus dados de treinamento, e seu desempenho em idiomas não ingleses além do chinês é menos avaliado. A grande pegada de memória do modelo limita a implantação em hardware de consumo, exigindo poda de modelo ou quantização para uso prático em alguns contextos. Até o início de 2025, o modelo não foi atualizado com um sucessor, embora a pesquisa contínua na DeepSeek prossiga.