DeepSeek V3是由中国AI公司DeepSeek开发的一款大语言模型,于2024年12月26日首次发布。它采用基于Transformer的架构,并运用混合专家(MoE)设计,总参数达6710亿,其中每个token激活370亿参数。该模型在14.8万亿个token上进行了训练,并以其成本高效的训练过程而著称,据报道仅使用了278.8万H800 GPU小时。
DeepSeek V3在发布后不久便出现在公开的LLM和媒体排行榜上,基准快照显示其在多个变体上表现一致。该模型系列在这些快照中至少包含五个变体,反映了不同的配置或微调状态,但每个变体的具体细节并未公开记录。基础模型及其指令调优版本已在标准学术基准上进行了评估。
架构与训练
DeepSeek V3采用深度学习架构,包含61层Transformer块。它结合多头潜在注意力(MLA)以实现高效推理,并在前馈层中使用DeepSeekMoE结构,每个token仅激活部分专家。该模型使用128,000个token的词汇表,并支持128K token的上下文长度。
训练采用学习率调度,峰值学习率为2.4e-3,并结合梯度裁剪和批归一化技术以适应大规模训练。数据集包含14.8万亿个token,主要以英语和中文为主,来源包括网页文本、书籍和其他精选语料库。训练过程使用了台积电制造的H800 GPU,据报道最终训练运行成本约为560万美元。
性能与基准
在公开基准上,DeepSeek V3取得了显著成绩。在MMLU(大规模多任务语言理解)基准上,它在5-shot设置下得分88.5%。在MATH-500基准上,它在零样本设置下达到90.2%。该模型在编码任务上也表现出色,在HumanEval上得分82.6%,在更具挑战性的LiveCodeBench上得分67.3%。
与同期模型相比,DeepSeek V3的性能与OpenAI和Anthropic的领先专有系统相当,但训练成本显著更低。在GPQA(研究生级Google-proof问答)基准上,它在零样本设置下得分59.1%,在DROP基准上,它在3-shot设置下达到91.6%。
发布与变体
2024年12月26日的首次发布包括基础模型和聊天优化版本DeepSeek-V3-Chat。两者均在MIT许可证下提供,允许商业使用和修改。模型权重通过Hugging Face等平台分发,促进了其在生成式AI社区的广泛采用。
2025年初的公开基准快照显示DeepSeek V3至少有五个不同变体,可能代表不同的微调运行或量化级别。这些变体出现在LMSYS Chatbot Arena和Open LLM Leaderboard等排行榜上,但每个变体的确切配置并未官方记录。截至2025年初,除基础版和聊天版外,尚未宣布其他官方变体。
影响与反响
DeepSeek V3的发布在人工智能社区引起了广泛关注,因为它结合了高性能和低训练成本。它证明了高效训练技术可以媲美以更大预算开发的模型能力。该模型在MIT许可证下的开源特性促进了其快速集成到各种应用和研究项目中。
评论家和分析师指出,DeepSeek V3的训练效率部分归功于其MoE架构,该架构降低了推理过程中的计算成本。然而,该模型依赖大量总参数,部署时仍需大量内存。该模型还引发了关于机器学习竞争格局的讨论,特别是关于中国AI公司在推进开源模型方面的作用。
技术细节与局限性
DeepSeek V3采用自定义位置编码方案,并使用多头注意力机制。它在注意力层中不使用传统的丢弃,这一设计选择提高了训练效率。模型的推理支持top-p采样和温度缩放以实现受控生成。
尽管有其优势,DeepSeek V3仍存在局限性。它可能表现出训练数据中存在的偏见,且其在除中文以外的非英语语言上的表现评估不够充分。该模型的大内存占用限制了其在消费级硬件上的部署,在某些场景下需要模型剪枝或量化才能实际使用。截至2025年初,该模型尚未有继任者更新,但DeepSeek的持续研究仍在进行中。