DeepSeek-V2是由中国人工智能公司DeepSeek于2024年5月发布的大型语言模型。它采用混合专家(MoE)架构,仅对每个输入激活其参数的一部分,从而实现高效计算并降低训练成本。该模型被定位为西方开发者当代模型的高性能替代品,其报告的训练成本显著低于同类系统。
DeepSeek-V2的发布发生在大型语言模型快速发展的时期,当时OpenAI、Anthropic和Google DeepMind等开发者也在发布新系统。DeepSeek的方法不同之处在于其强调开放权重和成本效率,这与该公司在硬件限制下最大化算法效率的总体战略一致。
架构与设计
DeepSeek-V2基于Transformer架构构建,这是现代生成式AI系统的主导框架。其定义性特征是混合专家设计,该设计将模型的参数划分为多个专家模块。在推理过程中,门控机制仅为每个令牌选择少量专家,从而在保持总参数数量庞大的同时减少计算负载。
该模型在多头注意力和位置编码方面引入了创新以提高效率。具体而言,DeepSeek-V2引入了一种新颖的注意力机制,减少了键值缓存的内存占用,这是长上下文任务中的常见瓶颈。这种设计选择使模型能够处理更长的序列,而无需按比例增加硬件需求。
与参数规模相似的密集模型相比,DeepSeek-V2在训练和推理过程中每个令牌所需的浮点运算次数更少。该公司报告称,该模型在使用显著更少计算资源的情况下实现了与领先系统竞争的性能,这一结果归因于MoE架构和训练流程的精心工程。
训练与成本
DeepSeek-V2在Fire-Flyer 2计算集群上训练,这是一个由DeepSeek的母公司幻方量化运营的定制系统。该集群由数千个Nvidia GPU组成,以高带宽互连,并配有协同设计的软件栈,包括3FS分布式文件系统和自定义通信库。该基础设施旨在最大化现有硬件上的效率,特别是考虑到美国对华先进芯片出口限制。
DeepSeek-V2的训练运行使用了数万亿令牌的数据集,这些数据来自公共网络来源、书籍和其他文本语料库。该公司未披露确切的数据集构成,这与其在发布模型权重的同时保持训练数据专有的做法一致。报告的训练成本约为560万美元,这一数字因其比西方实验室同类模型的估计成本低一个数量级而受到关注。
这种成本效率是通过算法改进、硬件优化以及MoE架构减少计算需求的组合实现的。DeepSeek的工程师还采用了梯度裁剪和学习率调度等技术来稳定训练并改善收敛。
性能与基准
DeepSeek-V2在自然语言处理任务的一系列标准基准上进行了评估,包括语言理解、推理和代码生成。在多项广泛使用的测试中,如MMLU(大规模多任务语言理解)和HumanEval,该模型取得了与其他开发者当代开放权重模型相当或更高的分数。
该模型的性能在数学推理和中文任务方面尤为突出,这反映了其训练数据的构成以及公司服务国内外用户的重点。在并排比较中,DeepSeek-V2优于几个更大的密集模型,表明MoE方法可以用更少的活跃参数提供强劲结果。
第三方研究人员的独立评估普遍证实了该公司的说法,尽管一些人指出该模型在某些基准上的性能因具体评估设置而异。发布还包括模型的较小变体,允许在性能较弱的硬件上部署,同时保留完整模型的大部分能力。
发布与反响
DeepSeek-V2于2024年5月公开发布,包括模型权重和描述其架构及训练方法的技术文档。这种开放权重的方法使其区别于仅通过API访问提供的专有模型,使研究人员和开发者能够下载、微调并在自己的基础设施上部署该模型。
机器学习社区的反响总体积极,许多人称赞技术创新和发布的透明度。低训练成本成为讨论的焦点,引发了关于其他开发者是否能实现类似效率提升的问题。一些评论者将此次发布解读为先进AI开发不再是资金雄厚的西方公司专属领域的证据。
然而,此次发布也引发了对潜在滥用的担忧,因为开放权重且与某些商业产品相比缺乏内置安全过滤器。DeepSeek与中国的关系以及一些研究人员之前的军事背景在报道中被提及,尽管公司本身强调其专注于研究而非军事应用。
与当代模型的比较
在发布时,DeepSeek-V2经常与Meta的Llama 3和Mistral的Mixtral等模型进行比较,这些模型也采用开放权重或开源方法。在原始基准分数方面,DeepSeek-V2与这些系统具有竞争力,而其训练成本显著低于同类模型的公开报告数字。
该模型还与OpenAI和Anthropic的专有系统进行了比较,尽管直接比较因评估方法的差异和这些系统的封闭性而变得复杂。DeepSeek发布详细技术报告的决定使得比仅API模型更深入的分析成为可能。
一个显著差异是DeepSeek-V2在中文任务上的表现,它通常优于主要基于英语数据训练的模型。这使其在中文市场应用中特别有吸引力,包括金融、教育和政府领域的企业用例。
影响与遗产
DeepSeek-V2确立了该公司在全球AI领域的重要地位,证明了高效训练技术可以产生最先进的结果。该模型的成功影响了该领域的后续发展,包括对混合专家架构和成本感知训练方法的兴趣增加。
此次发布还具有地缘政治影响,突显了中国公司尽管面临高端硬件出口管制仍能开发先进AI系统的能力。DeepSeek对算法效率的关注,部分源于必要性,成为面临类似限制的其他开发者的典范。
在发布后的几个月里,DeepSeek继续迭代其技术,最终发布了具有进一步改进的后续模型。DeepSeek-V2确立的原则,,开放权重、成本效率和架构创新,,在后续发布中仍然是公司方法的核心。
技术规格
DeepSeek-V2的总参数数量报告为2360亿,由于MoE架构,每个令牌仅激活210亿个参数。该模型使用128,000个令牌的上下文窗口,这得益于减少内存使用的高效注意力机制。训练使用混合精度进行,结合BF16和FP32格式以平衡准确性和速度。
模型的标记器在多语言语料库上训练,特别关注中文和英文文本。发布包括多种格式的权重,兼容vLLM和TensorRT等流行推理框架。模型的较小版本,总参数较少,也提供用于在性能较弱的硬件上部署。
DeepSeek-V2的架构作为公司后续模型的基础,后续发布在其创新基础上构建,同时结合了从人类反馈中进行强化学习等额外技术。该模型仍可下载,其技术文档在学术研究中继续被引用,用于高效语言模型训练的研究。