DeepSeek-V3发布

译自英文

DeepSeek-V3,一个拥有6710亿参数的混合专家大语言模型,于2024年12月由中国AI公司DeepSeek发布,与OpenAI和Google的闭源模型相抗衡。

DeepSeek-V3是由DeepSeek开发的大型语言模型,DeepSeek是一家总部位于中国浙江杭州的人工智能公司。该模型于2024年12月发布,采用混合专家(MoE)架构,总参数达6710亿,其中每个令牌激活370亿参数。其设计旨在与OpenAIAnthropicGoogle DeepMind的专有模型竞争,同时以开放权重模型的形式发布,这意味着其参数公开共享,但训练数据未开放许可。

DeepSeek-V3的发布标志着Generative AI领域的一个重要里程碑,证明了高性能模型可以在较旧的硬件上高效训练,部分原因是美国对先进芯片出口到中国的限制。该模型的发布附带了技术报告和开放权重,使研究人员和开发者能够使用和微调它,促进了其在各种应用中的快速采用。

背景

DeepSeek由梁文锋于2023年7月创立,他还共同创立了High-Flyer,这是一家最初专注于AI驱动交易的中国对冲基金。该公司的起源可追溯到High-Flyer对GPU计算集群的投资,从2019年的Fire-Flyer开始,该集群包含1100个GPU,以200 Gbit/s的速度互联。到2021年,High-Flyer在美国出口限制生效前已购置10000个Nvidia A100 GPU,从而能够构建Fire-Flyer 2,这是一个更大的集群,包含625个节点中的5000个PCIe A100 GPU。

DeepSeek的使命是推进通用人工智能研究,重点关注开放权重模型。公司从中国顶尖大学招募研究人员,并从非传统领域(如诗歌和高等数学)招聘人才,以拓宽模型能力。这种方法与研究优先的策略相结合,使DeepSeek能够在模型架构和训练效率方面进行创新。

模型架构

DeepSeek-V3采用混合专家架构,这种设计将模型划分为多个专门的子网络(即专家),并且每个输入仅激活其中一部分。这种方法降低了计算成本,同时保持了高容量。该模型拥有6710亿参数,但每个令牌仅激活370亿,从而实现高效的推理和训练。

该架构融合了多头潜在注意力和无辅助损失负载均衡等创新,这些技术提高了训练稳定性和性能。这些技术建立在早期Transformer (architecture)模型和Multi-Head Attention工作的基础上,使DeepSeek-V3能够有效处理长上下文和复杂推理任务。

训练与基础设施

DeepSeek-V3在Fire-Flyer 2上训练,这是一个与定制软件和硬件共同设计的计算集群。该集群使用Nvidia GPU,具有200 Gbps互联和胖树网络拓扑,以实现高二分带宽。软件栈包括3FS(一种针对异步随机读取优化的分布式并行文件系统)和hfreduce(一种用于异步通信的库)。

训练如此规模的模型需要大量计算资源。DeepSeek报告称,Fire-Flyer 2在2022年的使用率超过96%,总计达5674万GPU小时。该集群的设计强调效率,最初使用PCIe A100 GPU,因为模型适合40 GB VRAM,后来引入NVLinks和NCCL以支持需要模型并行性的更大模型。

训练过程可能使用了Adam (Optimizer)变体、Learning Rate SchedulingGradient Clipping等技术以确保稳定性。DeepSeek对算法效率的关注使其能够在硬件限制下训练出有竞争力的模型,这一策略被视为对美国芯片限制的回应。

性能与基准测试

DeepSeek-V3在各种基准测试中表现出竞争力,可与OpenAIGoogle DeepMind的闭源模型相媲美。在内部评估中,它在自然语言理解、代码生成和数学推理方面取得了强劲成绩。例如,据报道它在某些编码任务上优于GPT-4o等模型,尽管发布时的独立验证有限。

该模型的开放权重特性使研究社区能够测试和验证其能力,导致其在学术和商业环境中被广泛采用。其效率和性能使其对计算资源有限的组织特别有吸引力。

发布与反响

DeepSeek-V3于2024年12月发布,在AI社区引起了广泛关注。它被视为开放权重模型能够挑战专有系统的证明,引发了关于AI发展未来的辩论。该模型由Microsoft Azure和Perplexity AI等云提供商托管,使其可供广泛受众使用。

批评者指出,DeepSeek的开放权重方法虽然对参数透明,但未披露训练数据,引发了对数据来源和潜在偏见的质疑。此外,该公司与High-Flyer的联系及其研究人员与中国国防机构的关联也受到审视,尽管DeepSeek表示其重点是研究。

影响与遗产

DeepSeek-V3影响了AI领域的后续发展,包括2025年1月发布的DeepSeek-R1,该模型融入了推理能力。该模型还促进了高效AI的更广泛趋势,鼓励其他公司优化资源消耗。

此次发布具有地缘政治影响,凸显了中国公司在出口管制下进行创新的能力。它还引发了关于AI民主化的讨论,因为开放权重模型使更广泛的人群能够获得先进技术。

未来方向

继DeepSeek-V3之后,DeepSeek继续以开源许可证发布模型,扩大了其产品组合。该公司专注于研究和效率的策略使其在全球AI格局中占据关键地位。截至2025年,Fire-Flyer 2仍在运行,支持持续的研究和开发。

DeepSeek向非洲扩展,提供经济实惠且节能的AI解决方案,表明其进入服务不足市场的雄心。该公司的未来发布可能会基于DeepSeek-V3引入的创新,可能影响下一代Large language model的发展。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:deepseek-v3·large-language-model·ai-launch·open-weights
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史