译自英文

DeepSeek V3.1是由DeepSeek开发的大型语言模型,于2025年发布,在公开基准测试中出现了多个变体。它基于其前身DeepSeek V3的混合专家架构构建。

DeepSeek V3.1是一个由大型语言模型组成的系列,由中国人工智能公司DeepSeek开发。该系列于2025年发布,是2024年底推出的DeepSeek V3的继任者。V3.1系列包含四个变体,已出现在公开的LLM和媒体排行榜上,但公司尚未公布所有变体的详细技术规格。这些模型设计用于通用文本生成、推理和编码任务,并以开源许可证提供。

DeepSeek V3.1的开发基于Transformer (architecture)架构,具体采用混合专家(MoE)设计,每个令牌仅激活参数子集,从而提高计算效率。该模型系列是生成式AI向更大、更强系统发展的更广泛趋势的一部分,与OpenAIAnthropicGoogle DeepMind的产品竞争。DeepSeek将V3.1定位为经济高效的替代方案,其训练和推理成本显著低于许多西方同类产品。

架构与训练

DeepSeek V3.1采用神经网络混合专家架构,每个令牌由少量专家模块处理。这种设计降低了每个令牌的计算成本,同时保持了高模型容量。基础模型DeepSeek V3拥有6710亿总参数,每个令牌激活370亿参数;V3.1可能遵循类似结构,但新变体的确切参数数量尚未官方披露。模型使用深度学习技术训练,包括监督微调和基于人类反馈的强化学习(RLHF),以使输出与人类偏好对齐。

V3.1的训练数据包括大量多语言文本语料库,重点为英语和中文。公司未公布数据集大小或组成的具体细节,但已知DeepSeek使用公开网络数据和专有来源的组合。训练过程利用GPU集群,DeepSeek已发表关于优化训练效率的研究,包括使用FP8混合精度训练。

变体与基准测试

DeepSeek V3.1的四个变体已在公开基准快照中被识别,可能在参数数量或微调上有所不同。这些变体已在标准LLM基准上评估,如MMLU(知识)、HumanEval(代码生成)和MATH(数学推理)。例如,一个变体据报道在MMLU上得分88.5%,优于原始V3在同一测试中的86.2%。在HumanEval上,一个变体得分82.3%,而V3为78.1%。这些分数使V3.1跻身顶级开放权重模型之列,但具体数字因变体和评估设置而异。

在媒体排行榜上,如LMArena(Chatbot Arena)Elo评分,DeepSeek V3.1变体已获得1300-1400范围内的Elo分数,与GPT-4o和Claude 3.5 Sonnet等专有模型相当。然而,随着更多用户投票的收集,确切的Elo评分可能会变化。这些模型在编码任务中也表现出色,一个变体在SWE-bench基准上实现了75.4%的pass@1分数,该基准测试现实世界的软件工程问题。

发布与可用性

DeepSeek V3.1于2025年初发布,首批变体出现在公司API和开源下载中。模型在MIT许可证下分发,允许商业和研究使用。DeepSeek已在Hugging Face上提供模型权重,并在GitHub上提供推理代码。公司还提供API,定价显著低于OpenAIAnthropic的同类模型,,例如,截至发布日期,输入令牌定价为每百万0.27美元,输出令牌为每百万1.10美元。

发布伴随一份技术报告,详细说明训练方法和评估结果,但某些细节(如训练令牌的确切数量)被省略。DeepSeek还发表了一篇关于模型架构中使用多头注意力位置编码的论文,为机器学习的广泛学术文献做出贡献。

接受度与影响

DeepSeek V3.1的发布在AI社区引起了广泛关注,因为其性能具有竞争力,而成本仅为专有模型的一小部分。它在社交媒体和技术媒体上被广泛讨论,一些评论者指出它展示了中国AI公司的快速进步。模型的开源性质促进了其在研究和工业中的采用,并已集成到各种第三方工具和平台中。

然而,一些专家对训练数据缺乏透明度和潜在偏见表示担忧。DeepSeek未发布详细的模型卡,也未进行独立审计。截至2025年,该模型仍在积极开发中,预计未来会有更新。

与前代产品的比较

DeepSeek V3.1在推理、编码和多语言理解等多个关键领域优于V3。公司报告称,与V3相比,V3.1在12个标准基准上的平均改进为2.3%。例如,在MMLU基准上,V3.1得分88.5%,而V3为86.2%;在HumanEval基准上,得分82.3%,而V3为78.1%。这些改进归因于更好的训练数据、更精细的微调和架构调整。

与V3只有一个模型不同,V3.1是一个变体系列,允许用户选择在性能和资源使用之间取得平衡的模型。这种方法类似于其他提供商,如OpenAI的GPT-4o和GPT-4o mini,但DeepSeek的变体均为开放权重。V3.1的发布还包括更新的分词器和上下文长度,支持高达128K令牌,与领先模型的能力相匹配。

未来方向

DeepSeek继续迭代其模型系列,预计V3.1之后会有进一步更新。公司已暗示在多模态能力方面的工作,这将使模型能够处理图像和音频,而不仅仅是文本。截至2025年,尚未宣布V4的官方发布日期,但快速的发展步伐表明新版本将在年内出现。DeepSeek模型对更广泛AI格局的影响仍是一个关注话题,特别是在人工智能全球竞争的背景下。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:large-language-models·artificial-intelligence·deep-learning·open-source-software
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史