DeepSeek-R1 2025年1月

译自英文

DeepSeek-R1,一款由中国人工智能公司DeepSeek于2025年1月20日发布的开源权重大型语言模型,引发了全球科技股抛售潮,并导致Nvidia股价大幅下跌。

DeepSeek-R1是由杭州深度求索人工智能基础技术研究有限公司开发的开源权重大型语言模型,该公司是一家总部位于中国浙江杭州的人工智能企业。该模型于2025年1月20日发布,展示了先进的推理能力,而训练成本仅为西方同类模型的一小部分,引发了显著的市场反应。数日内,英伟达股价大幅下跌,全球科技股遭遇抛售,投资者重新评估了人工智能的竞争格局以及对昂贵图形处理单元(GPU)的需求。

DeepSeek-R1的发布不仅因其技术成就而引人注目,还因其战略意义而备受关注。该模型以开源权重许可证发布,允许研究人员和开发者访问其参数,但训练数据未予公开。这种开放性与美国主要人工智能实验室的专有方法形成鲜明对比,并凸显了中国人工智能公司在美国先进芯片出口管制下仍取得的快速进展。这一事件成为全球人工智能竞赛中的一个里程碑,既凸显了算法创新可能带来的效率提升,也反映了市场对人工智能供应链变化的敏感性。

背景

DeepSeek由梁文锋于2023年7月创立,他是人工智能爱好者,也是中国对冲基金幻方量化的联合创始人。该公司源于幻方量化早期对金融交易深度学习的研究。到2023年,幻方量化已构建了包括英伟达GPU集群在内的大量计算基础设施,为DeepSeek的模型开发提供了基础。DeepSeek的使命聚焦于推进大型语言模型,强调研究而非即时商业化。公司从中国顶尖大学招募研究人员,并不同寻常地招募了来自诗歌和高等数学等非计算机科学领域的人才,旨在拓宽模型的知识和能力。

DeepSeek的模型是开源权重的,即训练后的参数公开共享,但训练数据未以开放许可证发布。自2025年1月以来,DeepSeek已根据免费开源软件许可证发布其模型。这种方法促进了第三方采用,包括微软Azure和Perplexity AI等云提供商,它们原生托管DeepSeek模型。公司的策略还使其能够规避某些针对面向消费者技术的中国人工智能法规,因为其专注于研究和开放分发减少了直接面向消费者的曝光。

开发与训练

DeepSeek的训练基础设施源于幻方量化早期的计算集群。第一个集群Fire-Flyer于2019年建成,包含1,100个GPU,以200 Gbit/s的速度互连,耗资2亿元人民币,使用1.5年后退役。第二个集群Fire-Flyer 2于2021年开始建设,预算为10亿元人民币,包含625个节点中的5,000个PCIe A100 GPU。到2022年,其容量利用率超过96%,总计5,674万GPU小时,其中27%的容量支持外部科学计算。该集群采用了软硬件协同设计的架构,包括用于高效异步随机读取的Fire-Flyer文件系统(3FS)和用于异步通信的hfreduce库。

DeepSeek-R1通过监督微调和强化学习的组合进行训练,重点在于推理任务。该模型采用了Transformer (architecture)架构,并结合了多头注意力残差网络等技术。训练过程强调计算效率,利用较旧的硬件和算法优化来降低能耗和成本。这种效率是模型市场影响的关键因素,因为它表明高性能人工智能模型可以在不依赖最新、最昂贵芯片的情况下开发。

发布与技术特点

DeepSeek-R1于2025年1月20日发布,同时推出了同名聊天机器人。该模型在推理、数学和编码基准测试中表现出色,媲美或超过美国实验室的一些专有模型。其开源权重特性允许研究人员检查和微调模型,促进了开发者社区的形成。发布包含多个版本,旗舰模型和较小的蒸馏变体旨在实现更广泛的部署。

DeepSeek-R1的一个显著方面是其训练方法,该方法结合了基于人工智能反馈的强化学习(RLAIF)来改进推理链。该模型被设计为生成逐步解决方案,增强了其在复杂任务上的可解释性和准确性。此外,DeepSeek采用了top-p采样温度缩放等技术来控制输出多样性。模型的效率部分归因于模型剪枝数据增强方面的创新,这些创新在不牺牲性能的情况下减少了计算负担。

市场影响

DeepSeek-R1发布后,全球金融市场经历了显著反应。2025年1月27日,英伟达股价下跌约17%,市值蒸发数千亿美元。抛售蔓延至其他科技公司,包括AMD博通台积电,投资者担心如果人工智能模型可以更高效地训练,高端GPU的需求可能会减少。更广泛的科技行业,包括微软Alphabet,也出现下跌,反映出对竞争压力和人工智能基础设施支出可能降低的担忧。

市场反应由多个因素驱动。DeepSeek-R1的性能表明,尖端人工智能能力可以用更少的计算资源实现,这削弱了大规模GPU集群是先进人工智能先决条件的假设。此外,该模型的开源权重可用性威胁了美国人工智能公司的专有优势,可能使人工智能技术商品化。分析师指出,抛售也是对地缘政治影响的回应,因为一家中国公司在美国出口管制下展示了技术对等。

行业反应

行业领袖和专家对DeepSeek-R1的反应各不相同。一些人称赞该模型的效率和开放方法,视其为人工智能的民主化力量。另一些人则对国家安全和潜在滥用表示担忧,鉴于模型的开源权重。2026年2月,Anthropic指控DeepSeek使用数千个欺诈账户生成数百万条与Claude(其自身人工智能模型)的对话,以训练DeepSeek的大型语言模型。这一指控凸显了中美人工智能公司之间的竞争紧张关系。

DeepSeek的成功也引发了对美国出口管制有效性的讨论。据报道,该公司在限制收紧前已获得10,000个英伟达A100 GPU,其持续进展表明算法创新可以部分抵消硬件限制。一些观察者呼吁增加对国内人工智能研究的投资,而另一些人则主张采取更细致的出口政策。

更广泛的背景

DeepSeek-R1的发布发生在人工智能格局快速演变的时期。主要参与者如OpenAIAnthropicGoogle DeepMind正在开发越来越强大的模型,但其专有性质限制了外部审查。DeepSeek的开源权重方法提供了一种替代方案,使独立验证和适应成为可能。该模型还对发展中地区的人工智能可及性产生了影响,因为其效率和开放许可使其可以在性能较低的硬件上部署。

DeepSeek扩展到非洲,提供负担得起且节能的人工智能解决方案,是这一更广泛趋势的一部分。该公司与当地初创企业和云提供商(如华为)合作,以增强非洲语言模型并支持当地数据主权。这与西方人工智能平台形成对比,后者通常需要大量基础设施并引发数据隐私问题。

后续影响

发布后的几个月里,DeepSeek继续开发其技术并扩大其影响力。公司宣布计划于2026年5月进行A轮融资,以520亿美元的投后估值筹集70亿美元。2026年7月出现了最早可能在2027年进行首次公开募股的报道,讨论目标为700亿美元的投前估值。这些进展表明投资者对DeepSeek发展轨迹的信心,尽管此前市场动荡。

英伟达股价下跌和科技股抛售成为人工智能突破如何扰乱金融市场的案例研究。它强调了监测技术进步及其重塑行业动态潜力的重要性。对DeepSeek而言,这一事件巩固了其作为全球人工智能竞赛主要参与者的声誉,挑战了美国科技巨头的统治地位,并促使全球重新评估人工智能投资策略。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:artificial-intelligence·large-language-model·technology-event·market-impact
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史