DeepSeek-R1发布

译自英文

DeepSeek-R1是由中国人工智能公司DeepSeek于2025年1月发布的一款开放权重推理模型,因其高性能和低训练成本引发了全球科技股抛售。

DeepSeek-R1是一个开放权重的大型语言模型,由杭州深度求索人工智能基础技术研究有限公司开发,该公司是一家总部位于浙江杭州的中国人工智能公司,并由对冲基金High-Flyer提供资金支持。该模型于2025年1月与DeepSeek聊天机器人一同发布,展现出可与领先专有系统相媲美的高级推理能力,而其报道的训练效率和开放可用性则引发了全球科技股的显著抛售,尤其影响了Nvidia和其他芯片制造商。

此次发布标志着Artificial intelligence领域的一个显著时刻,因为它挑战了关于最先进大型语言模型必须依赖海量计算资源的假设。DeepSeek-R1的开放权重框架使全球研究人员和开发者能够下载并适配该模型,这促进了其快速采用和市场反应。

背景与公司起源

DeepSeek由梁文峰于2023年7月创立,他此前曾于2015年6月共同创立了High-Flyer。High-Flyer于2016年10月21日开始使用依赖GPU的深度学习模型进行股票交易,从早期基于CPU的线性模型过渡而来。到2017年底,其大部分交易决策已由人工智能驱动。

2019年,High-Flyer构建了其第一个计算集群Fire-Flyer,耗资2亿元人民币,包含1100个以200 Gbit/s速度互联的GPU。该集群在运行1.5年后退役。到2021年,梁文峰已在美国对华芯片销售限制生效前购得约10000个Nvidia A100 GPU。

Fire-Flyer 2集群于2021年开始构建,预算为10亿元人民币,最终以5000个PCIe A100 GPU在625个节点上运行。2022年,其容量利用率超过96%,总计达到5674万GPU小时,其中27%的容量用于支持外部科学计算。该集群最初仅使用PCIe连接,因为模型适配于单个40 GB GPU VRAM内,仅需数据并行;后来为需要模型并行的大型模型添加了NVLink和NCCL。

创立与公司结构

2023年4月14日,High-Flyer宣布创建通用人工智能(AGI)研究实验室。两个月后,即2023年7月17日,该实验室被剥离为一家名为DeepSeek的独立公司,High-Flyer为其主要投资者。风险资本投资者最初不愿为此风险投资提供资金,怀疑其能否快速退出。

DeepSeek总部位于浙江杭州,仍由High-Flyer拥有并资助。梁文峰担任首席执行官,截至2024年5月,他通过两家壳公司个人持有84%的股份。该公司保持了以研究为导向的策略,声明没有立即商业化的计划,这也使其能够避开某些针对面向消费者技术的中国人工智能法规。

DeepSeek-R1模型

DeepSeek-R1于2025年1月作为开放权重推理模型发布。与来自OpenAIAnthropic等公司的专有模型不同,DeepSeek-R1的确切参数是公开共享的,但其训练数据并未开放许可。该模型在推理基准测试中表现出色,据报道在某些特定任务上可与领先的西方模型相媲美或超越。

该模型的开发受益于DeepSeek对算法持续优化以最大化计算效率的努力,这是在美国芯片出口限制下的一种必要之举。这种对效率的关注使DeepSeek能够使用较旧或性能较弱的硬件取得有竞争力的结果,从而降低了能耗和训练成本。

全球市场影响

DeepSeek-R1发布后,全球科技股经历了急剧抛售。投资者对主要人工智能公司高额资本支出可能并非实现先进人工智能能力所必需的可能性作出反应。作为人工智能训练GPU的关键供应商,Nvidia的市场价值大幅下跌,其他芯片制造商和云服务提供商也受到影响。

此次抛售反映了人们的担忧,即像DeepSeek-R1这样的开放权重模型可能使人工智能开发商品化,削弱那些在专有模型和基础设施上投入巨大的公司的竞争优势。该事件在金融媒体上被广泛报道,并引发了关于人工智能投资热潮可持续性的辩论。

采用与生态系统

由于其开放权重框架,DeepSeek-R1和其他DeepSeek模型被云提供商原生托管,包括Microsoft Azure和Perplexity AI。该模型在主要平台上的可用性促进了其集成到各种应用和研究项目中。

DeepSeek还扩展到非洲,提供更实惠且功耗更低的人工智能解决方案。该公司加强了非洲语言模型,并催生了大量初创公司,例如在内罗毕。与华为的存储和云计算服务一起,DeepSeek对撒哈拉以南非洲科技界的影响相当可观,提供了本地数据主权和比西方人工智能平台更大的灵活性。

训练基础设施

DeepSeek的训练框架依赖于Fire-Flyer集群,截至2025年Fire-Flyer 2仍在运行。该集群采用协同设计的软件和硬件架构。在硬件方面,Nvidia GPU使用200 Gbps互联,网络拓扑由两棵胖树组成,以提供高对分带宽。集群分为两个区域,支持跨区域任务。

在软件方面,关键组件包括:

  • 3FS(Fire-Flyer文件系统):一种分布式并行文件系统,专为异步随机读取设计,使用Direct I/O和RDMA Read。与标准Buffered I/O不同,Direct I/O不缓存数据,这对于数据不被复用的随机读取是高效的。
  • hfreduce:一个用于异步通信的库,最初设计用于在某些场景下替代Nvidia的NCCL,以提高可扩展性和性能。

这些创新使DeepSeek能够在硬件限制下高效训练大型模型,这为DeepSeek-R1所展示的成本效益做出了贡献。

后续发展

2026年2月,Anthropic指控DeepSeek使用数千个欺诈账户生成数百万次与Claude的对话来训练其自身模型。2026年4月,投资者开始讨论一轮3亿美元的融资,这将使DeepSeek估值达到100亿美元。该公司于2026年5月完成了A轮融资,获得70亿美元,使融资后估值达到520亿美元。

2026年7月,彭博社和《金融时报》报道称,DeepSeek已开始为首次公开募股(IPO)做准备,最早可能在2027年上市。同月,该公司启动了另一轮融资讨论,目标融资前估值为700亿美元。

DeepSeek的招聘方式强调技能而非冗长的工作经验,导致许多新员工是刚毕业的大学生。该公司还招募没有计算机科学背景的人员,以扩展在诗歌和高等数学等领域的专长。据《纽约时报》报道,数十名DeepSeek研究人员与中国人民解放军实验室和“国防七子”有或曾有联系。自2025年以来,其聊天机器人被中国人民解放军采用于非战斗角色,包括医院、人民武装警察部队和国家动员组织。

结论

2025年1月DeepSeek-R1的发布代表了Generative AI领域的一个重要里程碑,证明了开放权重模型可以以较低的资源需求实现有竞争力的性能。全球科技股抛售凸显了该模型的颠覆性潜力,而随后的融资轮次和IPO准备则表明了投资者的强烈兴趣。DeepSeek对效率和开放可用性的持续关注,使其成为不断演变的人工智能生态系统中的显著参与者。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:artificial-intelligence·large-language-models·deepseek·2025-events
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史