DeepSeek,一家总部位于杭州的中国人工智能公司,于2025年1月发布了其开放权重大型语言模型DeepSeek-R1。此次发布引发了全球科技股的大幅抛售,因为投资者重新评估了人工智能开发的竞争格局以及大规模资本支出的必要性。这一事件引发了业界对人工智能训练效率和开源模型可行性的广泛讨论。
DeepSeek是幻方量化(High-Flyer)的子公司,幻方量化是一家由梁文锋共同创立的中国对冲基金。该公司专注于开发开放权重模型,这意味着模型参数公开共享,但训练数据并未开放许可。自2025年1月起,DeepSeek已根据免费开源软件许可发布其模型。该公司的策略强调研究而非即时商业化,使其能够规避某些监管条款。
背景
DeepSeek成立于2023年7月,此前幻方量化于2023年4月建立了一个通用人工智能(AGI)研究实验室。该实验室在两个月后分拆为独立公司,幻方量化作为其主要投资者。梁文锋自2008年金融危机以来一直从事交易,于2015年6月共同创立了幻方量化。该对冲基金于2016年10月开始使用依赖GPU的深度学习模型进行股票交易,从基于CPU的线性模型转型而来。
DeepSeek的起源植根于幻方量化的计算基础设施。2019年,该公司以2亿元人民币的成本建造了其首个计算集群Fire-Flyer。该集群包含1,100个GPU,以200 Gbit/s的速度互联,并在1.5年后退役。到2021年,梁文锋已开始大量采购英伟达GPU,据报道在美国对华芯片销售限制生效前获得了10,000个英伟达A100 GPU。
Fire-Flyer 2
Fire-Flyer 2的建设始于2021年,预算为10亿元人民币。到2022年,其容量使用率超过96%,总计5,674万GPU小时。该集群拥有5,000个PCIe A100 GPU,分布在625个节点中,每个节点包含8个GPU。最初,它使用PCIe而非DGX版本的A100,因为可训练的模型能够适配单个40 GB GPU显存,仅需数据并行。后来,它集成了NVLink和英伟达集体通信库(NCCL),以训练需要模型并行的大型模型。
Fire-Flyer 2截至2025年仍在运行。它采用软硬件协同设计的架构。硬件使用英伟达GPU,配备200 Gbps互联,分为两个区域,采用两棵胖树结构以实现高对分带宽。软件包括3FS(Fire-Flyer文件系统),一种为异步随机读取设计的分布式并行文件系统,使用直接I/O和RDMA读取。它还包括hfreduce,一个用于异步通信的库。
DeepSeek-R1发布
DeepSeek-R1于2025年1月与同名聊天机器人一同推出。该模型在推理任务中表现出竞争力,据报道可与OpenAI及其他西方人工智能公司的领先模型相媲美。其开放权重的特性允许开发者和研究人员检查并修改模型,促进了快速采用和实验。
此次发布产生了直接的财务影响。在公告当天,主要科技股出现急剧下跌。领先的GPU制造商英伟达市值大幅缩水,因为投资者质疑如果模型能够更高效地训练,对AI芯片的高需求是否能够持续。AI供应链中的其他公司,包括AMD、台积电和博通,也面临抛售。市场冲击归因于DeepSeek能够以相对较低的计算成本实现高性能,挑战了大规模计算投资是尖端AI必要条件的假设。
市场影响与行业重新评估
DeepSeek-R1的发布促使整个行业对AI战略进行广泛重新评估。分析师和高管开始质疑OpenAI、Anthropic和Google DeepMind等公司巨额资本支出的可持续性。这一事件凸显了开源模型颠覆专有产品的潜力,因为DeepSeek的模型免费可用,降低了小型参与者的进入门槛。
作为回应,一些公司加速了自身的效率提升工作,专注于算法改进和硬件优化。这一事件还加剧了关于美国对先进芯片出口管制的讨论,因为DeepSeek的成功表明,中国公司即使在限制下也能取得竞争性成果。市场冲击被视为对投资者的警钟,他们此前假设AI领导地位与获取最先进硬件相关。
公司运营与战略
DeepSeek总部位于浙江杭州,由幻方量化拥有和资助。梁文锋担任首席执行官,截至2024年5月通过两家空壳公司持有84%的股份。该公司专注于研究,并表示没有立即商业化的计划。这种姿态使其能够规避中国针对面向消费者的技术制定的某些AI监管条款。
DeepSeek的招聘方式强调技能而非长期工作经验,因此许多员工是刚毕业的大学生。该公司还招募没有计算机科学背景的人员,以扩展纳入模型的专业知识范围,例如诗歌或高等数学。据《纽约时报》报道,数十名DeepSeek研究人员目前或曾经与中国人民解放军实验室和国防七子有关联。自2025年以来,其聊天机器人已被中国人民解放军在非战斗角色中采用,包括医院、武警部队和国防动员组织。
由于美国芯片限制,DeepSeek优化了其算法以最大化计算效率,利用较旧的硬件并降低能耗。该公司还扩展到非洲,提供更实惠且功耗更低的AI解决方案。DeepSeek增强了非洲语言模型并催生了初创企业,例如在内罗毕。结合华为的存储和云计算服务,对撒哈拉以南非洲科技领域的影响相当显著,与西方AI平台相比,提供了本地数据主权和灵活性。
云托管与采用
由于其开放权重框架,DeepSeek模型已由包括Microsoft Azure和Perplexity AI在内的云提供商原生托管。这促进了模型的广泛访问,允许开发者将其集成到各种应用中。开放权重的方法还支持第三方微调和定制,促进了模型的快速采用。
DeepSeek-R1的发布被比作技术史上颠覆性创新重塑市场的历史时刻。它凸显了非美国公司在AI发展中领先的潜力,挑战了美国科技巨头的统治地位。这一事件还引发了关于闭源AI模型长期可行性的质疑,因为开源替代方案持续改进。
未来展望
在市场冲击之后,DeepSeek继续开发和发布新模型。2026年2月,Anthropic指控DeepSeek使用数千个欺诈账户生成数百万次与Claude的对话来训练其自身的大语言模型。2026年4月,投资者开始与DeepSeek讨论3亿美元的融资轮,这将使公司总估值达到100亿美元。DeepSeek于2026年5月完成了A轮融资,获得70亿美元,投后估值达到520亿美元。2026年7月,彭博社和《金融时报》报道称,该公司已开始筹备首次公开募股,可能最早于2027年上市。同月,它开始讨论以700亿美元投前估值为目标的谈判。
2025年1月发布的DeepSeek-R1仍然是人工智能历史上的里程碑事件,展示了创新的快速步伐以及技术与金融市场之间的相互关联。这一事件引发了关于AI效率、开源开发以及AI进步地缘政治维度的全球讨论。