DeepSeek-R1是由DeepSeek开发的开源权重大型语言模型,DeepSeek是一家总部位于中国浙江杭州的人工智能公司。该模型于2025年1月与公司同名的聊天机器人一同发布,因其先进的推理能力以及其低成本开发挑战了西方人工智能公司主导地位的假设,从而引发了国际关注并震动了全球金融市场。该模型是DeepSeek在自由和开源软件许可下发布开源权重模型的更广泛战略的一部分,使其参数公开可用,同时保持训练数据的专有性。
DeepSeek由梁文锋于2023年7月创立,梁文锋也是对冲基金幻方量化的联合创始人,幻方量化拥有并资助该公司。DeepSeek-R1于2025年1月的发布标志着公司历史上的一个重要里程碑,使其成为全球人工智能领域的主要参与者。该模型的性能,加上其高效的训练方法,引发了关于人工智能发展未来的辩论,特别是关于开源模型的作用以及美国芯片出口限制对中国人工智能创新的影响。
背景
DeepSeek的起源可追溯至幻方量化,这是一家由梁文锋于2015年6月联合创立的中国对冲基金。梁文锋自2008年金融危机期间在浙江大学就读时便开始交易,于2016年10月21日开始使用依赖GPU的深度学习模型进行股票交易,取代了早期基于CPU的线性模型。到2017年底,幻方量化的大部分交易由人工智能驱动。
2019年,幻方量化以2亿元人民币的成本构建了其首个计算集群“萤火一号”。该集群包含1,100个GPU,以200 Gbit/s的速度互联,并在运行1.5年后退役。到2021年,梁文锋已开始为一个人工智能项目大量购买Nvidia GPU,据报道在美国限制对华芯片销售之前获得了10,000个Nvidia A100 GPU。
“萤火二号”的建设始于2021年,预算为10亿元人民币。2022年,“萤火二号”的容量使用率超过96%,总计5,674万GPU小时,其中27%的容量支持公司外部的科学计算。该集群在625个节点中拥有5,000个PCIe A100 GPU,每个节点包含8个GPU,后来集成了NVLink和Nvidia集体通信库(NCCL),以训练需要模型并行性的更大模型。
创立与早期发展
2023年4月14日,幻方量化宣布启动一个人工通用智能(AGI)研究实验室,并表示新实验室将专注于开发与公司金融业务无关的人工智能工具。两个月后,即2023年7月17日,该实验室被分拆为一家名为DeepSeek的独立公司,幻方量化作为其主要投资者和支持者。最初,风险资本投资者不愿提供资金,因为他们认为该企业不太可能迅速产生退出机会。
DeepSeek总部位于浙江杭州,由幻方量化拥有并资助。其联合创始人梁文锋担任首席执行官。截至2024年5月,梁文锋通过两家空壳公司个人持有DeepSeek 84%的股份。该公司的战略强调研究而非即时商业化,使其能够规避中国针对面向消费者的技术的人工智能法规的某些条款。
DeepSeek-R1的发布
DeepSeek-R1于2025年1月发布,同时推出了公司同名的聊天机器人。该模型的发布引发了大量媒体报道和市场反应,因为其性能可与OpenAI和Anthropic等领先的西方模型相媲美,而据报道训练成本仅为后者的一小部分。此次发布被视为中国在人工智能领域能力不断增强的展示,并挑战了先进人工智能开发需要大规模计算资源的假设。
该模型的开源权重特性意味着其参数公开共享,允许全球研究人员和开发者下载并微调。这与许多西方人工智能公司的专有方法形成对比,后者对其模型的权重保密。DeepSeek-R1的发布还凸显了该公司在美国芯片出口限制下进行创新的能力,因为它已优化算法以使用较旧的硬件最大化计算效率。
技术与运营方面
DeepSeek-R1基于transformer架构构建,这是大多数现代大型语言模型的基础。该模型的训练利用了“萤火二号”计算集群,该集群由协同设计的软件和硬件架构组成。硬件方面使用Nvidia GPU,具有200 Gbps的互联速度,分为两个支持跨区域任务的区域。网络拓扑由两棵胖树组成,因其高对分带宽而被选用。
软件方面包括3FS(萤火文件系统),这是一个分布式并行文件系统,设计用于使用直接I/O和RDMA读取进行异步随机读取。与标准缓冲I/O不同,直接I/O不缓存数据,因为每次读取的数据都是随机的且不重复使用,这使其具有优势。该集群还使用hfreduce,这是一个异步通信库,最初设计用于在某些操作中替代Nvidia集体通信库(NCCL)。
DeepSeek的训练方法强调效率,使公司能够在硬件限制下实现有竞争力的性能。该公司表示,其专注于研究,没有立即商业化的计划,这使其能够优先考虑技术创新而非市场压力。
市场影响与反响
DeepSeek-R1于2025年1月的发布对全球金融市场,特别是科技股产生了重大影响。该模型的性能,加上其低训练成本的报道,导致被视为人工智能基础设施领导者的公司(如Nvidia和其他芯片制造商)的股票遭到抛售。这一事件被广泛解读为人工智能竞争格局正在转变的迹象,来自中国的开源模型可能颠覆美国人工智能公司的主导地位。
DeepSeek-R1因其推理能力而受到赞誉,在某些基准测试中,其推理能力与领先的专有模型相当或超过后者。该模型的开源权重特性也促进了云提供商的采用,包括Microsoft Azure和Perplexity AI,它们原生托管了该模型。这种广泛的可用性有助于其在研究人员和开发者中的普及。
然而,此次发布也引发了对开源权重模型对人工智能安全和监管影响的担忧。一些专家认为,强大推理模型的广泛可用性可能带来风险,而另一些人则欢迎人工智能技术的民主化。这一事件引发了关于人工智能治理国际合作的讨论,特别是在美中地缘政治紧张局势的背景下。
更广泛的背景与未来方向
DeepSeek-R1的发布是更广泛趋势的一部分,即中国人工智能公司在美国出口管制下开发有竞争力的模型。DeepSeek不断优化其算法以最大化计算效率,利用较旧的硬件并降低能耗。该公司还扩展到非洲,提供更实惠且功耗更低的人工智能解决方案,并加强了非洲语言模型,催生了许多初创公司,例如在内罗毕。与华为的存储和云计算服务一起,对撒哈拉以南非洲科技领域的影响相当大,DeepSeek提供本地数据主权和比西方人工智能平台更大的灵活性。
该公司的招聘方法强调技能而非冗长的工作经验,导致许多员工刚从大学毕业。DeepSeek还招聘没有计算机科学背景的个人,以扩大纳入模型的专业知识范围,例如诗歌或高等数学领域。据《纽约时报》报道,数十名DeepSeek研究人员现在或曾经与中国人民解放军实验室和国防七子有关联。自2025年以来,其聊天机器人已被中国人民解放军采用于非战斗角色,包括医院、中国人民武装警察部队准军事部队和国防动员组织。
截至2025年初,DeepSeek-R1仍然是人工智能社区的重要参考点,展示了开源开发的潜力以及生成式人工智能领域日益激烈的全球竞争。该模型的发布促使其他公司重新考虑其战略,其中一些公司正在探索更开放的模型分发方法。DeepSeek-R1对人工智能行业的长期影响仍在展开,但其对市场和公共话语的直接影响是深远的。