译自英文

DeepSeek是一家中国人工智能公司,由梁文峰于2023年7月创立,致力于开发开放权重的大型语言模型。该公司隶属于幻方量化,并于2024年发布了包括DeepSeek-V2和R1在内的知名模型。

DeepSeek是一家中国人工智能公司,开发开放权重的大型语言模型(LLM)。公司总部位于浙江杭州,由中国对冲基金幻方量化(High-Flyer)全资持有并提供资金支持。公司由梁文锋于2023年7月创立,专注于研究导向的人工智能开发,其模型以开放权重许可证形式公开发布。

DeepSeek的方法强调计算效率,并在传统计算机科学领域之外广泛招募人才。其模型已由主要云服务提供商托管,并因其性能和可及性而获得国际关注,尤其是在寻求西方人工智能平台替代品的地区。

创立与早期历史

DeepSeek的起源可追溯至幻方量化,该公司由梁文锋于2015年6月联合创立。2016年10月21日,幻方量化开始使用依赖GPU的深度学习模型进行股票交易,从早期基于CPU的线性模型过渡。到2017年底,其大部分交易操作已由人工智能驱动。

2019年,幻方量化以2亿元人民币的成本建造了首个计算集群萤火一号(Fire-Flyer)。该集群包含1,100块GPU,以200 Gbit/s速率互联,运行1.5年后退役。到2021年,梁文锋已开始大量购买英伟达GPU,据报在美国对华芯片销售限制生效前获得了10,000块英伟达A100 GPU。

萤火二号(Fire-Flyer 2)的建设始于2021年,预算为10亿元人民币。2022年,该集群容量利用率超过96%,总计5,674万GPU小时,其中27%的容量支持公司外部的科学计算。萤火二号最初使用5,000块PCIe A100 GPU,分布在625个节点中,每个节点包含8块GPU,后来集成了NVLink和英伟达集体通信库以支持更大规模的模型。

2023年4月14日,幻方量化宣布成立通用人工智能(AGI)研究实验室。两个月后,即2023年7月17日,该实验室分拆为独立公司DeepSeek,幻方量化作为主要投资者。最初,风险投资机构因担心快速退出问题而不愿提供资金。

2024年模型发布

2024年,DeepSeek在其开放权重框架下发布了多款重要模型。2024年初推出的DeepSeek-V2展示了模型架构和训练效率方面的进步。公司继续优化算法以最大化计算效率,利用较旧的硬件并降低能耗,部分原因是美国芯片限制。

DeepSeek-R1于2025年1月推出,同时发布的还有同名聊天机器人,标志着重大里程碑。该模型因其推理能力和高性价比的训练方法获得国际认可。自2025年1月起,DeepSeek以免费和开源软件许可证发布其模型。

公司运营

DeepSeek总部位于浙江杭州,梁文锋担任首席执行官。截至2024年5月,梁文锋通过两家空壳公司个人持有DeepSeek 84%的股份。公司专注于研究,并表示没有立即商业化的计划,这使其能够规避中国人工智能法规中针对面向消费者技术的某些条款。

由于其开放权重框架,DeepSeek模型已由微软Azure和Perplexity AI等云服务提供商原生托管。2026年2月,Anthropic指责DeepSeek使用数千个欺诈账户生成数百万次与Claude的对话来训练其自己的LLM。2026年4月,投资者开始讨论一轮3亿美元的融资,这将使公司估值达到100亿美元。DeepSeek于2026年5月完成了A轮融资,获得70亿美元,投后估值达到520亿美元。2026年7月,彭博社和《金融时报》报道称,公司正在筹备最早于2027年进行IPO,另有一轮讨论的目标是700亿美元的投前估值。

训练框架

DeepSeek运营萤火一号和萤火二号计算集群。萤火二号截至2025年仍在运行,采用软硬件协同设计的架构。硬件使用英伟达GPU,配备200 Gbps互联,分为两个区域并支持跨区域任务。网络拓扑使用两个胖树结构以实现高对分带宽。

关键软件组件包括3FS(萤火文件系统),这是一种分布式并行文件系统,设计用于使用直接I/O和RDMA读取进行异步随机读取。由于每次数据读取都是随机的且不会重复使用,因此无需缓存。另一个组件是hfreduce,一个异步通信库,最初设计用于替代英伟达集体通信库的功能。

战略与招聘

DeepSeek的招聘方法强调技能而非长期工作经验,因此许多员工是刚毕业的大学生。公司招募没有计算机科学背景的人才,以扩展在诗歌和高等数学等领域的能力。据《纽约时报》报道,数十名DeepSeek研究人员目前或曾经与中国人民解放军实验室和国防七子有关联。

自2025年以来,DeepSeek的聊天机器人被中国人民解放军在非战斗角色中采用,包括医院、武警部队和国防动员组织。公司还扩展到非洲,提供更实惠且功耗更低的人工智能解决方案,支持非洲语言模型和初创企业的发展,例如在内罗毕。与华为的存储和云计算服务一起,DeepSeek对撒哈拉以南非洲科技界的影响相当可观,与西方人工智能平台相比,它提供了本地数据主权和灵活性。

接受度与影响

DeepSeek的模型因其在大型语言模型生态系统中的效率和开放可及性而获得认可。公司以研究而非商业化为重点,这使得它区别于OpenAIAnthropic等竞争对手。其训练创新,包括萤火集群和定制软件,推动了机器学习深度学习领域的更广泛发展。

DeepSeek向非洲的扩张及其高性价比的解决方案使其成为全球人工智能应用的重要参与者,尤其是在基础设施有限的地区。公司的开放权重方法允许本地定制和部署,促进了日益壮大的开发者和初创企业社区。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:artificial-intelligence·large-language-model·chinese-company·open-source-software
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史