Cerebras Systems Inc.总部位于加利福尼亚州桑尼维尔,开发半导体、超级计算机及相关软件,为人工智能深度学习应用(如推理引擎)提供支持。其产品包括晶圆级引擎(WSE)-3半导体、CS-3超级计算机,以及“AI推理云”和“AI训练云”API,使用户无需购买其硬件即可访问公司的计算能力。该公司还使用其处理器和超级计算机建设数据中心,直接向客户提供云计算服务。
该公司的WSE-3半导体尺寸为215毫米(8.5英寸)见方,是目前已制造的最大AI半导体。它们占据整个硅晶圆,采用晶圆级集成和交换矩阵技术。与GPU集群相比,这降低了延迟和互连瓶颈。它们使用静态随机存取存储器,而非动态随机存取存储器。Cerebras的半导体和计算机系统比竞争对手的产品强大得多;然而,由于其尺寸庞大、功耗达25千瓦,以及每个节点高达300万美元的成本,它们也存在劣势。
历史
Cerebras Systems于2015年由Andrew Feldman、Gary Lauterbach、Michael James、Sean Lie和Jean-Philippe Fricker创立。这五位创始人曾在SeaMicro共事,该公司由Feldman和Lauterbach于2007年创立,并于2012年以3.34亿美元出售给AMD。
创始人们知道GPU并非高级处理流程的最佳半导体。然而,他们必须设计独特的冷却方法以防止“巨型”半导体在供电时燃烧,设计独特的软件来绕过常见的微观制造缺陷,并且必须发明一种能够同时将40颗螺丝钻入晶圆而不会使其破裂的机器。
该公司在解决集成电路封装问题方面遇到了困难:将硅附着到主板上、接收电力、处理加热和冷却以及输送和返回数据的管道。该公司每月烧掉800万美元,并花费2亿美元试图解决这一问题。2019年7月,经过反复试验,该公司终于生产出可用的产品。
2019年8月,Cerebras发布了WSE-1,即其第一代晶圆级引擎(WSE)半导体,以及CS-1超级计算系统。CS-1是一款19英寸机架式设备,包含一个具有40万个处理核心、1.2万亿个晶体管(12个100千兆以太网连接)和18千兆字节内存的WSE主处理器。
该公司的首批客户是教育机构和生命科学公司,它们正在构建超级计算机,用于药物发现、计算流体动力学、遗传和基因组研究、预测药物反应以及COVID-19研究。早期客户包括葛兰素史克、阿斯利康、国家能源技术实验室、劳伦斯利弗莫尔国家实验室、匹兹堡超级计算中心和爱丁堡并行计算中心。
2020年9月,该公司在日本开设了办事处,并与东京电子建立了合作伙伴关系。
2021年4月,该公司发布了基于其晶圆级引擎二号(WSE-2)的CS-2系统,该系统拥有85万个核心。CS-2由台积电采用7纳米工艺制造。它高26英寸(660毫米),可安装在标准数据中心机架的三分之一空间内。WSE-2拥有85万个核心和2.6万亿个晶体管。它使单个系统能够支持超过120万亿参数的AI模型。WSE-2将片上SRAM扩展到40千兆字节,内存带宽扩展到每秒20拍字节,总结构带宽扩展到每秒220拍比特。客户包括道达尔能源、nference、国家超级计算应用中心(NCSA)和莱布尼茨超级计算中心。
2021年8月,Cerebras宣布与Peptilogics合作开发用于肽类疗法的AI。
2022年6月,Cerebras创下了在单台设备上训练的最大AI模型的纪录,,一台配备单个Cerebras晶圆的CS-2系统训练了多达200亿参数的模型。Cerebras CS-2系统可以训练数十亿参数的自然语言处理(NLP)模型,包括GPT-3XL 13亿参数模型,以及GPT-J 6B、GPT-3 13B和GPT-NeoX 20B,同时降低了软件复杂性和基础设施要求。
2022年8月,位于加利福尼亚州山景城的计算机历史博物馆展出了以WSE-2为主题的新展品,名为“世界上最大的芯片”。
同样在2022年8月,Cerebras在印度班加罗尔开设了办事处。
2022年9月,Cerebras宣布可以将其芯片拼接在一起,打造有史以来最大的AI计算集群。一个晶圆级集群可以将多达192个CS-2 AI系统连接成一个集群,而一个由16个CS-2 AI系统组成的集群可以创建一个拥有1360万个核心的计算系统,用于自然语言处理。它使用数据并行性进行训练。
2022年10月,美国国家核安全管理局的桑迪亚国家实验室开始使用CS-2进行核储备管理计算,以确定核武器是否能按预期工作。
2022年11月,Cerebras推出了仙女座超级计算机,它将16个WSE-2芯片组合成一个集群,拥有1350万个AI优化核心,提供高达1百亿亿次浮点运算的AI计算能力,即每秒至少10^18次运算。整个系统消耗500千瓦,这远低于性能相当的GPU加速超级计算机。
2022年11月,Cerebras宣布与Cirrascale Cloud Services合作,为其Cerebras AI Model Studio提供统一费率的“按模型付费”计算时间。
2022年11月,国家能源技术实验室(NETL)使用Cerebras产品实现了里程碑式的成果。
2022年11月,阿贡国家实验室通过使用CS-2以及Nvidia和惠普的产品,将大型语言模型用于分析和预测SARS-CoV-2变体,赢得了2022年戈登贝尔COVID-19研究特别奖。
2023年7月,G42同意支付约1亿美元购买Cerebras首批可能多达九台超级计算机中的第一台。第一套系统于当年晚些时候交付,G42随后成为主要客户,占Cerebras收入的很大一部分。
技术与产品
Cerebras的核心技术是晶圆级引擎,这是一种横跨整个硅晶圆的单个半导体。这种方法与传统芯片制造形成对比,传统制造中单个晶圆会被切割成多个芯片。通过使用整个晶圆,Cerebras消除了芯片间互连的需求,而这是GPU集群中的主要瓶颈。WSE-3于2024年发布,是该设计的第三代产品,拥有4万亿个晶体管和90万个核心。它由台积电采用5纳米工艺制造,是目前已制造的最大AI半导体。
CS-3超级计算机是容纳WSE-3的系统。它被设计为完整的AI计算节点,集成了冷却和电力输送功能。CS-3既可用于训练也可用于推理,支持多达24万亿参数的模型。Cerebras还提供云服务,允许客户通过API访问其硬件,而无需直接购买系统。
该公司的半导体使用静态随机存取存储器(SRAM)而非动态随机存取存储器(DRAM),这提供了更高的带宽和更低的延迟。这对于需要快速访问大量数据的AI工作负载尤其有利。
应用与使用场景
Cerebras系统用于各种AI应用,包括自然语言处理、药物发现和科学研究。早期客户包括葛兰素史克和阿斯利康,它们使用CS-1进行药物发现和基因组学研究。国家能源技术实验室使用Cerebras系统进行能源研究,劳伦斯利弗莫尔国家实验室用于核储备管理。阿贡国家实验室也使用CS-2进行COVID-19研究,并因此赢得了2022年戈登贝尔特别奖。
在商业领域,总部位于阿拉伯联合酋长国的AI公司G42一直是主要客户,使用Cerebras系统进行大规模AI训练。OpenAI和亚马逊网络服务于2026年签署了使用Cerebras硬件的协议,进一步扩大了其客户群。
市场地位与竞争
Cerebras在两个主要市场运营:AI硬件和AI云服务。在硬件市场,其主要竞争对手是Nvidia、AMD、Intel和博通。Nvidia凭借其GPU主导AI芯片市场,但Cerebras通过提供单芯片解决方案来差异化自身,避免了多GPU系统的互连瓶颈。在云服务市场,Cerebras与亚马逊网络服务、微软Azure、谷歌云平台、甲骨文公司和CoreWeave竞争。
尽管具有技术优势,Cerebras仍面临系统高成本和高功耗的挑战。每个节点成本高达300万美元,功耗为25千瓦,这限制了其对高性能计算用户这一小众市场的吸引力。
制造与供应链
Cerebras的半导体由台积电制造,台积电是目前唯一能够生产如此大型芯片的公司。晶圆级集成需要专门的制造工艺,WSE-3和WSE-2分别使用台积电的5纳米和7纳米节点。对单一供应商的依赖是一个潜在的脆弱点,但也确保了高质量和一致性。
近期发展与未来展望
2024年,Cerebras发布了WSE-3和CS-3,与前几代产品相比性能显著提升。该公司还一直在扩展其云服务,在美国和其他地区设有数据中心。2026年,Cerebras与OpenAI和亚马逊网络服务签署了协议,表明对其技术的需求不断增长。该公司继续投资于研发,专注于改进晶圆级集成和降低功耗。
截至2025年,Cerebras在桑尼维尔、圣迭戈、多伦多和印度班加罗尔设有办事处。该公司的主要客户包括穆罕默德·本·扎耶德人工智能大学(占2025年收入的62%)和G42(占24%)。该公司未来的成功将取决于其扩大制造规模的能力,以及吸引当前小众市场之外更广泛客户群的能力。
参见
- 人工智能
- 机器学习
- 深度学习
- 神经网络
- 大型语言模型
- Transformer
- OpenAI
- Anthropic
- Google DeepMind
- 生成式AI
- AMD
- Intel
- 台积电
- 博通
- 亚马逊网络服务
- Azure
- 谷歌云
- 甲骨文云
- Groq
- SambaNova
- Graphcore
- 诺基亚贝尔实验室
- 施乐帕洛阿尔托研究中心
- 麻省理工学院计算机科学与人工智能实验室
- 斯坦福AI实验室
- 多伦多大学
- 卡内基梅隆大学
- 伯克利AI研究
- 牛津大学
- D-Wave
- 阿里云
- Waymo
- 特斯拉自动驾驶
- Adam优化器
- 残差网络
- U-Net
- RLHF
- 课程学习
- 梯度裁剪
- 批归一化
- 层归一化
- Dropout
- 权重初始化
- 损失函数
- 位置编码
- 多头注意力
- 交叉注意力
- 编码器-解码器
- 序列到序列
- 束搜索
- Top-K采样
- Top-P采样
- 温度缩放
- 模型剪枝