Cerebras Inference是由Cerebras Systems开发的一项基于云的AI推理服务,该公司以其晶圆级引擎(WSE)芯片而闻名。该服务旨在以远超传统GPU基础设施的速度运行大型语言模型和其他深度学习模型,面向需要低延迟响应的企业和开发者,用于生产级AI应用。该服务于2024年推出,利用公司定制硬件,为现有云服务提供商和专业AI芯片初创公司提供了一种替代方案。
该服务通过简单的API运行,允许用户部署模型而无需管理底层基础设施。它支持一系列开放权重模型,包括Llama和Mistral系列,并已被宣传为高吞吐量推理任务的经济高效解决方案。通过专注于推理阶段而非训练,Cerebras Inference满足了聊天机器人、代码生成和实时分析等领域对快速、可扩展模型服务的日益增长的需求。
硬件基础
Cerebras Inference基于公司的晶圆级引擎构建,这是一块作为单个大规模处理器的硅晶圆。与传统芯片被切割成独立裸片不同,WSE集成了数千个核心和片上内存,减少了数据在独立组件之间移动的需求。2021年推出的第二代WSE-2包含85万个核心和40GB片上SRAM,使其能够将整个模型保存在内存中,并避免与外部内存访问相关的瓶颈。
这种架构特别适合推理,因为它允许极高的内存带宽和低延迟。例如,该服务已报告对某些模型以超过每秒1800个令牌的速率生成令牌,这一数字优于许多基于GPU的系统。该硬件与TSMC合作制造,后者使用先进工艺节点生产晶圆级组件。
服务功能与模型
该服务提供托管API,支持流式和非流式响应,并兼容OpenAI风格端点以简化开发者集成。它最初支持Llama 3.1 8B和70B模型,随后增加了Mistral 7B以及Llama和Qwen的后续版本。截至2025年,该平台已扩展到支持多达4050亿参数的模型,尽管如此大的模型可能需要跨多个晶圆进行分布式执行。
Cerebras Inference还提供无服务器层级,带有免费速率限制供实验使用,以及针对生产工作负载的付费计划。该服务包括结构化输出、函数调用和JSON模式等功能,这些在现代LLM平台中很常见。截至早期发布,它不提供微调功能,而是专注于预训练模型的部署。
性能与基准测试
独立基准测试突显了Cerebras Inference的速度,尤其是对于较小模型。在artificial analysis进行的测试中,该服务在特定Llama模型上实现了主要提供商中最高的吞吐量,超过了Groq、SambaNova和AWS的产品。低延迟归因于晶圆级设计,该设计消除了数据在独立内存芯片之间传输的需要。
然而,性能因模型大小和请求模式而异。对于非常大的模型,该服务可能无法超越顶级GPU集群,公司也承认其优势在完全适合片上内存的模型中最为明显。该服务还支持批处理,这可以提高高容量应用的效率。
竞争格局
Cerebras Inference在拥挤的AI推理提供商市场中竞争。主要云平台如Google Cloud、Azure和AWS提供基于GPU的推理服务,而Groq和SambaNova等专业初创公司提供定制硬件解决方案。Cerebras通过其晶圆级方法实现差异化,该方法提供了内存带宽和计算密度的独特组合。
该服务是专用AI基础设施更广泛趋势的一部分,与Graphcore和D-Wave等公司并列,尽管这些公司专注于不同细分市场。Cerebras还定位为寻求避免供应商锁定的企业合作伙伴,提供可跨多个平台部署的开放权重模型。
采用与用例
Cerebras Inference的早期采用者包括需要实时AI响应的初创公司和研究机构,如对话代理和编码助手。该服务已用于从客户支持自动化到科学数据分析的各种应用。其低延迟使其适合交互式用例,用户期望即时反馈,例如在生成式AI工具中。
公司报告了与学术机构和企业的合作,但具体客户名称并不总是公开。截至2025年,该服务持续发展,计划根据用户反馈添加更多模型和功能。其定价模式具有竞争力,在高吞吐量工作负载中通常低于基于GPU的替代方案。
未来方向
Cerebras Systems已表示将扩展推理服务,以支持更多模型架构和更大的参数数量。公司还在努力改进多晶圆扩展,以处理超过单个芯片内存容量的模型。随着机器学习模型的快速发展,该服务旨在保持在低延迟推理的前沿,可能集成Transformer变体和神经网络创新等新兴技术。
随着AI推理需求的增长,Cerebras Inference代表了对传统芯片制造商和云服务提供商主导地位的一次显著挑战。其成功将取决于持续的硬件改进和吸引广泛开发者社区的能力。