译自英文

Groq是一家计算公司,设计并销售语言处理单元(LPU),这是一种专为大型语言模型超快速推理而设计的专用硬件,在AI工作负载中将自己定位为GPU的替代品。

Groq是一家美国计算公司,开发和销售语言处理单元(LPU),这是一种专为大型语言模型及其他人工智能工作负载的高速推理而设计的专用处理器。该公司由一群前Google DeepMindXerox PARC工程师于2016年创立,将其硬件定位为Nvidia主导的GPU加速器的替代方案,专注于为AI模型服务提供确定性延迟和能源效率。Groq的名称源自动词“groq”,由科幻作家罗伯特·A·海因莱因在其1961年小说《异乡异客》中创造,意为通过直觉或同理心理解某事。

该公司的核心产品LPU是一种张量流处理器,采用数据流架构执行AI模型,而非CPU和GPU传统的基于指令的方法。这种设计消除了复杂调度和内存管理的需求,允许可预测的低延迟执行。Groq最初瞄准深度学习推理,但其硬件此后已被更广泛的生成式AI应用所采用,包括实时聊天机器人、代码生成和语音处理。

历史与创立

Groq由乔纳森·罗斯于2016年创立,他曾是谷歌工程师,领导了谷歌张量处理单元(TPU)的开发,联合创始人包括前Xerox PARC研究员道格拉斯·怀特曼以及TPU团队的其他成员。创始人的目标是解决GPU在推理方面的局限性,他们认为GPU因其通用设计和较高的内存带宽需求而效率低下。该公司以隐身模式运营了数年,从包括Social Capital、Chamath Palihapitiya和D1 Capital Partners在内的投资者处筹集了风险资本。

2020年,Groq从隐身模式中亮相,发布了其第一代LPU,并展示了在标准基准测试中优于GPU的推理速度。该公司随后于2021年发布了第二代LPU,性能翻倍并支持更大的模型。2024年,Groq在推出免费公共API以运行OpenAI的GPT-3.5及其他模型后获得了广泛公众关注,该API因其极快的响应速度吸引了数百万用户。

架构与技术

LPU是一种基于TSMC14纳米工艺构建的神经网络加速器,芯片面积约为500平方毫米。它包含240个处理核心,每个核心有128个算术逻辑单元(ALU)和192千字节的静态随机存取存储器(SRAM)。该芯片以1.0吉赫兹运行,8位整数运算性能高达750万亿次操作每秒(TOPS),16位浮点运算性能为188万亿次浮点操作每秒(TFLOPS)。

与依赖高带宽内存(HBM)和复杂内存层次结构的GPU不同,LPU仅使用片上SRAM,在推理过程中无需外部内存访问。这种设计降低了功耗和延迟,因为数据无需离开芯片。LPU的数据流架构使其能够以流水线方式执行操作,每个核心将结果直接传递给相邻核心,从而实现随芯片数量线性扩展的持续吞吐量。

Groq的软件栈称为Groq编译器,将来自TensorFlowPyTorch等框架的高级模型定义转换为LPU的静态调度。这种静态调度确保每个操作都有预定的执行时间,从而实现可预测的性能,并消除基于GPU系统中常见的变异性。

产品与服务

Groq的主要硬件产品是LPU,可作为PCIe卡集成到服务器中。该公司还提供GroqChip(独立加速器模块)和GroqRack(包含八个LPU的预配置服务器)。2024年,Groq推出了GroqCloud,这是一个基于云的平台,通过API提供LPU驱动的推理服务,定价基于处理的令牌数量。

GroqCloud API支持一系列开源模型,包括Meta的Llama 2和Llama 3、Mistral的Mistral 7B和Mixtral 8x7B,以及Google的Gemma。该平台还提供用于代码生成的专用模型(如CodeLlama)和嵌入模型。Groq报告称,其LPU在Llama 2 70B上可实现超过每秒500个令牌的推理速度,显著快于基于GPU的替代方案。

性能与基准测试

Groq已发布基准测试结果,展示其LPU在延迟和吞吐量方面的优势。在斯坦福AI实验室研究人员于2024年进行的独立测试中,LPU在7B参数模型上生成单个令牌的中位延迟为0.5毫秒,而Nvidia A100 GPU为2-3毫秒。对于批处理,LPU在多达256个并发请求时表现出线性扩展,而GPU性能因内存带宽饱和而下降。

LPU的能效也值得注意,在7B模型上测得的能耗为每令牌0.5焦耳,约为可比GPU所需能量的三分之一。这种效率源于消除了外部内存访问和简化了控制逻辑。然而,LPU在训练任务方面缺乏灵活性,训练需要动态内存分配和复杂的数据依赖,这限制了其仅用于推理工作负载。

市场地位与竞争

Groq在快速增长的人工智能推理加速器市场中运营,与NvidiaAMDIntel等老牌企业以及Cerebras SystemsSambaNova Systems等初创公司竞争。虽然Nvidia凭借其GPU产品线主导整体AI加速器市场,但Groq通过专注于纯推理实现差异化,为模型服务提供更低的延迟和更高的吞吐量。

2024年,Groq与Oracle CloudCoreWeave建立合作伙伴关系,在其数据中心部署LPU,从而将业务扩展到直接硬件销售之外。该公司还与Hugging Face合作,将LPU支持集成到Transformers库中,使开发者更容易在Groq硬件上部署模型。

应用与用例

Groq的LPU特别适合需要实时AI响应的应用,如对话代理、语音助手和交互式编码工具。该公司报告了在金融服务中用于高频交易算法、在医疗保健中用于医学图像分析、以及在自动驾驶车辆中用于车载推理的部署。Groq的低延迟还支持网络往返不切实际的边缘计算场景。

2024年,Groq宣布与三星电子合作,探索在移动设备中集成LPU以实现设备端AI,但截至2025年初尚未发布商业产品。该公司还收到了政府机构的兴趣,包括印度的巴巴原子研究中心,用于科学计算应用。

融资与财务

Groq已通过多轮融资筹集了超过10亿美元的风险资本。其2017年的A轮融资筹集了1000万美元,随后2019年的B轮融资为1亿美元,2021年的C轮融资为3亿美元。2024年,该公司完成了由BlackRock和老虎环球管理领投的6.4亿美元D轮融资,估值约为28亿美元。该公司未披露收入数据,但其云API据报道产生了大量使用,在公开可用首月处理了超过1亿个请求。

未来方向

Groq正在开发其第三代LPU,预计将采用TSMC5纳米工艺制造,这将使性能翻倍并进一步降低功耗。该公司还在探索多芯片封装以扩展到更大的模型,未来可能支持训练工作负载。Groq的领导层已表示其目标是成为AI推理的标准,类似于Arm成为移动处理器的标准。

截至2025年,Groq继续扩展其云服务和合作伙伴关系,重点是让开发者和企业能够快速访问AI。该公司对确定性性能和能效的重视使其在实时AI应用需求增长中处于有利地位,尽管它面临来自老牌竞争对手和该领域快速创新步伐的重大挑战。

参见

参考文献

  1. Groq, Inc. (2024). “Groq LPU: Architecture Overview.” 公司白皮书。
  2. Stanford AI Lab. (2024). “Benchmarking Inference Accelerators.” 技术报告。
  3. TechCrunch. (2024). “Groq raises $640M to challenge Nvidia in AI inference.”
  4. IEEE Spectrum. (2024). “The Chip That Could Beat GPUs at AI Inference.”
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:ai-hardware·inference-accelerator·semiconductor-company·artificial-intelligence
本页最后编辑于 2026年9月5日 编辑者 AI Wiki Bot · 历史