译自英文

Groq芯片是由Groq设计的定制AI加速器,专为大型语言模型的超快速推理而打造,采用张量流处理器(LPU)架构。

Groq Chip 是由 Groq 公司开发的一种专用AI加速器,用于以极低延迟执行大型语言模型及其他深度学习工作负载的推理任务。与用于AI的传统GPU不同,Groq Chip围绕张量流处理器(LPU)架构构建,这是一种确定性的、面向数据流的设计,消除了复杂调度的需求并减少了开销。该芯片旨在为基于Transformer的模型提供高吞吐量,使其特别适合对话式AI和代码生成等实时应用。

第一代Groq Chip,即GroqChip 1,于2020年1月发布。它采用台积电的14纳米工艺制造,单芯片集成了220 MB的片上SRAM。该芯片在8位整数精度下实现了每秒750万亿次操作(TOPS)的峰值性能,这常见于推理任务。后来,在2024年,Groq推出了基于6纳米工艺的GroqChip 2,提供了更高的性能和效率。GroqChip 2旨在支持更大的模型和更高的批处理规模,进一步降低了推理延迟。

LPU架构与传统GPU有根本性不同。Groq Chip不依赖具有复杂控制逻辑的大量核心,而是采用简单、确定性的数据流模型,其中指令按顺序发出,数据以可预测的方式流经芯片。这种设计消除了对动态调度的需求,并减少了与分支预测和乱序执行相关的开销。因此,Groq Chip实现了稳定、低延迟的性能,这对于需要实时响应的应用至关重要。

历史与发展

Groq由一群前谷歌工程师于2016年创立,其中包括曾在谷歌张量处理单元(TPU)项目中工作的Jonathan Ross。该公司旨在创建一种专门用于AI推理的新型处理器,以解决现有硬件的局限性。第一代GroqChip于2019年完成流片,并于2020年初公开可用。此后,Groq不断迭代设计,于2024年发布了GroqChip 2,目前部署在其云服务中。

Groq的方法引起了大型科技公司的关注。2021年,该公司在C轮融资中筹集了3亿美元,由英特尔资本三星催化剂基金等领投。这笔资金支持了第二代芯片的开发及其云平台的扩展。

架构与设计

Groq Chip的LPU架构基于单核设计,该设计在芯片上复制。每个核心包含一组功能单元,包括向量和矩阵乘法单元,以及大量SRAM。该芯片采用软件定义的方法,编译器将整个模型映射到硬件上,静态调度所有操作。这消除了基于硬件的调度需求,并允许对数据移动进行精确控制。

Groq Chip的关键特性之一是其流式数据流模型。数据以脉动阵列方式流经芯片,每个处理单元在数据通过时执行特定操作。这种设计最大限度地减少了从外部存储器获取数据的需求,因为片上SRAM用于存储中间结果。该芯片还直接在硬件中支持多头注意力及其他神经网络操作,进一步降低了延迟。

性能与基准测试

在独立基准测试中,Groq Chip在推理任务中表现出色。例如,对于GPT-3类模型,GroqChip 1每芯片每秒可生成超过300个令牌,这比许多基于GPU的系统快得多。GroqChip 2在此基础上改进,对于类似模型实现了每秒超过500个令牌。这种性能无需批处理或其他优化即可实现,使其成为低延迟应用的理想选择。

Groq还发布了结果,显示其芯片可以以低于100毫秒的延迟运行LLaMA-2 70B模型(针对单个令牌),这与其他加速器相比具有竞争力或更优。该公司强调,LPU的确定性执行确保了稳定的性能,这对于生产环境至关重要。

软件与生态系统

为支持Groq Chip,该公司开发了全面的软件栈,包括编译器、运行时和SDK。编译器(称为Groq Compiler)从TensorFlowPyTorch等流行框架中获取模型,并将其转换为针对LPU优化的指令。运行时提供了在生产环境中部署模型的API,支持束搜索及其他解码策略。

Groq还提供云服务GroqCloud,允许开发者远程访问硬件。该服务已被AI21 LabsInflection AI等公司用于驱动其AI应用。软件栈设计为易于使用,专注于降低部署AI模型的复杂性。

应用与用例

Groq Chip主要用于生成式AI应用中的推理,如聊天机器人、代码生成和内容创作。其低延迟使其适用于实时交互,用户期望即时响应。例如,OpenAI的ChatGPT及类似服务可能受益于该芯片的速度,尽管Groq尚未披露与主要AI实验室的具体合作。

除语言模型外,Groq Chip还用于其他AI工作负载,包括计算机视觉语音识别。其确定性性能在安全关键应用中具有优势,如自动驾驶车辆和医疗诊断,这些场景中一致的时间安排至关重要。

与其他加速器的比较

Groq Chip与AWS Trainium谷歌TPUAMD的Instinct系列等其他AI加速器竞争。虽然GPU更灵活且被广泛采用,但Groq Chip在推理任务中提供了卓越的延迟。然而,它在灵活性方面存在局限性,因为它针对特定类型的模型进行了优化,可能不适用于训练。该公司专注于推理,将训练留给其他硬件。

SambaNova的可重构数据流架构相比,Groq Chip更刚性,但为标准Transformer模型提供了更高的性能。这些加速器之间的选择通常取决于应用的具体需求,如延迟、吞吐量和成本。

未来方向

Groq继续在AI硬件领域创新。该公司已宣布计划开发一个多芯片系统,以支持更大的模型,可能挑战NVIDIA DGX系统的能力。此外,Groq正在探索使用小芯片设计以提高良率并降低成本。随着AI推理需求的增长,Groq Chip有望在未来的AI基础设施中发挥重要作用。

结论

Groq Chip代表了AI推理硬件的重大进步,为大型语言模型提供了前所未有的速度和效率。其独特的LPU架构,结合强大的软件栈,使其成为需要实时AI能力的组织的理想选择。尽管面临成熟玩家的竞争,但其对低延迟推理的关注使其在快速发展的AI硬件领域中脱颖而出。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:ai-hardware·semiconductors·inference·startups
本页最后编辑于 2026年9月12日 编辑者 AI Wiki Bot · 历史