Groq Inc. 是一家专注于人工智能(AI)推理硬件和软件的技术公司。该公司最著名的成就是开发了语言处理单元(LPU),这是一种专为加速大型语言模型(LLM)及其他AI工作负载执行而设计的专用处理器架构。Groq 的主要目标是提供超低延迟的推理解决方案,并将其定位为图形处理单元(GPU)在运行生成式AI模型方面的替代方案。
Groq 成立于2016年,由一支曾为谷歌数据中心构建定制AI加速器的工程师团队创立。公司创始人之一乔纳森·罗斯(Jonathan Ross)曾参与谷歌的张量处理单元(TPU)项目。他们的目标是打造一种能够克服基于GPU的AI推理中常见内存带宽瓶颈的处理器。Groq 总部位于加利福尼亚州山景城,此后其业务范围已扩展至云服务和企业级部署。
架构与技术
Groq 技术的核心是 LPU,即张量流处理器(TSP),它采用数据流架构。与传统依赖复杂控制逻辑和大容量缓存的 CPU 及 GPU 不同,LPU 以确定性的流式方式执行指令。这种方法消除了指令获取和解码的开销,从而实现了可预测且极快的神经网络运算执行。
Groq 的 LPU 基于单芯片设计,集成了大规模处理单元阵列。该架构针对 Transformer 模型中占主导地位的矩阵乘法和激活函数进行了优化。通过让数据以同步方式在处理器中流动,LPU 实现了高利用率和低延迟,尤其适用于批量大小为 1 的推理场景,这在交互式AI应用中非常常见。
产品与服务
Groq 通过多种渠道提供其 LPU 硬件。公司面向企业和研究机构提供本地部署系统,同时也通过云平台提供其硬件的访问。2024年,Groq 推出了一项云服务,允许开发者在 LPU 上运行 Llama 和 Mistral 等开源 LLM,并侧重于速度和成本效益。该服务因其 token 生成速率显著快于许多基于 GPU 的产品而受到关注。
除了硬件,Groq 还开发了包括编译器和运行时在内的软件栈。Groq 编译器可将 PyTorch 和 ONNX 等流行框架的模型转换为针对 LPU 优化的指令。公司还与其他企业建立了合作伙伴关系,以将其技术集成到更广泛的AI基础设施中,包括与云服务提供商和系统集成商的合作。
市场地位与竞争
Groq 运营于竞争激烈的AI推理加速器领域,与 NVIDIA 等老牌厂商以及 Cerebras 和 SambaNova 等新兴初创公司展开竞争。虽然 Nvidia 凭借其 GPU 主导着AI训练市场,但 Groq 则瞄准推理市场,在该市场中延迟和吞吐量至关重要。公司的 LPU 特别适用于实时应用,包括聊天机器人、代码生成以及其他交互式 Generative AI 服务。
Groq 的发展战略吸引了主要科技公司的投资。2021年,该公司在由 d1-capital 和 tiger-global-management 领投的一轮融资中筹集了3亿美元,the-whale-rock-group 等也参与了投资。此外,公司还获得了 Samsung Electronics 和 Intel 的支持,这反映出老牌半导体公司对替代性AI架构的兴趣。
应用场景
Groq 的技术被用于各种AI应用,尤其是那些需要快速响应的场景。公司的 LPU 已部署在边缘计算环境中,例如自动驾驶汽车和机器人技术,这些领域对低延迟至关重要。Groq 还与研究机构和大学合作,加速 Machine learning 工作负载,包括用于自然语言处理和计算机视觉的 Deep learning 模型。
在企业领域,Groq 的云服务使公司无需投资专用硬件即可部署 Large language model 应用。该平台支持对 GPT-J 和 Llama 2 等模型进行微调和推理,帮助企业构建定制化的AI助手和分析工具。Groq 的确定性性能也吸引了具有严格延迟要求的行业,例如金融交易和医疗诊断。
未来方向
Groq 持续发展其硬件和软件产品。公司已宣布计划推出新一代 LPU,以增加内存和处理能力,旨在支持更大的模型和更复杂的工作负载。Groq 还在探索将其技术与 Artificial intelligence 框架和工具集成,使开发者更容易在其工作流程中采用 LPU。
随着AI推理需求的增长,Groq 面临着扩大生产规模以及与成熟的 GPU 生态系统竞争的挑战。公司专注于高性能推理,这使其成为一个细分领域的参与者,但其技术有潜力影响更广泛的AI硬件格局。Groq 的成功将取决于其能否在速度、成本和能效方面相较于现有解决方案展现出明显优势。