Gaudi是由Habana Labs(英特尔子公司)开发的一系列AI训练处理器,旨在加速大规模模型的深度学习工作负载。这些处理器针对人工智能模型的训练和推理进行了优化,尤其是大型语言模型及其他深度学习架构。Habana Labs成立于2016年,于2019年被英特尔收购,其Gaudi系列已成为英特尔AI硬件战略的关键组成部分。
第一代产品Gaudi 1于2019年发布,面向数据中心训练。它采用集成以太网网络的专业架构,支持跨多个节点的横向扩展。第二代产品Gaudi 2于2022年推出,提升了性能和内存容量,并被云服务提供商和企业采用。2024年,英特尔推出了Gaudi 3,进一步提高了基于Transformer模型的训练吞吐量,与英伟达和AMD的产品展开竞争。
架构与设计
Gaudi处理器基于异构架构构建,结合了矩阵乘法引擎、向量处理单元和通用CPU核心。其设计强调神经网络操作的高利用率,并专注于减少数据移动瓶颈。与一些竞争对手不同,Gaudi通过以太网集成了片上网络,消除了多节点训练设置中对独立网络适配器的需求。
处理器采用自定义内存层次结构,配备大型片上SRAM和高带宽HBM2E内存。例如,Gaudi 3提供128 GB的HBM2E内存,内存带宽为3.7 TB/s。该架构同时支持训练和推理,并通过软件优化支持PyTorch和TensorFlow等流行框架。
性能与基准测试
Habana发布了性能基准测试,显示Gaudi 2和Gaudi 3在ResNet和基于Transformer的语言模型等模型的训练时间上具有竞争力。在内部测试中,Gaudi 3对大型语言模型的训练速度比Gaudi 2快达50%,推理速度快达40%。然而,独立基准测试有限,实际性能取决于软件成熟度和系统集成。
这些处理器设计为可扩展到数千个节点,并附带数据增强和模型剪枝工具包,帮助优化模型的部署。Habana的软件栈称为SynapseAI,提供图形编译器,可自动优化硬件上的操作。
软件生态系统
SynapseAI是Gaudi的核心软件框架,提供用户友好的界面,支持ONNX和流行的深度学习框架。它包括一个图形编译器,可融合操作、优化内存使用,并在处理器核心之间调度任务。该软件还通过Horovod和PyTorch的分布式数据并行模块支持分布式训练。
Habana已与Hugging Face合作,为Gaudi优化了数千种模型,包括BERT、GPT和LLaMA。这种集成使开发人员能够以最小的代码更改运行这些模型。此外,软件还包括量化和剪枝工具,以提高推理效率。
市场地位与竞争
Gaudi直接与英伟达的A100和H100 GPU,以及AMD的MI300系列竞争。虽然英伟达主导AI训练市场,但Gaudi提供了成本更低且性能具有竞争力的替代方案,尤其适用于基于以太网的集群。Habana还将Gaudi定位为更节能的选择,具有更低的总拥有成本。
2024年,英特尔宣布Gaudi 3将通过AWS和Google Cloud提供,扩大了其覆盖范围。然而,与英伟达相比,其采用率仍然有限,部分原因是CUDA的成熟度及其周围庞大的生态系统。Habana一直在通过提供兼容层和合作伙伴关系来弥合这一差距。
使用案例与采用
Gaudi处理器用于各种AI应用,包括生成式AI、计算机视觉和自然语言处理。它们特别适合训练大型语言模型和推荐系统。早期采用者包括Hugging Face(使用Gaudi进行推理)以及提供Gaudi实例的多家云服务提供商。
2023年,英特尔宣布与OpenAI合作,为他们的模型优化Gaudi,但细节不多。此外,AWS提供基于Gaudi的训练实例,Oracle Cloud已将Gaudi集成到其AI基础设施中。这些处理器也被用于学术研究,斯坦福AI实验室和伯克利AI研究正在探索其能力。
未来发展
英特尔已承诺Gaudi的路线图,未来几代预计将提供更高的性能和更好的能效。公司还在投资软件增强,以简化从英伟达平台的迁移。截至2025年,Gaudi 3是最新一代产品,但英特尔已暗示正在开发Gaudi 4,目标于2026年推出。
Gaudi的成功将取决于英特尔AI生态系统的更广泛采用,以及在价格和性能上的竞争能力。随着生成式AI和大型语言模型的兴起,训练硬件的需求正在激增,Gaudi有望在这一市场中占据份额。
结论
Gaudi代表了英特尔在AI加速器领域的重大推进,为英伟达GPU提供了可行的替代方案。凭借其独特的集成网络和具有竞争力的性能,它在数据中心训练中找到了自己的定位。尽管软件成熟度和生态系统支持方面仍面临挑战,但该处理器的持续发展和合作关系表明其在AI硬件领域前景可期。