Gaudi 是英特尔设计的一系列专用集成电路(ASIC),用于加速深度学习工作负载,特别是大语言模型的训练和推理。其架构强调异构计算方式,将多个张量处理核心与专用的片上网络和高带宽内存(HBM)集成在一起,以实现跨多个加速器的高效扩展。Gaudi 处理器被定位为英伟达基于 GPU 的加速器以及其他 AI 芯片(如AMD的 Instinct 系列和谷歌云的 TPU)的竞争对手。
第一代 Gaudi 处理器于 2019 年发布,由 Habana Labs 开发,这是一家以色列 AI 芯片初创公司,于 2019 年被英特尔以约 20 亿美元收购。第二代 Gaudi 2 于 2022 年推出,第三代 Gaudi 3 于 2024 年发布。英特尔将 Gaudi 定位为用于 AI 训练和推理的高性价比替代方案,重点关注开放软件生态系统,并支持PyTorch和TensorFlow等流行框架。
历史
Gaudi 的起源可追溯至 Habana Labs,该公司由 David Dahan、Ran Halutz 等人于 2016 年创立,总部位于以色列凯撒利亚。该公司最初开发了 Goya 推理芯片,于 2018 年发布,随后将重点转向使用 Gaudi 进行训练。英特尔于 2019 年 12 月收购了 Habana Labs,将该团队整合到其数据平台事业部。此次收购是英特尔在 AI 加速器市场(该市场一直由英伟达的 GPU 主导)竞争更广泛战略的一部分。
第一款 Gaudi 处理器 Gaudi 1 于 2019 年正式推出,早期客户包括亚马逊云服务(AWS),后者于 2021 年提供了基于 Gaudi 的实例。Gaudi 2 于 2022 年 5 月发布,在内存容量和计算性能方面有显著改进,并被云服务提供商和企业采用。2024 年 4 月,英特尔推出了 Gaudi 3,该产品采用了更先进的 5nm 工艺(由台积电制造),并在大语言模型训练方面性能较前代产品翻倍。
架构
Gaudi 处理器围绕异构架构构建,该架构将多个张量处理核心(TPC)与可扩展的网络结构相结合。每个 Gaudi 芯片包含一组完全可编程的 TPC,用于执行矩阵乘法和其他张量运算,类似于英伟达 GPU 中的张量核心。TPC 辅以使用 HBM 的专用内存子系统,为计算单元提供高带宽数据供给。
Gaudi 的一个显著特点是其集成的网络能力。与通常需要外部 InfiniBand 或以太网交换机进行多节点扩展的 GPU 不同,Gaudi 包含片上 RDMA(远程直接内存访问)以太网(RoCE)引擎。这使得多个 Gaudi 加速器可以直接互连,从而降低构建大规模 AI 集群的成本和复杂性。片上网络(NoC)支持单个芯片内 TPC 之间的高效通信,而 RoCE 引擎则处理芯片间的通信。
Gaudi 2 和 Gaudi 3 还集成了专用的矩阵乘法引擎,与 TPC 分离,以加速 Transformer 和其他现代神经网络架构中常见的运算。这些处理器支持混合精度训练,包括 FP32、BF16 和 FP8 格式,以平衡精度和性能。
代际
Gaudi 1
第一代 Gaudi 处理器于 2019 年发布,配备 32 个 TPC 和 16 GB HBM2 内存,带宽为 1.2 TB/s。它专为神经网络模型的训练和推理而设计,注重效率和可扩展性。Gaudi 1 在 BF16 精度下每芯片性能达到 1.6 TFLOPS(尽管该数字通常被引用为密集矩阵运算的 1.6 TFLOPS)。该芯片采用台积电的 16nm 工艺制造。
Gaudi 2
Gaudi 2 于 2022 年推出,将 TPC 数量翻倍至 64 个,并将 HBM 容量提升至 96 GB HBM2e,带宽为 2.4 TB/s。它还增加了专用的矩阵乘法引擎,将 BF16 性能提升至 3.2 TFLOPS。Gaudi 2 基于 7nm 工艺构建。英特尔声称,在训练大语言模型方面,Gaudi 2 相比英伟达的 A100 GPU 提供了更优的性价比,并引用了在GPT-3和BERT等模型上的基准测试结果。
Gaudi 3
Gaudi 3 于 2024 年 4 月发布,代表了重大的架构飞跃。它集成了 128 个 TPC 和更强大的矩阵引擎,配备 128 GB HBM2e 内存,带宽为 3.7 TB/s。该芯片在台积电采用 5nm 工艺制造。英特尔表示,Gaudi 3 训练一个 1750 亿参数的大语言模型(类似于 GPT-3)的速度比英伟达的 H100 GPU 快 50%,同时功耗更低。Gaudi 3 还引入了对 FP8 精度的支持,进一步提高了吞吐量。
软件生态系统
Gaudi 处理器由英特尔的 SynapseAI 软件栈支持,该软件栈提供了针对硬件优化的编译器、运行时和库。SynapseAI 与流行的深度学习框架集成,包括PyTorch和TensorFlow,使开发人员只需对代码进行少量更改即可运行模型。英特尔还提供了Hugging Face集成,便于部署预训练的 Transformer 模型。
该软件栈包括模型优化工具,如量化和图编译,以及支持跨多个 Gaudi 节点进行分布式训练的功能。英特尔强调开放性,Gaudi 支持标准网络协议(RoCE),并兼容 Kubernetes 以用于云环境中的编排。
性能与基准测试
英特尔已发布 Gaudi 处理器的基准测试结果,特别是针对大语言模型的训练和推理。2023 年,英特尔声称 Gaudi 2 在训练 GPT-3 和Llama 2模型方面,性价比比英伟达的 A100 高出 1.5 倍至 2 倍。对于 Gaudi 3,英特尔报告称,在 GPT-3 训练吞吐量方面比英伟达的 H100 提升 1.7 倍,在Falcon和Llama 3等模型的推理方面提升 2 倍。
独立基准测试有限,但一些云服务提供商(如 AWS 和 IBM Cloud)已提供基于 Gaudi 的实例并报告了有竞争力的结果。2024 年,英特尔还宣布与谷歌云合作,以服务形式提供 Gaudi 3,扩大了其可用性。
市场地位与竞争
Gaudi 直接与英伟达的数据中心 GPU(包括 A100、H100 和更新的 H200)以及AMD的 Instinct MI300 系列和AWS的 Trainium 和 Inferentia 芯片竞争。英特尔将 Gaudi 定位为更具成本效益的替代方案,特别是对于希望降低 AI 基础设施成本的企业和云服务提供商。该公司还强调了 Gaudi 的能效,这是数据中心日益关注的问题。
尽管具有技术优势,但 Gaudi 在广泛采用方面面临挑战,部分原因是英伟达主导的软件生态系统(CUDA)和既有的市场地位。英特尔试图通过支持开放标准和提供迁移工具来应对这一问题,但截至 2025 年,Gaudi 的市场份额相对于英伟达仍然较小。
应用
Gaudi 处理器用于深度学习模型的训练和推理,重点关注大语言模型、计算机视觉和推荐系统。它们部署在云数据中心、本地企业系统和边缘环境中。关键用例包括自然语言处理、图像识别以及聊天机器人和内容生成等生成式 AI 应用。
除了云服务外,英特尔还与系统集成商合作,提供基于 Gaudi 的服务器和工作站。这些处理器也用于研究环境,大学和 AI 实验室利用 Gaudi 进行模型开发。
评价与批评
行业分析师普遍认为 Gaudi 是英伟达的可靠替代品,但指出软件成熟度和生态系统支持仍然较弱。一些批评者指出,英特尔的基准测试声明通常基于特定配置,可能无法反映真实世界性能。此外,英伟达产品发布的快速节奏(例如 H100、H200 以及即将推出的 Blackwell 架构)使得 Gaudi 难以保持性能优势。
英特尔通过强调总拥有成本(TCO)和能效来回应,认为 Gaudi 为大规模部署提供了更好的价值。该公司还承诺定期发布产品,Gaudi 4 预计将于 2025 年推出。
未来发展
英特尔已宣布计划继续开发 Gaudi 系列,Gaudi 4 预计将采用更先进的工艺并进一步提升性能。该公司还致力于将 Gaudi 与其 Xeon 处理器和 oneAPI 统一编程模型集成,以简化异构计算。截至 2025 年,英特尔旨在占据 AI 加速器市场更大份额,目标涵盖云和企业领域。
参见
参考文献
- 英特尔新闻室。“英特尔收购 Habana Labs 以扩展 AI 产品组合。”2019 年 12 月 16 日。
- Habana Labs。“Gaudi 训练处理器。”2019 年。
- 英特尔。“英特尔 Gaudi 2 AI 加速器。”2022 年。
- 英特尔。“英特尔 Gaudi 3 AI 加速器。”2024 年。
- 云服务提供商关于 Gaudi 实例的文档(AWS、IBM Cloud、谷歌云)。