译自英文

AWS Trainium是亚马逊网络服务专为机器学习模型训练和推理设计的定制AI加速器芯片系列,通过EC2实例提供。它旨在为云端AI工作负载提供一种高性价比、高性能的GPU替代方案。

AWS Trainium 是亚马逊云服务(AWS)开发的一系列定制应用专用集成电路(ASIC),用于加速云中的机器学习训练和推理任务。Trainium 芯片于2020年11月发布,并于2022年首次投入使用,其设计目标是为大规模 AI 工作负载提供比通用图形处理单元(GPU)更具成本效益和能效的替代方案,尤其是涉及深度学习模型(如大型语言模型Transformer架构)的工作负载。这些芯片集成到 AWS 的弹性计算云(EC2)实例中,为客户提供针对神经网络操作特定计算模式优化的专用硬件。

Trainium 的开发是 AWS 更广泛战略的一部分,旨在使其 AI 硬件产品多样化,并减少对外部芯片供应商(如Nvidia)的依赖。通过设计自己的芯片,AWS 旨在为其平台上运行的主流 AI 工作负载优化每美元和每瓦特的性能。Trainium 与 AWS Inferentia 互补,后者是一个专门专注于推理的独立芯片系列,两者共同构成 AWS 定制 AI 加速产品组合的核心。Trainium 系列已随着后续世代不断演进,包括2023年发布并于2024年开始更广泛部署的第二代 Trainium2,以及2024年底发布的第三代 Trainium3。

硬件架构

Trainium 芯片基于专用架构构建,强调高吞吐量的矩阵乘法和数据移动,这是神经网络训练中的核心操作。每个 Trainium 芯片包含多个张量核心,可执行混合精度计算,支持 FP32、FP16、BF16 和 FP8 等数据类型。第一代 Trainium 芯片采用TSMC的7纳米工艺制造,在 FP16 和 BF16 操作中提供高达200 teraflops 的性能。它包含大容量片上存储器和连接到外部存储器的高带宽接口,能够高效处理大型模型参数和激活值。

第二代 Trainium2 显著提升了性能和内存容量。采用5纳米工艺制造,每个 Trainium2 芯片提供高达400 teraflops 的 FP16/BF16 性能,并配备32 GB 高带宽内存(HBM)。单个 Trainium2 UltraServer 是一个机架级系统,包含64个通过高速互联网络连接的 Trainium2 芯片,提供总计25.6 petaflops 的计算能力和6 TB 内存。这种设计允许训练具有数千亿参数的模型,例如用于生成式 AI应用的模型。

Trainium3 于2024年12月发布,预计采用3纳米工艺制造,性能约为 Trainium2 的两倍,并同时关注训练和推理效率。AWS 表示 Trainium3 将于2025年上市,并向部分客户提供早期访问权限。

EC2 实例与可用性

AWS 通过其 EC2 服务以 Trn1 和 Trn2 实例系列提供基于 Trainium 的计算能力。第一代 Trn1 实例于2022年10月推出,有两种规格:配备一个 Trainium 芯片的 trn1.2xlarge 和配备16个 Trainium 芯片的 trn1.32xlarge。trn1.32xlarge 提供高达3.2 petaflops 的 FP16/BF16 性能和512 GB 内存,并支持通过弹性结构适配器(EFA)进行高速网络连接,以便跨多个实例进行分布式训练。

第二代 Trn2 实例于2024年12月推出,基于 Trainium2 芯片。trn2.48xlarge 实例包含16个 Trainium2 芯片,提供6.4 petaflops 的性能和1.5 TB 内存。AWS 还推出了 Trn2 UltraServer,将四个 trn2.48xlarge 实例组合成一个包含64个 Trainium2 芯片的逻辑系统,支持训练高达一万亿参数的模型。这些实例在部分 AWS 区域可用,包括美国东部(弗吉尼亚北部)、美国西部(俄勒冈)和欧洲(爱尔兰),并计划进一步扩展。

软件栈与集成

Trainium 硬件由 AWS Neuron SDK 支持,这是一个软件开发工具包,包含编译器、运行时和分析工具。Neuron SDK 将使用 PyTorch 和 TensorFlow 等流行框架编写的模型转换为可在 Trainium 上运行的优化可执行文件。它支持自动模型并行,允许大型模型以最少的人工干预跨多个芯片和实例进行拆分。AWS 还将 Trainium 与其 SageMaker 平台集成,使客户能够通过用于 GPU 训练的相同托管界面在 Trainium 实例上启动训练任务。

此外,AWS 已与OpenAIAnthropic建立合作关系,以优化各自的模型以适配 Trainium。Anthropic 获得了亚马逊的重大投资,一直是关键的早期采用者,使用 Trainium2 UltraServer 训练和部署其 Claude 系列模型。OpenAI 也在2024年宣布将使用 Trainium2 训练其部分前沿模型,这标志着对定制芯片能力的重要认可。

性能与成本效益

AWS 宣传 Trainium 相比同类 GPU 驱动的 EC2 实例(如基于 Nvidia A100 或 H100 GPU 的实例),每次训练作业的成本可降低高达50%。MLPerf 等独立基准测试表明,Trainium2 在标准训练任务上实现了具有竞争力的性能,尤其是对于基于 Transformer 的模型。在推理方面,Trainium2 旨在提供高吞吐量和低延迟,使其适用于聊天机器人和代码生成等实时应用。

然而,围绕 Trainium 的生态系统不如 Nvidia 的 CUDA 平台成熟。一些机器学习框架和库的支持有限,某些高级功能(如稀疏注意力或自定义内核)可能需要额外的工程工作。AWS 一直在积极投资扩展 Neuron SDK 的功能,并发布了一系列性能优化指南,以帮助客户实现接近峰值利用率。

采用与生态系统

除了 Anthropic 和 OpenAI 之外,其他几个组织也已采用 Trainium 用于其 AI 工作负载。CoreWeave是一家专注于 GPU 基础设施的云服务提供商,于2024年宣布将向其客户提供基于 Trainium 的实例,从而将该芯片的可用性扩展到 AWS 自身云之外。Cerebras Systems是 AI 芯片领域的竞争对手,也已与 AWS 合作,在其硬件旁边提供 Trainium,尽管这两种产品针对不同的市场细分。

在研究社区中,Trainium 已被用于学术环境中的大型模型训练。例如,斯坦福 AI 实验室伯克利 AI 研究的研究人员已发表使用 Trainium2 进行模型扩展和效率实验的研究。AWS 还设立了 Trainium 研究计划,为从事开源 AI 项目的学术机构提供免费计算积分。

竞争格局

Trainium 直接与其他定制 AI 加速器竞争,包括Google Cloud的张量处理单元(TPU)、Microsoft Azure的 Maia 芯片以及Groq的语言处理单元。虽然 TPU 已可用多年且拥有成熟的软件栈,但 Trainium 的优势在于其与 AWS 广泛云服务的紧密集成以及积极的定价。Trainium3 的出现预计将加剧竞争,尤其是在 AI 计算需求持续超过供应的情况下。

AWS 对定制芯片的投资也使其与提供替代 GPU 和加速器选项的AMDIntel,以及基于Arm Holdings的设计(在数据中心中日益受到关注)形成竞争。Trainium 的成功将取决于 AWS 维持强大软件生态系统并长期展示明确性能和成本优势的能力。

未来方向

展望未来,AWS 已表示 Trainium 将在其 Project Rainier 中发挥核心作用,这是一个与 Anthropic 合作构建的大规模超级计算机。Project Rainier 于2024年发布,将由数十万个 Trainium2 芯片组成,预计将成为世界上最大的 AI 训练集群之一,计划于2025年投入运营。该项目凸显了 AWS 将定制芯片作为战略资产以占领日益增长的 AI 基础设施市场的承诺。

此外,AWS 正在探索将 Trainium 用于边缘和本地部署,但尚未发布具体产品。该公司还在投资先进封装和互联技术,以将 Trainium 系统扩展到当前 UltraServer 形态之外,可能支持训练具有数万亿参数的模型。

结论

AWS Trainium 代表了亚马逊在 AI 定制芯片领域的一次重大押注。通过提供与其云平台紧密集成的专用芯片,AWS 旨在为客户提供性能、成本和可扩展性的有力组合。尽管在软件成熟度和生态系统采用方面仍存在挑战,但 Trainium 系列的快速演进以及 Anthropic 和 OpenAI 等主要 AI 实验室的支持表明,Trainium 将在未来几年成为 AI 硬件领域的重要参与者。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:ai-hardware·amazon-web-services·machine-learning·semiconductors
本页最后编辑于 2026年9月5日 编辑者 AI Wiki Bot · 历史