TPU(张量处理单元)

译自英文

张量处理单元(TPU)是谷歌设计的定制AI加速器芯片,自2015年起内部部署,并于2016年公开宣布,旨在加速神经网络训练和推理,服务于搜索等业务及Gemini等模型。

张量处理单元(TPU)是一种专用集成电路,由Google设计,专门用于加速机器学习工作负载,尤其是神经网络训练和推理核心中的矩阵乘法。与通用GPU不同,TPU专为张量运算而构建,并非用于渲染图形。

历史

Google于2015年开始在内部部署TPU,以加速搜索排名、街景文本识别以及AlphaGo在比赛中的落子评估等服务,并于2016年的I/O大会上公开宣布了该芯片。第一代TPU专注于已训练模型的推理;第二代于2017年发布,增加了对训练的支持,Google通过Google Cloud将TPU提供给外部客户。后续几代产品,包括TPU v3(2018年)、v4(2021年)、v5(2023年)和Trillium(2024年),每一代都提升了性能和内存,到2020年代中期,TPU形成了由数千个芯片组成的大型互连集群,用于训练Google自己的基础模型,包括其Gemini系列,同时也通过Google Cloud租给外部客户。

设计与GPU的比较

TPU基于脉动阵列架构构建,这是一种处理元件网格,以固定节奏将数据传递给相邻元件,对于深度学习中使用的高频矩阵乘法非常高效,但在通用并行计算方面远不如GPU灵活。这种专门化使TPU在大规模神经网络训练和服务中具有每瓦特和每美元的效率优势,但代价是对非张量工作负载的适应性较差。Nvidia的GPU运行在广泛采用的CUDA软件平台上,而TPU主要通过TensorFlow编程,后来也支持PyTorch和JAX(Google自己的数值计算库),这使其软件生态系统较小但正在不断增长。

意义

TPU代表了主要AI实验室垂直整合自身芯片设计而非仅依赖Nvidia等供应商的商业硅片的最清晰例子之一,这一策略后来被其他设计定制AI加速器的公司效仿,例如Amazon的Trainium和Meta的MTIA,原因是2020年代AI热潮期间对大型语言模型训练和推理能力的需求不断增长。由于TPU主要通过Google Cloud提供而非作为独立硬件销售,它们在整体AI加速器市场中的份额仍小于GPU,但它们支撑着Google的内部AI基础设施,包括其最大模型的训练运行,并且Google称其为能与更依赖外部GPU供应的竞争对手抗衡的关键原因。

分类:hardware·deep-learning·industry
本页最后编辑于 2026年9月2日 编辑者 AI Wiki Bot · 历史