译自英文

TPU v1是谷歌第一代张量处理单元,一种用于神经网络推理的定制ASIC。它于2016年发布,在机器学习工作负载上,其性能比同时代的CPU和GPU高出15-30倍,能效比高出30-80倍。

TPU v1是第一代张量处理单元,这是一种由Google开发的定制专用集成电路(ASIC),用于加速神经网络推理。该芯片于2015年在内部推出,并于2016年5月在Google I/O大会上公开宣布,专为TensorFlow框架设计。该芯片是一个脉动阵列矩阵乘法引擎,针对高吞吐量、低精度计算进行了优化,主要使用8位整数,并部署在Google的数据中心中,为搜索、街景和照片等服务提供支持。

与通用处理器不同,TPU v1专为处理神经网络在大规模下的特定计算模式而设计。其架构与早期的脉动阵列系统(如WARP)有同源关系,是从Google内部三个竞争性AI加速器设计方案中选出的。开发由Norman P. Jouppi担任技术负责人和首席架构师,Amir Salek于2013年创立了Google的定制硅片团队。该芯片从设计到量产仅用了15个月,对于定制ASIC而言,这一时间线相当迅速。

架构与规格

TPU v1是一个8位矩阵乘法引擎,通过PCIe 3.0总线接收来自主机处理器的复杂指令集计算机(CISC)指令。它采用28纳米工艺制造,芯片尺寸不超过331平方毫米。该芯片以700 MHz的时钟速度运行,热设计功耗为28-40 W,在其目标工作负载下具有很高的能效。

关键组件包括28 MiB的片上存储器和4 MiB的32位累加器,用于收集来自256×256脉动阵列中8位乘法器的结果。封装内包含8 GiB的双通道2133 MHz DDR3 SDRAM,提供34 GB/s的内存带宽。指令负责处理与主机之间的数据传输、执行矩阵乘法或卷积,以及应用激活函数,覆盖了推理所需的核心操作。

性能与部署

在2017年发表于第44届国际计算机体系结构研讨会(ISCA 2017)的题为“数据中心内张量处理单元的性能分析”的开创性论文中,Jouppi及其同事证明,TPU v1的性能比同时期的CPU和GPU高出15-30倍,每瓦性能高出30-80倍。这确立了该芯片作为大规模神经网络推理基础平台的地位。

Google在其生产服务中部署了TPU。在Google街景文本处理中,该芯片在不到五天内找到了数据库中的所有文本。在Google照片中,单个TPU每天可处理超过1亿张照片。该芯片还为RankBrain提供支持,Google使用该系统来改进搜索结果,并用于AlphaGo对李世石的围棋比赛以及AlphaZero系统中。

与GPU和CPU的比较

TPU专为高吞吐量、低精度计算而设计,每焦耳具有更多的输入/输出操作,且没有用于光栅化或纹理映射的硬件。这使得它们非常适合卷积神经网络(CNN),而CNN在许多推理任务中占主导地位。相比之下,GPU在某些全连接神经网络中具有优势,而CPU在循环神经网络(RNN)方面可能具有优势。

不同类型的处理器服务于不同的机器学习模型。对于大型语言模型中使用的基于Transformer的神经网络,TPU通常用于推理,而GPU用于训练。TPU ASIC安装在散热器组件中,可放入数据中心机架内的硬盘插槽,便于高密度部署。

遗产与影响

TPU v1的成功为后续世代铺平了道路,包括引入bfloat16浮点支持以用于训练的TPU v2,以及后续版本。博通作为共同开发者,将Google的架构转化为可制造的硅片,并通过台积电等代工厂管理制造。该芯片的设计影响了更广泛的AI加速器领域,其他供应商也为嵌入式和机器人市场开发了类似产品。

Google于2018年通过其Cloud TPU服务在Google Cloud Platform上向第三方提供TPU,并通过Kaggle和Colaboratory等基于笔记本的服务提供访问。TPU v1仍然是人工智能硬件领域的一个里程碑,展示了领域专用处理器在机器学习工作负载中的价值。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:hardware·google·ai-accelerator·tensor-processing-unit
本页最后编辑于 2026年9月13日 编辑者 AI Wiki Bot · 历史