Tensor Core 是集成于 NVIDIA 显卡和数据中心 GPU 中的专用处理单元,旨在高速执行矩阵乘加运算。这些运算构成了神经网络(尤其是深度学习和人工智能应用)的数学基础。与处理通用并行计算的标准 CUDA 核心不同,Tensor Core 针对支撑模型训练和推理的密集线性代数进行了优化。
首批 Tensor Core 出现在 Volta 架构中,于 2017 年 12 月随 Tesla V100 数据中心 GPU 一同发布。这标志着 GPU 设计的一次转变,即在传统图形处理之外增加了专用 AI 硬件。2018 年,NVIDIA 将 Tensor Core 扩展至消费级产品,推出了基于 Turing 架构的 GeForce RTX 20 系列。这些消费级 GPU 利用 Tensor Core 实现实时光线追踪降噪,以及公司旗下的 DLSS(深度学习超采样)技术,该技术通过 AI 将低分辨率帧提升至更高分辨率。
架构与运作
Tensor Core 在一个时钟周期内对小型矩阵(通常为 4x4 或更大)执行融合乘加运算。例如,Volta 设计可处理 4x4x4 的矩阵运算,而后续架构(如 Ampere 和 Hopper)则扩展至更大格式,并增加了对稀疏矩阵计算的支持。这种高效性源于减少了矩阵运算所需的指令数量,因为硬件能够一步完成整个操作,而非发出多条标量指令。
Tensor Core 支持多种数值精度,包括 FP16、BF16、INT8 和 FP8,使开发者能够在精度与速度之间进行权衡。混合精度训练(模型在前向和反向传播中使用 FP16,权重更新使用 FP32)在 Tensor Core 展现出显著加速后成为标准做法。硬件还包含用于矩阵转置和结果累加等操作的专用单元,进一步减少了性能瓶颈。
在深度学习中的作用
Tensor Core 对大规模神经网络(包括大语言模型和 Transformer 架构)的训练与部署至关重要。训练 GPT-3 或现代生成式 AI 系统等模型需要数十亿次矩阵乘法;Tensor Core 相比传统 GPU 核心可将这些运算加速一个数量级。这使 NVIDIA 在 AI 硬件市场中占据了关键差异化优势,与 AWS Trainium、Google Cloud TPU 以及 AMD 的 Instinct 加速器 等替代方案展开竞争。
推理(即运行已训练模型的过程)同样受益于 Tensor Core。包括 Amazon Web Services、Microsoft Azure 和 Oracle Cloud 在内的多家云服务提供商,均提供配备 Tensor Core 的 GPU 实例用于 AI 工作负载。硬件在矩阵运算方面的高效性也影响了软件框架;cuBLAS 和 cuDNN 等库经过优化,可自动利用 Tensor Core,使开发者无需底层编程即可使用其能力。
超越 AI 的应用
Tensor Core 不仅限于神经网络。它们还加速涉及密集线性代数的科学计算任务,例如物理学、化学和金融领域的模拟。包括 TOP500 榜单上多台系统在内的高性能计算系统,使用配备 Tensor Core 的 NVIDIA GPU 处理从气候建模到分子动力学等各种工作负载。此外,Tensor Core 还为消费软件中的实时 AI 功能提供支持,例如电子游戏中的 DLSS 以及创意应用中的 AI 视频增强。
Nintendo Switch 2 于 2025 年 6 月 5 日发布,成为首款集成 Tensor Core 的游戏主机,利用它们实现 DLSS 以提升图形保真度。这一采用标志着该技术已扩展至传统 PC 和数据中心市场之外。
代际演进
NVIDIA 在历代架构中持续迭代 Tensor Core 设计。Turing 引入了支持 INT8 和 INT4 推理的消费级 Tensor Core。Ampere 于 2020 年发布,增加了第三代 Tensor Core,支持 BF16 并改进了稀疏计算。Hopper 于 2022 年推出,引入了 Transformer Engine,可自动为 Transformer 模型选择精度。Blackwell 于 2024 年发布,进一步优化了这些能力,增加了 FP4 支持并提升了大型语言模型的性能。
每一代产品还扩展了软件生态系统。NVIDIA 的 CUDA 平台,以及 TensorRT 等库和 PyTorch、TensorFlow 等框架,都在不断演进以充分利用新的 Tensor Core 特性。硬件与软件之间的紧密集成帮助 NVIDIA 维持了在 AI 加速领域的领先地位,尽管 Intel、Qualcomm 和 Samsung Electronics 等竞争对手也在各个 AI 硬件细分市场积极布局。
影响与未来
Tensor Core 已成为 AI 行业的基础性技术,推动了 深度学习、生成式 AI 和 大语言模型 领域的突破。它们还影响了其他 AI 加速器的设计,推动整个行业向专用矩阵数学硬件方向发展。随着 AI 模型规模不断增大、复杂度持续提升,Tensor Core 预计将演进以支持新的精度、更大的矩阵尺寸以及与内存系统更紧密的集成。NVIDIA 的路线图表明其将持续投入该技术,未来架构很可能进一步模糊图形处理与 AI 计算之间的界限。