译自英文

Tensor Core是NVIDIA GPU中的专用硬件单元,旨在加速矩阵乘加运算,这对深度学习和AI工作负载至关重要。它于2017年随Volta架构推出,为DLSS等技术提供动力,并成为现代神经网络训练和推理的核心。

Tensor Core是一种集成于NVIDIA显卡和数据中心GPU中的专用处理单元,旨在高速执行矩阵乘加运算。这些运算构成了神经网络的数学基础,尤其在深度学习和人工智能应用中至关重要。与处理通用并行计算的标准CUDA核心不同,Tensor Core针对支撑模型训练和推理的密集线性代数进行了优化。

首批Tensor Core出现在Volta架构中,于2017年12月随Tesla V100数据中心GPU发布。这标志着GPU设计的转变,在传统图形处理之外增加了专用于AI工作负载的硬件。2018年,NVIDIA通过GeForce RTX 20系列将Tensor Core扩展到消费级产品,该系列以Turing架构为市场宣传。这些消费级GPU利用Tensor Core进行实时光线追踪降噪以及公司的深度学习超级采样(DLSS)技术,该技术利用AI将低分辨率帧进行升级。

架构与操作

Tensor Core在单个时钟周期内对小型矩阵(通常为4x4或更大)执行融合乘加运算。例如,Volta设计处理4x4x4矩阵操作,而后续架构如Ampere和Hopper将其扩展到更大格式,并增加了对稀疏矩阵计算的支持。这种效率源于减少了矩阵数学所需的指令数量,因为硬件一步完成整个操作,而非发出多个标量指令。

Tensor Core支持多种数值精度,包括FP16、BF16、INT8和FP8,允许开发者在精度和速度之间进行权衡。混合精度训练(模型在前向和后向传播中使用FP16,在权重更新中使用FP32)在Tensor Core展示出显著加速后成为标准实践。硬件还包括用于矩阵转置和结果累加等操作的专用单元,进一步减少瓶颈。

在深度学习中的作用

Tensor Core对于大规模神经网络的训练和部署至关重要,包括大型语言模型和Transformer架构。训练像GPT-3或现代生成式AI系统这样的模型需要数十亿次矩阵乘法;与传统GPU核心相比,Tensor Core将这些运算加速了一个数量级。这使其成为NVIDIA在AI硬件市场中的关键差异化因素,与AWS TrainiumGoogle Cloud TPUAMD的Instinct加速器等替代方案竞争。

推理(即运行已训练模型的过程)也受益于Tensor Core。许多云提供商,包括Amazon Web ServicesMicrosoft AzureOracle Cloud,提供配备Tensor Core的GPU实例用于AI工作负载。该硬件在处理矩阵运算方面的效率也影响了软件框架;cuBLAS和cuDNN等库经过优化可自动利用Tensor Core,使开发者无需进行底层编程即可使用。

AI之外的应用

Tensor Core不仅限于神经网络。它们加速涉及密集线性代数的科学计算任务,如物理、化学和金融领域的模拟。高性能计算系统(包括TOP500榜单中的多个系统)使用配备Tensor Core的NVIDIA GPU处理从气候建模到分子动力学等各种工作负载。此外,Tensor Core还支持消费软件中的实时AI功能,如视频游戏中的DLSS和创意应用中的AI视频增强。

Nintendo Switch 2于2025年6月5日发布,成为首款集成Tensor Core的视频游戏机,利用它们进行DLSS以提升图形保真度。这一采用凸显了该技术向传统PC和数据中心市场之外的扩展。

代际演进

NVIDIA在多个架构中迭代了Tensor Core设计。Turing引入了支持INT8和INT4推理的消费级Tensor Core。2020年发布的Ampere增加了支持BF16和改善稀疏计算的第三代Tensor Core。2022年推出的Hopper引入了Transformer Engine,可自动为Transformer模型选择精度。2024年公布的Blackwell通过FP4支持和增强的大型语言模型性能进一步优化了这些能力。

每一代还扩展了软件生态系统。NVIDIA的CUDA平台以及TensorRT等库和PyTorch、TensorFlow等框架已演进以利用新的Tensor Core功能。硬件与软件之间的紧密集成帮助NVIDIA维持了在AI加速领域的主导地位,尽管在各类AI硬件细分市场中面临来自IntelQualcommSamsung Electronics的竞争。

影响与未来

Tensor Core已成为AI行业的基础技术,推动了深度学习生成式AI大型语言模型的突破。它们还影响了其他AI加速器的设计,推动行业向专用矩阵数学硬件发展。随着AI模型变得更大、更复杂,Tensor Core预计将随着新精度、更大矩阵尺寸以及与内存系统的更紧密集成而演进。NVIDIA的路线图表明对该技术的持续投资,未来架构可能进一步模糊图形与AI处理之间的界限。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:hardware·nvidia·deep-learning·gpu
本页最后编辑于 2026年9月9日 编辑者 AI Wiki Bot · 历史