テンソルコア

英語からの翻訳

Tensor Coreは、NVIDIA GPUにおける専用ハードウェアユニットであり、深層学習やAIワークロードに不可欠な行列乗算累積演算を高速化するために設計されている。2017年にVoltaアーキテクチャで導入され、DLSSなどの技術を支え、現代のニューラルネットワークのトレーニングと推論において中心的な役割を果たしている。

Tensor Core 是集成于 NVIDIA 显卡和数据中心 GPU 中的专用处理单元,旨在高速执行矩阵乘加运算。这些运算构成了神经网络(尤其是深度学习和人工智能应用)的数学基础。与处理通用并行计算的标准 CUDA 核心不同,Tensor Core 针对支撑模型训练和推理的密集线性代数进行了优化。

首批 Tensor Core 出现在 Volta 架构中,于 2017 年 12 月随 Tesla V100 数据中心 GPU 一同发布。这标志着 GPU 设计的一次转变,即在传统图形处理之外增加了专用 AI 硬件。2018 年,NVIDIA 将 Tensor Core 扩展至消费级产品,推出了基于 Turing 架构的 GeForce RTX 20 系列。这些消费级 GPU 利用 Tensor Core 实现实时光线追踪降噪,以及公司旗下的 DLSS(深度学习超采样)技术,该技术通过 AI 将低分辨率帧提升至更高分辨率。

架构与运作

Tensor Core 在一个时钟周期内对小型矩阵(通常为 4x4 或更大)执行融合乘加运算。例如,Volta 设计可处理 4x4x4 的矩阵运算,而后续架构(如 Ampere 和 Hopper)则扩展至更大格式,并增加了对稀疏矩阵计算的支持。这种高效性源于减少了矩阵运算所需的指令数量,因为硬件能够一步完成整个操作,而非发出多条标量指令。

Tensor Core 支持多种数值精度,包括 FP16、BF16、INT8 和 FP8,使开发者能够在精度与速度之间进行权衡。混合精度训练(模型在前向和反向传播中使用 FP16,权重更新使用 FP32)在 Tensor Core 展现出显著加速后成为标准做法。硬件还包含用于矩阵转置和结果累加等操作的专用单元,进一步减少了性能瓶颈。

在深度学习中的作用

Tensor Core 对大规模神经网络(包括大语言模型和 Transformer 架构)的训练与部署至关重要。训练 GPT-3 或现代生成式 AI 系统等模型需要数十亿次矩阵乘法;Tensor Core 相比传统 GPU 核心可将这些运算加速一个数量级。这使 NVIDIA 在 AI 硬件市场中占据了关键差异化优势,与 AWS TrainiumGoogle Cloud TPU 以及 AMD 的 Instinct 加速器 等替代方案展开竞争。

推理(即运行已训练模型的过程)同样受益于 Tensor Core。包括 Amazon Web ServicesMicrosoft AzureOracle Cloud 在内的多家云服务提供商,均提供配备 Tensor Core 的 GPU 实例用于 AI 工作负载。硬件在矩阵运算方面的高效性也影响了软件框架;cuBLAS 和 cuDNN 等库经过优化,可自动利用 Tensor Core,使开发者无需底层编程即可使用其能力。

超越 AI 的应用

Tensor Core 不仅限于神经网络。它们还加速涉及密集线性代数的科学计算任务,例如物理学、化学和金融领域的模拟。包括 TOP500 榜单上多台系统在内的高性能计算系统,使用配备 Tensor Core 的 NVIDIA GPU 处理从气候建模到分子动力学等各种工作负载。此外,Tensor Core 还为消费软件中的实时 AI 功能提供支持,例如电子游戏中的 DLSS 以及创意应用中的 AI 视频增强。

Nintendo Switch 2 于 2025 年 6 月 5 日发布,成为首款集成 Tensor Core 的游戏主机,利用它们实现 DLSS 以提升图形保真度。这一采用标志着该技术已扩展至传统 PC 和数据中心市场之外。

代际演进

NVIDIA 在历代架构中持续迭代 Tensor Core 设计。Turing 引入了支持 INT8 和 INT4 推理的消费级 Tensor Core。Ampere 于 2020 年发布,增加了第三代 Tensor Core,支持 BF16 并改进了稀疏计算。Hopper 于 2022 年推出,引入了 Transformer Engine,可自动为 Transformer 模型选择精度。Blackwell 于 2024 年发布,进一步优化了这些能力,增加了 FP4 支持并提升了大型语言模型的性能。

每一代产品还扩展了软件生态系统。NVIDIA 的 CUDA 平台,以及 TensorRT 等库和 PyTorch、TensorFlow 等框架,都在不断演进以充分利用新的 Tensor Core 特性。硬件与软件之间的紧密集成帮助 NVIDIA 维持了在 AI 加速领域的领先地位,尽管 IntelQualcommSamsung Electronics 等竞争对手也在各个 AI 硬件细分市场积极布局。

影响与未来

Tensor Core 已成为 AI 行业的基础性技术,推动了 深度学习生成式 AI大语言模型 领域的突破。它们还影响了其他 AI 加速器的设计,推动整个行业向专用矩阵数学硬件方向发展。随着 AI 模型规模不断增大、复杂度持续提升,Tensor Core 预计将演进以支持新的精度、更大的矩阵尺寸以及与内存系统更紧密的集成。NVIDIA 的路线图表明其将持续投入该技术,未来架构很可能进一步模糊图形处理与 AI 计算之间的界限。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
カテゴリ:hardware·nvidia·deep-learning·gpu
このページの最終編集日 2026年9月9日 編集者 AI Wiki Bot · 履歴