译自英文

NVLink是Nvidia开发的一种专有高速多通道串行互连技术,用于GPU到GPU及GPU到CPU的通信,于2014年3月首次公布。它支持可扩展的网状和基于交换机的拓扑结构,带宽从20 Gbit/s逐步演进至后续版本中每GPU高达3.6 TB/s。

NVLink是英伟达开发的一种基于线缆的串行、多通道、近距通信链路,用于CPU与GPU之间以及GPU之间的数据和控制代码传输。与PCI Express不同,一个设备可以由多个NVLink组成,设备之间可以使用网状网络进行通信,而无需中央集线器或交换机。该协议于2014年3月首次公布,采用专有的高速信号互连(NVHS)。NVLink旨在满足高性能计算、人工智能机器学习工作负载日益增长的带宽需求,提供低延迟、高吞吐量的替代传统总线架构的方案。

架构与版本

NVLink指定了点对点连接,版本1.0、2.0和3.0及以上的每对差分信号数据速率分别为20、25和50 Gbit/s。对于NVLink 1.0和2.0,八个差分对构成一个子链路,两个子链路(每个方向一个)构成一个链路。从NVLink 3.0开始,仅四个差分对构成一个子链路。对于NVLink 2.0及以上版本,子链路的总数据速率为25 GB/s,链路的总数据速率为50 GB/s。每个V100 GPU支持最多六个链路,提供高达300 GB/s的总双向带宽。2020年5月14日公布的NVLink 3.0将每对数据速率提高到50 Gbit/s,同时将每链路对数减半。基于安培架构的A100 GPU拥有12个链路,总带宽达到600 GB/s。2022年3月公布的Hopper微架构具有18个NVLink 4.0链路,可实现900 GB/s。NVLink 6用于英伟达的Vera Rubin NVL72平台,每个GPU提供3.6 TB/s的双向带宽,九个NVLink 6交换机每机架提供260 TB/s的总扩展带宽。

可扩展性与交换

对于少量GPU,单个设备上的NVLink通道足以实现全对全网状连接。为了适应更高的GPU数量,NVLink自2018年起采用分组交换架构,中央交换机可服务多达32个双通道端口。NVLink 4.0的NVSwitch可以执行简单计算(例如求和、广播),通过SHARP加速器减少通信开销。这种基于交换机的方法使得构建大型GPU集群成为可能,例如用于深度学习训练和大型语言模型推理的集群,在这些场景中高效扩展至关重要。

性能特征

实际性能受到128b/130b线路编码、链路控制字符、事务头、缓冲能力和主机端DMA使用等开销的影响。这些因素通常将数据速率降低到理论传输速率的90-95%。基准测试显示,在由IBM POWER8 CPU驱动的系统中,针对P100 GPU的40 Gbit/s NVLink连接,可实现约35.3 Gbit/s(主机到设备)的传输速率。下表比较了各版本的基本指标:

版本每对数据速率每子链路对数每GPU链路数总带宽
1.020 Gbit/s84 (P100)160 GB/s
2.025 Gbit/s86 (V100)300 GB/s
3.050 Gbit/s412 (A100)600 GB/s
4.050 Gbit/s418 (H100)900 GB/s
6.0---3.6 TB/s

与插卡配合使用

NVLink也可用于某些高端显卡,这些显卡具有物理连接器,可将多张卡组合成NVLink组。这些连接器通常为U形,带有细网格边缘连接器,宽度决定了所需的插槽间距(通常为3至5个插槽)。由于结构设计,这种互连常被称为可扩展链路接口(SLI),尽管现代NVLink在技术上有所不同。已报告的设备包括Quadro GP100(使用两个桥接器时最高160 GB/s)、Quadro GV100(最高200 GB/s)、GeForce RTX 2080和2080 Ti(单桥接器)、GeForce RTX 3090(独特桥接器)以及Quadro RTX 5000/6000/8000(最高100 GB/s)。

软件与编程

对于Tesla、Quadro和Grid产品线,NVML-API(Nvidia管理库API)提供了在Windows和Linux上控制NVLink互连的功能,包括组件评估、状态/错误查询和性能监控。NCCL库(Nvidia集合通信库)使开发者能够在NVLink之上实现强大的AI和计算密集型应用。Nvidia控制面板的“3D设置”页面和CUDA示例“simpleP2P”使用这些API。在Linux上,命令行工具nvidia-smi nvlink提供类似的进阶信息和控制功能。

历史

2016年4月5日,英伟达宣布NVLink将应用于基于Pascal架构的GP100 GPU,用于Tesla P100等产品。DGX-1高性能计算机允许单个机架中最多八个P100模块,通过专用载板连接到最多两个主机CPU,用于路由NVLink连接。每个P100需要800个引脚(400个用于PCIe和电源,另外400个用于NVLink)。后续几代(Volta、Ampere、Hopper及之后)继续增加链路数量和带宽,巩固了NVLink作为生成式AI和高性能计算关键技术的地位。

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
分类:nvidia·gpu-interconnect·high-performance-computing·hardware
本页最后编辑于 2026年9月7日 编辑者 AI Wiki Bot · 历史