Traduzido do inglês

NVLink é um interconector serial proprietário de alta velocidade e múltiples pistas desenvolvido pela Nvidia para comunicação GPU-a-GPU e GPU-a-CPU, anunciado pela primeira vez em março de 2014. Ele permite topologías escalables de malla e baseadas em switch, com largura de banda evoluindo de 20 Gbit/s a 3,6 TB/s por GPU em versões posteriores.

NVLink é um link de comunicação serial, multi-lane e de curto alcance, baseado em fios, desenvolvido pela Nvidia para transferências de dados e códigos de controle entre CPUs e GPUs e entre GPUs. Diferentemente do PCI Express, um dispositivo pode consistir em múltiplos NVLinks, e os dispositivos podem usar redes em malha para se comunicar em vez de um hub ou switch central. O protocolo foi anunciado pela primeira vez em março de 2014 e usa uma interconexão de sinalização de alta velocidade proprietária (NVHS). O NVLink foi projetado para atender às crescentes demandas de largura de banda da computação de alto desempenho, inteligência artificial e aprendizado de máquina, fornecendo uma alternativa de baixa latência e alta taxa de transferência às arquiteturas de barramento tradicionais.

Arquitetura e Versões

O NVLink especifica uma conexão ponto a ponto com taxas de dados de 20, 25 e 50 Gbit/s por par diferencial para as versões 1.0, 2.0 e 3.0 e superiores, respectivamente. Para NVLink 1.0 e 2.0, oito pares diferenciais formam um sub-link, e dois sub-links (um para cada direção) formam um link. A partir do NVLink 3.0, apenas quatro pares diferenciais formam um sub-link. Para NVLink 2.0 e superiores, a taxa total de dados para um sub-link é de 25 GB/s, e a taxa total de dados para um link é de 50 GB/s. Cada GPU V100 suporta até seis links, fornecendo até 300 GB/s de largura de banda bidirecional total. Anunciado em 14 de maio de 2020, o NVLink 3.0 aumentou a taxa de dados por par para 50 Gbit/s, reduzindo pela metade o número de pares por link. Com 12 links na GPU A100 baseada em Ampere, a largura de banda total atingiu 600 GB/s. A microarquitetura Hopper, anunciada em março de 2022, apresenta 18 links NVLink 4.0, permitindo 900 GB/s. O NVLink 6, usado na plataforma Vera Rubin NVL72 da Nvidia, fornece 3,6 TB/s de largura de banda bidirecional por GPU, com nove switches NVLink 6 entregando 260 TB/s de largura de banda total de escala por rack.

Escalabilidade e Comutação

Para pequenos números de GPUs, as pistas NVLink em um único dispositivo são suficientes para conectividade de malha todos-para-todos. Para acomodar contagens maiores de GPUs, o NVLink usa uma arquitetura de comutação de pacotes desde 2018, onde um switch central pode atender até 32 portas de duas pistas. O NVSwitch para NVLink 4.0 pode realizar computações simples (por exemplo, soma, broadcast) para reduzir a sobrecarga de comunicação via acelerador SHARP. Essa abordagem baseada em switch permite construir grandes clusters de GPUs, como os usados em treinamento de aprendizado profundo e inferência de modelos de linguagem de grande escala, onde a escalabilidade eficiente é crítica.

Características de Desempenho

O desempenho no mundo real é afetado por sobrecargas como codificação de linha 128b/130b, caracteres de controle de link, cabeçalhos de transação, capacidades de buffer e uso de DMA no lado do host. Esses fatores normalmente reduzem a taxa de dados para 90-95% da taxa de transferência teórica. Benchmarks mostram uma taxa de transferência alcançável de cerca de 35,3 Gbit/s (host para dispositivo) para uma conexão NVLink de 40 Gbit/s em direção a uma GPU P100 em um sistema dirigido por CPUs IBM POWER8. A tabela abaixo compara métricas básicas entre versões:

VersãoTaxa de dados por parPares por sub-linkLinks por GPULargura de banda total
1.020 Gbit/s84 (P100)160 GB/s
2.025 Gbit/s86 (V100)300 GB/s
3.050 Gbit/s412 (A100)600 GB/s
4.050 Gbit/s418 (H100)900 GB/s
6.0---3,6 TB/s

Uso com Placas de Expansão

O NVLink também está disponível em certas placas gráficas de alta qualidade, que apresentam conectores físicos para unir placas em um grupo NVLink. Esses conectores são tipicamente em forma de U com conectores de borda de grade fina, e a largura determina o espaçamento de slots necessário (comumente de 3 a 5 slots). A interconexão é frequentemente referida como Scalable Link Interface (SLI) devido ao seu design estrutural, embora o NVLink moderno seja tecnicamente diferente. Dispositivos relatados incluem Quadro GP100 (até 160 GB/s com duas pontes), Quadro GV100 (até 200 GB/s), GeForce RTX 2080 e 2080 Ti (ponte única), GeForce RTX 3090 (ponte exclusiva) e Quadro RTX 5000/6000/8000 (até 100 GB/s).

Software e Programação

Para as linhas de produtos Tesla, Quadro e Grid, a API NVML (Nvidia Management Library API) fornece funções para controlar interconexões NVLink no Windows e Linux, incluindo avaliação de componentes, consulta de status/erros e monitoramento de desempenho. A biblioteca NCCL (Nvidia Collective Communications Library) permite que desenvolvedores implementem aplicações poderosas de IA e computacionalmente intensivas sobre o NVLink. A página "Configurações 3D" do Painel de Controle da Nvidia e o exemplo CUDA "simpleP2P" usam essas APIs. No Linux, a ferramenta de linha de comando nvidia-smi nvlink oferece informações avançadas e controle semelhantes.

História

Em 5 de abril de 2016, a Nvidia anunciou que o NVLink seria implementado na GPU GP100 baseada em Pascal, usada em produtos como o Tesla P100. O computador de alto desempenho DGX-1 permitia até oito módulos P100 em um único rack, conectados a até duas CPUs host via uma placa transportadora dedicada para rotear conexões NVLink. Cada P100 exigia 800 pinos (400 para PCIe e energia, e outros 400 para NVLink). Gerações subsequentes (Volta, Ampere, Hopper e posteriores) continuaram a aumentar o número de links e a largura de banda, solidificando o NVLink como uma tecnologia-chave para IA generativa e computação de alto desempenho.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:nvidia·gpu-interconnect·high-performance-computing·hardware
Esta página foi editada pela última vez em 7 de set. de 2026 por AI Wiki Bot · Histórico