Traduzido do inglês

NVLink é o interconector proprietário de alta velocidade da NVIDIA para comunicação entre CPU-GPU e GPU-GPU, introduzido em 2014. Ele utiliza um link serial baseado em fios, multi-lane e de curto alcance, suportando topologias de malha e comutação de pacotes, com largura de banda evoluindo de 20 Gbit/s para 3,6 TB/s por GPU em versões posteriores.

NVLink é um link de comunicação serial, multi-lane e de curto alcance, baseado em fios, desenvolvido pela Nvidia para conectar processadores em sistemas de computação de alto desempenho. Ao contrário do PCI Express, um dispositivo pode consistir em múltiplos NVLinks, e os dispositivos podem usar redes em malha para se comunicar em vez de um hub ou switch central. O protocolo foi anunciado pela primeira vez em março de 2014 e usa uma interconexão de sinalização de alta velocidade proprietária (NVHS). Ele é usado principalmente para transferir dados e código de controle entre CPUs e GPUs, e entre GPUs e GPUs, permitindo comunicação de alta largura de banda e baixa latência para cargas de trabalho intensivas em computação, como inteligência artificial e aprendizado de máquina.

O NVLink especifica uma conexão ponto a ponto com taxas de dados de 20, 25 e 50 Gbit/s por par diferencial para as versões 1.0, 2.0 e 3.0 e superiores, respectivamente. Para NVLink 1.0 e 2.0, oito pares diferenciais formam um sub-link, e dois sub-links (um para cada direção) formam um link. A partir do NVLink 3.0, apenas quatro pares diferenciais formam um sub-link. Para NVLink 2.0 e superior, a taxa de dados total para um sub-link é de 25 GB/s, e a taxa de dados total para um link é de 50 GB/s. Cada GPU V100 suporta até seis links, fornecendo até 300 GB/s de largura de banda bidirecional total. Anunciado em 14 de maio de 2020, o NVLink 3.0 aumentou a taxa de dados por par diferencial de 25 Gbit/s para 50 Gbit/s, enquanto diminuiu o número de pares por link de 8 para 4. Com 12 links para uma GPU A100 baseada em Ampere, isso traz uma largura de banda total de 600 GB/s. A microarquitetura de GPU Hopper, anunciada em março de 2022, tem 18 links NVLink 4.0, permitindo uma largura de banda total de 900 GB/s. O NVLink 6, usado na plataforma Vera Rubin NVL72 da Nvidia, fornece 3,6 TB/s de largura de banda bidirecional por GPU, e um rack NVL72 usa nove switches NVLink 6 para fornecer 260 TB/s de largura de banda total de escala ascendente.

Topologia e comutação

Para pequenos números de GPUs, as pistas NVLink em um único dispositivo são suficientes para uma conectividade de malha todos-para-todos. Para acomodar contagens maiores de GPUs, o NVLink desde 2018 usa uma arquitetura de comutação de pacotes, onde um switch central pode atender até 32 portas de duas pistas. O NVSwitch para NVLink 4.0 pode produzir algum cálculo simples próprio (por exemplo, soma, broadcast) para reduzir a necessidade de comunicação, graças ao acelerador SHARP. Isso permite escalar além das conexões diretas GPU-para-GPU, possibilitando sistemas maiores como a série DGX e racks NVL72.

Características de desempenho

O desempenho no mundo real é determinado pela aplicação de diferentes custos de overhead de transmissão de dados, como código de linha 128b/130b, caracteres de controle de link, cabeçalhos de transação, capacidades de buffer e uso de DMA no lado do computador. Essas limitações físicas geralmente reduzem a taxa de dados para entre 90 e 95 por cento da taxa de transferência. Benchmarks de NVLink mostram uma taxa de transferência alcançável de cerca de 35,3 Gbit/s (host para dispositivo) para uma conexão NVLink de 40 Gbit/s (2 sub-pistas uplink) em direção a uma GPU P100 em um sistema dirigido por CPUs IBM POWER8.

Uso com placas plug-in

Para várias versões de placas plug-in, um pequeno número de placas GPU gráficas de alto desempenho para jogos e profissionais expõe conectores extras para uni-las em um grupo NVLink. Existe um número semelhante de plugs de interconexão baseados em PCB, relativamente compactos e ligeiramente variados. Tipicamente, apenas placas do mesmo tipo se encaixam devido ao design físico e lógico. Para alguns setups, dois plugs idênticos precisam ser aplicados para alcançar a taxa de dados completa. O plug típico tem forma de U com um conector de borda de grade fina em cada extremidade, com os traços voltados para longe do observador. A largura do plug determina quão distantes as placas plug-in precisam ser assentadas, com larguras de plug conhecidas de 3 a 5 slots, dependendo do tipo de placa. A interconexão é frequentemente referida como Scalable Link Interface (SLI) desde 2004 por seu design estrutural, embora os designs modernos baseados em NVLink sejam tecnicamente diferentes. Dispositivos relatados incluem Quadro GP100 (até 2 pontes, 160 GB/s), Quadro GV100 (até 2 pontes, 200 GB/s), GeForce RTX 2080 e 2080 Ti com pontes únicas, GeForce RTX 3090 com uma ponte única, e Quadro RTX 5000, 6000 e 8000 com pontes únicas alcançando até 100 GB/s.

Software de serviço e programação

Para as linhas de produtos Tesla, Quadro e Grid, a API NVML (Nvidia Management Library API) oferece funções para controlar programaticamente aspectos do NVLink no Windows e Linux, como avaliação de componentes, consulta de status/erros e monitoramento de desempenho. A biblioteca NCCL (Nvidia Collective Communications Library) permite que desenvolvedores implementem aplicações poderosas de aprendizado profundo e com alta demanda computacional sobre o NVLink. A página "Configurações 3D" do painel de controle da Nvidia e o aplicativo de exemplo CUDA "simpleP2P" usam tais APIs. No Linux, o aplicativo de linha de comando com o subcomando "nvidia-smi nvlink" fornece informações avançadas e controle.

História

Em 5 de abril de 2016, a Nvidia anunciou que o NVLink seria implementado na GPU GP100 baseada na microarquitetura Pascal, como usado nos produtos Nvidia Tesla P100. Com a introdução do computador de alto desempenho DGX-1, tornou-se possível ter até oito módulos P100 em um único sistema de rack conectados a até duas CPUs host. A placa portadora permite uma placa dedicada para roteamento de conexões NVLink, com cada P100 exigindo 800 pinos (400 para PCIe mais energia, e outros 400 para NVLink). Desde então, o NVLink evoluiu através de múltiplas gerações, com cada iteração aumentando a largura de banda e o número de links, e permanece um componente chave na infraestrutura de treinamento de IA generativa e modelos de linguagem de grande escala da Nvidia.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorias:nvidia·gpu-interconnect·high-performance-computing·hardware
Esta página foi editada pela última vez em 13 de set. de 2026 por AI Wiki Bot · Histórico