NVLink-C2C é um interconector chip-a-chip desenvolvido pela NVIDIA para conectar processadores, GPUs e outros aceleradores dentro de um único sistema. Ele é baseado no protocolo NVLink, que foi anunciado pela primeira vez em março de 2014 como um link de comunicação serial, multi-lane e de curto alcance baseado em fio. Diferentemente do PCI Express, o NVLink permite que os dispositivos usem múltiples links e redes mesh, possibilitando comunicação peer-to-peer direta sem um hub central. NVLink-C2C estende esta tecnologia para fornecer conexões de alta largura de banda e baixa latência entre diferentes tipos de chips, como uma CPU e uma GPU, ou entre múltiples GPUs em um sistema estrechamente acoplado. Este interconector é crítico para cargas de trabalho modernas de IA e aprendizado automático, onde a transferência massiva de dados entre elementos de computação é necessária.
NVLink-C2C suporta compartilhamento de memória coerente, permitendo que dispositivos conectados acessem um espaço de memória unificado. Isso simplifica a programação e reduz a duplicação de dados, melhorando o desempeño para aplicações como aprendizado profundo e modelos de linguagem grandes. A tecnologia é usada nas arquiteturas Grace CPU e Hopper GPU da NVIDIA, habilitando sistemas como o Grace Hopper Superchip, que combina uma CPU e uma GPU sobre NVLink-C2C para computação acelerada.
Especificações Técnicas
NVLink-C2C aproveita a capa física do NVLink, que especifica conexiones ponto-a-punto com taxas de datos de 20, 25 e 50 Gbit/s por par diferencial para las versiones 1.0, 2.0 e 3.0+, respectivamente. Para NVLink 1.0 e 2.0, oito pares diferenciais forman un sub-link, e dous sub-links (un para cada dirección) forman un link. A partir de NVLink 3.0, só catro pares diferenciais forman un sub-link. A taxa total de datos por sub-link é de 25 GB/s para NVLink 2.0 e superiores, e o total por link é de 50 GB/s. NVLink-C2C usa sinalización de alta velocidade similar, pero está optimizado para conexións chip-a-chip dentro dun paquete ou nunha placa, en lugar de entre módulos separados.
Por exemplo, a Grace CPU ten 18 links NVLink-C2C, proporcionando ata 900 GB/s de ancho de banda bidireccional a unha GPU Hopper. Este alto ancho de banda permite un movemento eficiente de datos para IA xenerativa e modelos transformadores, que requiren grandes pegadas de memoria e comunicación frecuente entre unidades de computación.
Arquitectura e Deseño
NVLink-C2C está deseñado para soportar unha variedade de topoloxías, incluíndo punto-a-punto, mesh e conexións baseadas en switches. Para pequenos números de dispositivos, os links directos proporcionan conectividade all-to-all. Para sistemas máis grandes, os switches NVLink (introducidos en 2018) usan arquitectura de conmutación de paquetes, con cada switch soportando ata 32 portas de dous lanes. O NVSwitch para NVLink 4.0 inclúe o acelerador SHARP, que pode realizar cálculos simples como suma e broadcast na rede, reducindo a sobrecarga de comunicación.
NVLink-C2C tamén incorpora características para fiabilidade e eficiencia enerxética. Usa un código de liña 128b/130b, similar ao PCI Express 3.0 e superiores, que reduce a sobrecarga en comparación con esquemas de codificación máis antigos. A capa física inclúe caracteres de control de link e cabeceiras de transacción, que engaden algo de sobrecarga, pero os benchmarks mostran taxas de transferencia alcanzables de aproximadamente 90-95% do máximo teórico. Por exemplo, unha conexión NVLink de 40 Gbit/s a unha GPU P100 alcanzou aproximadamente 35,3 Gbit/s en probas do mundo real.
Aplicacións e Casos de Uso
NVLink-C2C úsase principalmente en computación de alto rendemento e centros de datos de IA. É un componente clave dos sistemas DGX de NVIDIA, que integran múltiples GPUs para adestramento e inferencia de modelos grandes. O interconector tamén se usa no Grace Hopper Superchip, que combina unha CPU Grace de 72 núcleos cunha GPU H100, entregando ata 900 GB/s de ancho de banda entre eles. Este deseño é particularmente efectivo para cargas de traballo limitadas por memoria, como redes neurais e modelos de linguaxe grandes, onde a velocidade de transferencia de datos é un pescozo de botella.
Ademais da IA, NVLink-C2C úsase en computación científica, onde simulacións e análise de datos requiren comunicación de alto rendemento. A tecnoloxía tamén está sendo adoptada por provedores de nube como Amazon Web Services e Google Cloud para a súa infraestrutura de IA, así como por chips fabricados por TSMC en sistemas de AMD e Intel que incorporan NVLink-C2C para computación heteroxénea.
Comparación con Outros Interconectores
NVLink-C2C compite con outros interconectores de alta velocidade como PCI Express, CXL e InfiniBand. En comparación con PCIe, NVLink-C2C ofrece maior ancho de banda e menor latencia, xa que está deseñado especificamente para comunicación chip-a-chip en lugar de expansión periférica. Por exemplo, PCIe 5.0 proporciona 32 GT/s por lane, mentres que NVLink 4.0 ofrece 50 Gbit/s por par diferencial, e con máis links, o ancho de banda total é significativamente maior. CXL, que está baseado en PCIe, soporta compartimento de memoria cache-coherente pero normalmente ten menor ancho de banda que NVLink-C2C.
NVLink-C2C tamén difire dos interconectores de rede como InfiniBand, que se usan para comunicación sistema-a-sistema. NVLink-C2C é para conexións intra-sistema, proporcionando menor latencia e maior ancho de banda que as solucións de rede. Isto faino ideal para nodos de computación estrechamente acoplados nun único servidor ou rack.
Desenvolvementos Futuros
NVIDIA continúa evolucionando a tecnoloxía NVLink. NVLink 6, usado na plataforma Vera Rubin NVL72, proporciona 3,6 TB/s de ancho de banda bidireccional por GPU. Un rack NVL72 usa nove switches NVLink 6 para entregar 260 TB/s de ancho de banda total de scale-up. Estes avances espérase que soporten modelos de IA aínda máis grandes e simulacións máis complexas, mantendo a posición de NVLink-C2C como un interconector chip-a-chip líder na industria.
A partir de 2025, NVLink-C2C é un habilitador crítico para infraestrutura de IA, e a súa adopción está crecendo nas ofertas de AWS, Azure e Oracle Cloud. A tecnoloxía tamén está sendo explorada para uso en dispositivos edge e aplicacións automotrices, onde interconectores de alta ancho de banda e baixo consumo son esenciais.