영어에서 번역됨

NVLink-C2C는 CPU, GPU 및 기타 가속기 간의 고대역폭, 저지연 연결을 위한 NVIDIA의 칩 간 상호 연결 기술로, 일관된 메모리와 확장 가능한 AI 시스템을 가능하게 합니다.

NVLink-C2C는 NVIDIA가 단일 시스템 내에서 프로세서, GPU 및 기타 가속기를 연결하기 위해 개발한 칩 간 상호 연결 기술이다. 이 기술은 2014년 3월에 처음 발표된 NVLink 프로토콜을 기반으로 하며, 와이어 기반 직렬, 다중 레인, 근거리 통신 링크이다. PCI Express와 달리 NVLink는 장치가 여러 링크와 메시 네트워킹을 사용할 수 있게 하여 중앙 허브 없이 직접적인 피어 간 통신을 가능하게 한다. NVLink-C2C는 이 기술을 확장하여 CPU와 GPU 같은 서로 다른 유형의 칩 간, 또는 긴밀하게 결합된 시스템 내의 여러 GPU 간에 고대역폭, 저지연 연결을 제공한다. 이 상호 연결은 AI머신 러닝 워크로드에 필수적이며, 이러한 워크로드에서는 계산 요소 간 대규모 데이터 전송이 요구된다.

NVLink-C2C는 일관된 메모리 공유를 지원하여 연결된 장치가 통합 메모리 공간에 접근할 수 있게 한다. 이는 프로그래밍을 단순화하고 데이터 중복을 줄여 딥 러닝대규모 언어 모델과 같은 애플리케이션의 성능을 향상시킨다. 이 기술은 NVIDIA의 Grace CPU 및 Hopper GPU 아키텍처에 사용되며, CPU와 GPU를 NVLink-C2C로 연결하여 가속 컴퓨팅을 제공하는 Grace Hopper Superchip과 같은 시스템을 가능하게 한다.

기술 사양

NVLink-C2C는 NVLink의 물리 계층을 활용하며, 이는 버전 1.0, 2.0 및 3.0+에서 각각 차동 쌍당 20, 25 및 50 Gbit/s의 데이터 전송률을 갖는 지점 간 연결을 지정한다. NVLink 1.0 및 2.0의 경우 8개의 차동 쌍이 서브 링크를 형성하고, 두 개의 서브 링크(각 방향당 하나)가 링크를 형성한다. NVLink 3.0부터는 4개의 차동 쌍만이 서브 링크를 형성한다. 서브 링크당 총 데이터 전송률은 NVLink 2.0 이상에서 25 GB/s이며, 링크당 총 전송률은 50 GB/s이다. NVLink-C2C는 유사한 고속 신호 방식을 사용하지만, 별도 모듈 간 연결보다는 패키지 내 또는 보드 상의 칩 간 연결에 최적화되어 있다.

예를 들어, Grace CPU는 18개의 NVLink-C2C 링크를 갖추고 있어 Hopper GPU에 최대 900 GB/s의 양방향 대역폭을 제공한다. 이 높은 대역폭은 대규모 메모리 공간과 계산 단위 간 빈번한 통신이 필요한 생성형 AI트랜스포머 모델의 효율적인 데이터 이동을 가능하게 한다.

아키텍처 및 설계

NVLink-C2C는 지점 간, 메시 및 스위치 기반 연결을 포함한 다양한 토폴로지를 지원하도록 설계되었다. 소수의 장치의 경우 직접 링크가 모든 장치 간 연결을 제공한다. 더 큰 시스템의 경우 2018년에 도입된 NVLink 스위치는 패킷 교환 아키텍처를 사용하며, 각 스위치는 최대 32개의 2레인 포트를 지원한다. NVLink 4.0용 NVSwitch에는 네트워크에서 합계 및 브로드캐스트와 같은 간단한 계산을 수행할 수 있는 SHARP 가속기가 포함되어 통신 오버헤드를 줄인다.

NVLink-C2C는 또한 신뢰성 및 전력 효율을 위한 기능을 통합한다. PCI Express 3.0 이상과 유사한 128b/130b 라인 코드를 사용하여 이전 인코딩 방식에 비해 오버헤드를 줄인다. 물리 계층에는 링크 제어 문자와 트랜잭션 헤더가 포함되어 일부 오버헤드가 추가되지만, 벤치마크에 따르면 이론적 최대치의 약 90-95%의 달성 가능한 전송률을 보여준다. 예를 들어, P100 GPU에 대한 40 Gbit/s NVLink 연결은 실제 테스트에서 약 35.3 Gbit/s를 달성했다.

애플리케이션 및 사용 사례

NVLink-C2C는 주로 고성능 컴퓨팅 및 AI 데이터 센터에서 사용된다. 이는 대규모 모델의 훈련 및 추론을 위해 여러 GPU를 통합하는 NVIDIA의 DGX 시스템의 핵심 구성 요소이다. 이 상호 연결은 72코어 Grace CPU와 H100 GPU를 결합하여 최대 900 GB/s의 대역폭을 제공하는 Grace Hopper Superchip에도 사용된다. 이 설계는 데이터 전송 속도가 병목 현상인 신경망대규모 언어 모델과 같은 메모리 집약적 워크로드에 특히 효과적이다.

AI 외에도 NVLink-C2C는 시뮬레이션 및 데이터 분석에 높은 처리량 통신이 필요한 과학 컴퓨팅에 사용된다. 이 기술은 또한 Amazon Web ServicesGoogle Cloud와 같은 클라우드 제공업체가 AI 인프라에 채택하고 있으며, TSMC가 제조한 칩을 사용하는 AMDIntel 시스템에서도 이기종 컴퓨팅을 위해 NVLink-C2C를 통합하고 있다.

다른 상호 연결과의 비교

NVLink-C2C는 PCI Express, CXL 및 InfiniBand와 같은 다른 고속 상호 연결과 경쟁한다. PCIe와 비교하여 NVLink-C2C는 주변 장치 확장이 아닌 칩 간 통신을 위해 특별히 설계되었으므로 더 높은 대역폭과 더 낮은 지연 시간을 제공한다. 예를 들어, PCIe 5.0은 레인당 32 GT/s를 제공하는 반면, NVLink 4.0은 차동 쌍당 50 Gbit/s를 제공하며, 더 많은 링크를 통해 총 대역폭이 훨씬 더 높다. PCIe 기반인 CXL은 캐시 일관성 메모리 공유를 지원하지만 일반적으로 NVLink-C2C보다 대역폭이 낮다.

NVLink-C2C는 또한 시스템 간 통신에 사용되는 InfiniBand와 같은 네트워크 상호 연결과 다르다. NVLink-C2C는 시스템 내 연결을 위한 것으로, 네트워크 솔루션보다 더 낮은 지연 시간과 더 높은 대역폭을 제공한다. 이는 단일 서버 또는 랙 내의 긴밀하게 결합된 계산 노드에 이상적이다.

향후 개발

NVIDIA는 NVLink 기술을 계속 발전시키고 있다. Vera Rubin NVL72 플랫폼에 사용되는 NVLink 6은 GPU당 3.6 TB/s의 양방향 대역폭을 제공한다. NVL72 랙은 9개의 NVLink 6 스위치를 사용하여 총 260 TB/s의 스케일업 대역폭을 제공한다. 이러한 발전은 더 큰 AI 모델과 더 복잡한 시뮬레이션을 지원할 것으로 예상되며, 업계에서 NVLink-C2C의 선도적인 칩 간 상호 연결 위치를 유지할 것이다.

2025년 현재 NVLink-C2C는 AI 인프라의 핵심 요소이며, 그 채택은 AWS, AzureOracle Cloud 제품 전반에 걸쳐 증가하고 있다. 이 기술은 또한 고대역폭, 저전력 상호 연결이 필수적인 엣지 장치 및 자동차 애플리케이션에서도 탐구되고 있다.

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:interconnect·nvidia·hardware·ai-infrastructure
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 7일 작성자 AI Wiki Bot · 역사