Tensor Core는 NVIDIA 그래픽 카드와 데이터 센터 GPU에 통합된 특수 처리 장치로, 행렬 곱셈-누적 연산을 고속으로 수행하도록 설계되었다. 이러한 연산은 신경망, 특히 딥러닝 및 인공지능 애플리케이션의 수학적 기반을 형성한다. 일반적인 병렬 컴퓨팅을 처리하는 표준 CUDA 코어와 달리, Tensor Core는 모델 훈련과 추론의 기반이 되는 밀집 선형 대수에 최적화되어 있다.
최초의 Tensor Core는 2017년 12월 Tesla V100 데이터 센터 GPU와 함께 출시된 Volta 아키텍처에 등장했다. 이는 GPU 설계의 전환점으로, 기존 그래픽 처리와 함께 AI 워크로드 전용 하드웨어를 추가한 것이다. 2018년, NVIDIA는 Turing 아키텍처로 마케팅된 GeForce RTX 20 시리즈를 통해 Tensor Core를 소비자 제품으로 확장했다. 이러한 소비자 GPU는 실시간 레이 트레이싱 노이즈 제거와 AI를 활용해 저해상도 프레임을 업스케일링하는 딥 러닝 슈퍼 샘플링(DLSS) 기술에 Tensor Core를 사용했다.
아키텍처 및 작동 방식
Tensor Core는 일반적으로 4x4 이상의 작은 행렬에 대해 단일 클록 사이클에서 융합 곱셈-누적 연산을 수행한다. 예를 들어, Volta 설계는 4x4x4 행렬 연산을 처리하며, 이후 Ampere 및 Hopper와 같은 아키텍처는 더 큰 형식으로 확장하고 희소 행렬 계산 지원을 추가했다. 이러한 효율성은 하드웨어가 여러 스칼라 명령을 발행하는 대신 전체 연산을 한 단계로 처리하므로 행렬 수학에 필요한 명령 수를 줄이는 데서 비롯된다.
Tensor Core는 FP16, BF16, INT8, FP8을 포함한 다양한 숫자 정밀도를 지원하여 개발자가 정확성과 속도를 절충할 수 있게 한다. 모델이 순전파 및 역전파에 FP16을 사용하고 가중치 업데이트에 FP32를 사용하는 혼합 정밀도 훈련은 Tensor Core가 상당한 속도 향상을 입증한 후 표준 관행이 되었다. 하드웨어에는 행렬 전치 및 결과 누적과 같은 연산을 위한 전용 장치도 포함되어 병목 현상을 추가로 줄인다.
딥러닝에서의 역할
Tensor Core는 대규모 언어 모델 및 트랜스포머 아키텍처를 포함한 대규모 신경망의 훈련과 배포에 중요하다. GPT-3 또는 현대 생성 AI 시스템과 같은 모델을 훈련하려면 수십억 회의 행렬 곱셈이 필요하며, Tensor Core는 이를 기존 GPU 코어에 비해 한 자릿수 이상 가속화한다. 이는 AI 하드웨어 시장에서 NVIDIA의 핵심 차별화 요소가 되었으며, AWS Trainium, Google Cloud TPU, AMD의 Instinct 가속기와 같은 대안과 경쟁하고 있다.
훈련된 모델을 실행하는 과정인 추론도 Tensor Core의 혜택을 받는다. Amazon Web Services, Microsoft Azure, Oracle Cloud를 포함한 많은 클라우드 제공업체는 AI 워크로드를 위해 Tensor Core가 장착된 GPU 인스턴스를 제공한다. 행렬 연산 처리의 하드웨어 효율성은 소프트웨어 프레임워크에도 영향을 미쳤으며, cuBLAS 및 cuDNN과 같은 라이브러리는 Tensor Core를 자동으로 활용하도록 최적화되어 저수준 프로그래밍 없이도 개발자가 접근할 수 있게 한다.
AI 외의 응용 분야
Tensor Core는 신경망에 국한되지 않는다. 물리학, 화학, 금융의 시뮬레이션과 같은 밀집 선형 대수를 포함하는 과학 컴퓨팅 작업을 가속화한다. TOP500 목록의 여러 시스템을 포함한 고성능 컴퓨팅 시스템은 기후 모델링부터 분자 역학까지 다양한 워크로드에 Tensor Core가 장착된 NVIDIA GPU를 사용한다. 또한 Tensor Core는 비디오 게임의 DLSS 및 창의적 응용 프로그램의 AI 기반 비디오 향상과 같은 소비자 소프트웨어의 실시간 AI 기능을 가능하게 한다.
2025년 6월 5일에 출시된 Nintendo Switch 2는 Tensor Core를 통합한 최초의 비디오 게임 콘솔이 되었으며, 그래픽 품질 향상을 위해 DLSS에 이를 사용했다. 이러한 채택은 기술이 기존 PC 및 데이터 센터 시장을 넘어 확장되고 있음을 강조한다.
세대별 진화
NVIDIA는 여러 아키텍처에 걸쳐 Tensor Core 설계를 반복해 왔다. Turing은 추론을 위한 INT8 및 INT4 지원을 갖춘 소비자용 Tensor Core를 도입했다. 2020년에 출시된 Ampere는 BF16 지원과 개선된 희소 계산을 갖춘 3세대 Tensor Core를 추가했다. 2022년에 출시된 Hopper는 트랜스포머 모델에 대한 정밀도를 자동으로 선택하는 Transformer Engine을 도입했다. 2024년에 발표된 Blackwell은 FP4 지원과 대규모 언어 모델에 대한 향상된 성능으로 이러한 기능을 더욱 정교화했다.
각 세대는 소프트웨어 생태계도 확장했다. NVIDIA의 CUDA 플랫폼은 TensorRT와 같은 라이브러리 및 PyTorch와 TensorFlow와 같은 프레임워크와 함께 새로운 Tensor Core 기능을 활용하도록 진화했다. 하드웨어와 소프트웨어 간의 이러한 긴밀한 통합은 Intel, Qualcomm, Samsung Electronics가 다양한 AI 하드웨어 부문에서 경쟁함에도 불구하고 AI 가속화에서 NVIDIA의 지배력을 유지하는 데 도움이 되었다.
영향 및 미래
Tensor Core는 딥러닝, 생성 AI, 대규모 언어 모델의 돌파구를 가능하게 하는 AI 산업의 기반 기술이 되었다. 또한 다른 AI 가속기의 설계에 영향을 미쳐 업계를 특수 행렬 수학 하드웨어로 이끌었다. AI 모델이 더 커지고 복잡해짐에 따라 Tensor Core는 새로운 정밀도, 더 큰 행렬 크기, 메모리 시스템과의 더 긴밀한 통합으로 진화할 것으로 예상된다. NVIDIA의 로드맵은 이 기술에 대한 지속적인 투자를 시사하며, 향후 아키텍처는 그래픽과 AI 처리 간의 경계를 더욱 흐릴 가능성이 높다.