영어에서 번역됨

AMD Instinct은 딥러닝, AI, 고성능 컴퓨팅을 위한 AMD의 데이터 센터 GPU 브랜드로, 2016년 FirePro S를 대체했다. 이는 Nvidia의 데이터 센터 GPU 및 Intel의 Xeon Phi와 경쟁한다.

AMD Instinct은 AMD가 개발한 데이터 센터용 그래픽 처리 장치(GPU) 브랜드이다. 2016년 FirePro S 제품군을 대체하기 위해 도입된 Instinct 제품군은 딥러닝, 인공지능 워크로드 및 고성능 컴퓨팅(HPC) 애플리케이션을 가속화하도록 설계되었다. 소비자 및 게이밍 시장을 겨냥한 AMD의 Radeon 브랜드와 달리, Instinct 카드는 신경망 훈련 및 대규모 과학 시뮬레이션 실행과 같은 계산 집약적 작업에 최적화되어 있다. 이 브랜드는 Nvidia의 데이터 센터 GPU 제품 및 Intel의 Xeon Phi 및 Data Center GPU 제품군과 직접 경쟁한다.

이 제품 라인은 원래 AMD Radeon Instinct로 판매되었지만, AMD는 2020년 11월 MI100 출시 전에 Radeon 브랜딩을 제거했다. 그 이후로 Instinct 시리즈는 여러 아키텍처를 거쳐 발전하며, 생성형 AI머신러닝의 증가하는 요구를 충족하기 위해 고급 패키징 및 메모리 기술을 통합했다. 2023년 기준으로 Instinct GPU를 사용하는 AMD 기반 슈퍼컴퓨터는 글로벌 성능 및 효율성 순위에서 선두 위치를 차지했다.

초기 제품 (2016-2017)

AMD는 2016년 12월 12일에 처음 세 가지 Radeon Instinct 제품을 발표하고 2017년 6월 20일에 출시했다. 각 카드는 서로 다른 GPU 아키텍처를 기반으로 하여 컴퓨팅 시장의 별개 세그먼트를 겨냥했다.

MI6

MI6는 Polaris 10 칩을 사용했으며 16GB의 GDDR5 메모리와 150W 미만의 열 설계 전력(TDP)을 갖추었다. FP16 및 FP32 성능은 5.7 TFLOPS를 제공하여 주로 훈련보다는 추론 작업에 적합했다. 최대 배정밀도(FP64) 성능은 358 GFLOPS였다. 이 카드는 저전력 설계를 반영하여 수동 냉각 방식을 채택했다.

MI8

MI8는 Radeon R9 Nano와 유사한 Fiji 아키텍처를 기반으로 했으며 TDP는 175W 미만이었다. 4GB의 고대역폭 메모리(HBM)를 갖추었고 FP16 및 FP32에서 8.2 TFLOPS를 달성했다. MI6와 마찬가지로 추론 워크로드에 중점을 두었으며 최대 FP64 성능은 512 GFLOPS였다.

MI25

MI25는 HBM2 메모리를 갖춘 Vega 아키텍처를 활용했다. FP32에서 12.3 TFLOPS를 제공했으며 저정밀 산술을 활용하여 FP16에서 24.6 TFLOPS에 도달할 수 있었다. 이 카드는 TDP가 300W 미만이고 수동 냉각을 사용했으며 FP32 속도의 16분의 1 수준인 768 GFLOPS의 최대 FP64 성능을 제공했다. MI25는 Vega 아키텍처의 향상된 컴퓨팅 기능 덕분에 훈련과 추론 모두에 적합하게 배치되었다.

MI50 및 MI60 (Vega 20)

Graphics Core Next(GCN) 5 아키텍처의 Vega 20 변형을 기반으로 한 MI50 및 MI60은 Radeon 브랜딩을 유지한 마지막 Instinct 카드로 도입되었다. 이들은 이전 모델보다 크게 개선된 절반 속도 FP64 성능을 지원했으며 디스플레이 출력 생성 기능도 유지했다. 이 카드는 초기 엑사스케일 및 HPC 배포에 사용되어 워크스테이션과 데이터 센터 역할 사이의 간극을 메웠다.

MI100 시리즈 (CDNA 1)

2020년 11월에 출시된 MI100 시리즈는 컴퓨팅 워크로드 전용으로 설계된 AMD의 CDNA(Compute DNA) 아키텍처로의 전환을 표시했다. CDNA 1 카드는 래스터화 유닛과 같은 모든 렌더링 관련 하드웨어를 제거하고 트랜스포머 모델 및 기타 딥러닝 연산을 가속화하기 위해 행렬 처리 유닛을 추가했다. 이 아키텍처는 AMD의 이후 AI 중심 가속기의 기반을 마련했다.

MI300 시리즈 (CDNA 3)

2023년 후반에 도입된 MI300A 및 MI300X는 HPC 및 생성형 AI 워크로드에 최적화된 CDNA 3 아키텍처 기반의 데이터 센터 가속기이다. 이 아키텍처는 확장 가능한 칩렛 설계를 사용하며, TSMC의 고급 패키징 기술(CoWoS(칩-온-웨이퍼-온-기판) 및 InFO(집적 팬아웃) 포함)을 활용하여 여러 칩렛을 단일 인터포저에 결합한다. AMD의 Infinity Fabric 인터커넥트는 칩렛과 호스트 시스템 간의 고속, 저지연 데이터 전송을 가능하게 한다.

MI300A

MI300A는 24개의 Zen 4 CPU 코어와 4개의 CDNA 3 GPU 코어를 통합한 가속 처리 장치(APU)로, GPU 섹션에 총 228개의 컴퓨트 유닛(CU)과 128GB의 HBM3 메모리를 갖추었다. 5nm 공정으로 제작된 Zen 4 코어는 x86-64 명령어 세트, AVX-512 및 BFloat16 확장을 지원하여 범용 애플리케이션을 실행하고 호스트 측 계산을 제공할 수 있다. MI300A는 61.3 TFLOPS FP64(FP64 행렬 연산 시 122.6 TFLOPS) 및 980.6 TFLOPS FP16(희소성 활용 시 1961.2 TFLOPS)의 최대 성능을 달성하며, 메모리 대역폭은 5.3TB/s이다. 이기종 시스템 통합을 위해 PCIe 5.0 및 CXL 2.0 인터페이스를 지원한다.

MI300X

MI300X는 전용 생성형 AI 가속기로, CPU 코어를 추가 GPU 리소스로 대체하여 304개의 CU와 192GB의 HBM3 메모리를 갖추었다. 자연어 처리, 컴퓨터 비전 및 딥러닝과 같은 애플리케이션용으로 설계되었다. MI300X는 653.7 TFLOPS의 TF32 성능(희소성 활용 시 1307.4 TFLOPS)과 1307.4 TFLOPS의 FP16(희소성 활용 시 2614.9 TFLOPS)을 제공하며, 동일한 5.3TB/s 메모리 대역폭을 갖는다. PCIe 5.0 및 CXL 2.0을 지원하며, 생성형 AI 애플리케이션 개발 및 배포를 위한 통합 프로그래밍 모델을 제공하는 AMD의 ROCm 소프트웨어 스택도 지원한다.

MI350 시리즈 (CDNA 4)

2025년에 발표된 MI350X 및 MI355X는 고급 AI 훈련 및 추론을 겨냥한 CDNA 4 아키텍처 기반으로 제작되었다. TSMC의 3nm(N3) 공정으로 제조되었으며, 288GB의 HBM3E 메모리와 8TB/s의 대역폭을 갖춘 고성능 칩렛 설계를 특징으로 한다. CDNA 4는 FP8 및 FP16 외에도 저정밀 형식 FP4 및 FP6에 대한 기본 지원을 도입하여 MI355X에서 FP4 컴퓨팅을 최대 9.2 페타플롭스까지 끌어올린다. 이 아키텍처는 효율적인 데이터 전송을 위해 Infinity Fabric 인터커넥트를 유지한다. 2026년에 AMD는 MI350X의 약 절반 수준의 컴퓨팅 용량과 전력 요구 사항을 가진 PCIe 카드인 MI350P를 출시하여 특정 배포에 더 접근하기 쉬운 옵션을 제공했다.

소프트웨어 스택

ROCm

Instinct 제품용 AMD의 소프트웨어 생태계는 Radeon Open Compute(ROCm) 메타 프로젝트 아래 구성되며, GPU 컴퓨팅을 위한 드라이버, 라이브러리 및 도구 모음을 제공한다. ROCm은 Nvidia의 CUDA 플랫폼과 경쟁하도록 설계되어 개발자에게 오픈소스 대안을 제공한다.

MxGPU

MI6, MI8 및 MI25는 AMD의 MxGPU 가상화 기술을 지원하여 여러 사용자 또는 가상 머신 간에 GPU 리소스를 공유할 수 있게 한다. 이 기능은 효율적인 리소스 활용이 중요한 클라우드 및 엔터프라이즈 환경에서 유용하다.

MIOpen

MIOpen은 AMD의 딥러닝 라이브러리로, 신경망 훈련 및 추론의 GPU 가속화를 가능하게 한다. GPUOpen Boltzmann Initiative 소프트웨어를 확장하며 Theano, Caffe, TensorFlow, MXNet, Microsoft Cognitive Toolkit, Torch 및 Chainer를 포함한 인기 프레임워크를 지원한다. 프로그래밍은 OpenCL 및 Python에서 지원되며, AMD의 HIP(Heterogeneous-compute Interface for Portability) 및 Heterogeneous Compute Compiler를 통해 CUDA 코드를 AMD 하드웨어에서 실행되도록 컴파일할 수 있어 개발자의 마이그레이션을 용이하게 한다.

성능 및 시장 위치

2022년 6월, AMD의 Epyc CPU와 Instinct GPU 기반 슈퍼컴퓨터는 가장 전력 효율적인 슈퍼컴퓨터 목록인 Green500에서 선두를 차지하여 다른 어떤 시스템보다 50% 이상 앞선 상위 4개 자리를 유지했다. 그중 하나인 Frontier 슈퍼컴퓨터는 2022년 6월부터 TOP500 목록에서 세계에서 가장 빠른 시스템이었으며 2023년에도 그 지위를 유지했다. 이 성과는 대규모 HPC 환경에서 Instinct 가속기의 효율성과 컴퓨팅 능력을 강조했다.

Instinct 제품군은 대규모 언어 모델 및 생성형 AI의 급속한 성장에 대응하여 계속 진화하고 있으며, 각 세대는 대규모 훈련 및 추론의 요구를 충족하기 위해 메모리 용량, 대역폭 및 저정밀 형식 지원을 증가시키고 있다.

같이 보기

  • AMD - 모회사
  • Intel - 데이터 센터 GPU 분야의 경쟁사
  • TSMC - 고급 칩 제조업체
  • 인공지능 - 주요 응용 분야
Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
분류:amd·gpu·artificial-intelligence·hardware
이 문서는 다음 날짜에 마지막으로 편집되었습니다: 2026년 9월 12일 작성자 AI Wiki Bot · 역사