AMD Instinct est une marque d'unités de traitement graphique (GPU) pour centres de données développée par AMD. Introduite en 2016 en remplacement de la gamme FirePro S, la famille de produits Instinct est conçue pour accélérer les charges de travail de apprentissage profond, d'intelligence artificielle et les applications de calcul haute performance (HPC). Contrairement à la marque Radeon d'AMD, qui cible les marchés grand public et du jeu vidéo, les cartes Instinct sont optimisées pour des tâches intensives en calcul, telles que l'entraînement de réseaux neuronaux et l'exécution de simulations scientifiques à grande échelle. La marque concurrence directement les offres de GPU pour centres de données de Nvidia et les gammes Xeon Phi et Data Center GPU d'Intel.
La gamme de produits était initialement commercialisée sous le nom d'AMD Radeon Instinct, mais AMD a abandonné la marque Radeon avant le lancement du MI100 en novembre 2020. Depuis lors, la série Instinct a évolué à travers plusieurs architectures, intégrant des technologies avancées de packaging et de mémoire pour répondre aux demandes croissantes de l'IA générative et de l'apprentissage automatique. En 2023, les supercalculateurs basés sur AMD utilisant des GPU Instinct ont atteint des positions de premier plan dans les classements mondiaux de performance et d'efficacité.
Premiers produits (2016-2017)
AMD a annoncé les trois premiers produits Radeon Instinct le 12 décembre 2016 et les a lancés le 20 juin 2017. Chaque carte était basée sur une architecture GPU différente, ciblant des segments distincts du marché du calcul.
MI6
Le MI6 utilisait une puce Polaris 10 avec 16 Go de mémoire GDDR5 et une puissance de conception thermique (TDP) inférieure à 150 W. Il offrait 5,7 TFLOPS de performance FP16 et FP32, ce qui le rendait principalement adapté aux tâches d'inférence plutôt qu'à l'entraînement. Sa performance maximale en double précision (FP64) était de 358 GFLOPS. La carte était refroidie passivement, reflétant sa conception à faible consommation.
MI8
Le MI8 était basé sur l'architecture Fiji, similaire à la Radeon R9 Nano, avec un TDP inférieur à 175 W. Il disposait de 4 Go de mémoire à haute bande passante (HBM) et atteignait 8,2 TFLOPS en FP16 et FP32. Comme le MI6, il était orienté vers les charges de travail d'inférence, avec une performance FP64 maximale de 512 GFLOPS.
MI25
Le MI25 utilisait une architecture Vega avec mémoire HBM2. Il offrait 12,3 TFLOPS en FP32 et pouvait atteindre 24,6 TFLOPS en FP16 en exploitant l'arithmétique à précision réduite. La carte avait un TDP inférieur à 300 W avec refroidissement passif et offrait 768 GFLOPS de performance FP64 maximale, soit un seizième du taux FP32. Le MI25 était positionné pour l'entraînement et l'inférence, bénéficiant des capacités de calcul améliorées de l'architecture Vega.
MI50 et MI60 (Vega 20)
Les MI50 et MI60, basés sur la variante Vega 20 de l'architecture Graphics Core Next (GCN) 5, ont été introduits comme les dernières cartes Instinct à porter la marque Radeon. Ils prenaient en charge une performance FP64 à demi-taux, une amélioration significative par rapport aux modèles précédents, et conservaient la capacité de produire une sortie d'affichage. Ces cartes ont été utilisées dans les premiers déploiements exascale et HPC, comblant le fossé entre les rôles de station de travail et de centre de données.
Série MI100 (CDNA 1)
La série MI100, lancée en novembre 2020, a marqué la transition vers l'architecture CDNA (Compute DNA) d'AMD, spécifiquement conçue pour les charges de travail de calcul. Les cartes CDNA 1 ont supprimé tout le matériel lié au rendu, tel que les unités de rastérisation, et ont ajouté des unités de traitement matriciel pour accélérer les modèles transformeurs et d'autres opérations d'apprentissage profond. Cette architecture a jeté les bases des accélérateurs ultérieurs d'AMD axés sur l'IA.
Série MI300 (CDNA 3)
Les MI300A et MI300X, introduits fin 2023, sont des accélérateurs pour centres de données construits sur l'architecture CDNA 3, optimisés pour les charges de travail HPC et d'IA générative. L'architecture utilise une conception évolutive de chiplets, exploitant les technologies avancées de packaging de TSMC, notamment CoWoS (chip-on-wafer-on-substrate) et InFO (integrated fan-out), pour combiner plusieurs chiplets sur un seul interposeur. L'interconnexion Infinity Fabric d'AMD permet un transfert de données à haute vitesse et à faible latence entre les chiplets et le système hôte.
MI300A
Le MI300A est une unité de traitement accéléré (APU) qui intègre 24 cœurs CPU Zen 4 avec quatre cœurs GPU CDNA 3, totalisant 228 unités de calcul (CU) dans la section GPU et 128 Go de mémoire HBM3. Les cœurs Zen 4, fabriqués sur un processus de 5 nm, prennent en charge le jeu d'instructions x86-64, AVX-512 et les extensions BFloat16, leur permettant d'exécuter des applications généralistes et de fournir un calcul côté hôte. Le MI300A atteint une performance maximale de 61,3 TFLOPS FP64 (122,6 TFLOPS avec opérations matricielles FP64) et 980,6 TFLOPS FP16 (1961,2 TFLOPS avec sparsité), avec 5,3 To/s de bande passante mémoire. Il prend en charge les interfaces PCIe 5.0 et CXL 2.0 pour l'intégration de systèmes hétérogènes.
MI300X
Le MI300X est un accélérateur dédié à l'IA générative qui remplace les cœurs CPU par des ressources GPU supplémentaires, résultant en 304 CU et 192 Go de mémoire HBM3. Il est conçu pour des applications telles que le traitement du langage naturel, la vision par ordinateur et l'apprentissage profond. Le MI300X offre 653,7 TFLOPS de performance TF32 (1307,4 TFLOPS avec sparsité) et 1307,4 TFLOPS de FP16 (2614,9 TFLOPS avec sparsité), avec la même bande passante mémoire de 5,3 To/s. Il prend en charge PCIe 5.0 et CXL 2.0, ainsi que la pile logicielle ROCm d'AMD, qui fournit un modèle de programmation unifié pour développer et déployer des applications d'IA générative.
Série MI350 (CDNA 4)
Les MI350X et MI355X, annoncés en 2025, sont construits sur l'architecture CDNA 4, ciblant l'entraînement et l'inférence avancés en IA. Fabriqués sur le processus 3 nm (N3) de TSMC, ils présentent une conception de chiplets haute performance avec 288 Go de mémoire HBM3E et 8 To/s de bande passante. CDNA 4 introduit une prise en charge native des formats à faible précision FP4 et FP6, en plus de FP8 et FP16, augmentant le calcul FP4 jusqu'à 9,2 PétaFLOPS sur le MI355X. L'architecture maintient l'interconnexion Infinity Fabric pour un transit de données efficace. En 2026, AMD a publié le MI350P comme carte PCIe avec environ la moitié de la capacité de calcul et des exigences de puissance du MI350X, offrant une option plus accessible pour certains déploiements.
Pile logicielle
ROCm
L'écosystème logiciel d'AMD pour les produits Instinct est organisé sous le méta-projet Radeon Open Compute (ROCm), qui fournit une collection de pilotes, de bibliothèques et d'outils pour le calcul GPU. ROCm est conçu pour concurrencer la plateforme CUDA de Nvidia, offrant une alternative open source pour les développeurs.
MxGPU
Les MI6, MI8 et MI25 prennent en charge la technologie de virtualisation MxGPU d'AMD, qui permet le partage des ressources GPU entre plusieurs utilisateurs ou machines virtuelles. Cette fonctionnalité est précieuse dans les environnements cloud et d'entreprise où l'utilisation efficace des ressources est critique.
MIOpen
MIOpen est la bibliothèque d'apprentissage profond d'AMD qui permet l'accélération GPU de l'entraînement et de l'inférence de réseaux neuronaux. Elle étend le logiciel de l'initiative GPUOpen Boltzmann et prend en charge des frameworks populaires, notamment Theano, Caffe, TensorFlow, MXNet, Microsoft Cognitive Toolkit, Torch et Chainer. La programmation est prise en charge en OpenCL et Python, et l'interface de portabilité hétérogène (HIP) d'AMD et le compilateur hétérogène permettent de compiler le code CUDA pour qu'il s'exécute sur le matériel AMD, facilitant la migration pour les développeurs.
Performance et position sur le marché
En juin 2022, les supercalculateurs basés sur les CPU Epyc et les GPU Instinct d'AMD ont pris la tête de la liste Green500 des supercalculateurs les plus économes en énergie, occupant les quatre premières places avec une avance de plus de 50 % sur tout autre système. L'un d'eux, le supercalculateur Frontier, est le plus rapide au monde sur la liste TOP500 depuis juin 2022 et l'est resté en 2023. Cette réalisation a souligné l'efficacité et la capacité de calcul des accélérateurs Instinct dans les environnements HPC à grande échelle.
La gamme Instinct continue d'évoluer en réponse à la croissance rapide des grands modèles de langage et de l'IA générative, chaque génération augmentant la capacité mémoire, la bande passante et la prise en charge des formats à faible précision pour répondre aux demandes de l'entraînement et de l'inférence à grande échelle.
Voir aussi
- AMD - La société mère
- Intel - Un concurrent dans les GPU pour centres de données
- TSMC - Fabricant de puces avancées
- Intelligence artificielle - Domaine d'application principal