Une unité de traitement graphique (GPU) est un processeur spécialisé conçu à l'origine pour accélérer la création et le rendu d'images, de vidéos et d'effets visuels. Contrairement à une unité centrale de traitement (CPU), qui optimise les tâches séquentielles à faible latence, une GPU contient des centaines ou des milliers de cœurs plus petits qui fonctionnent en parallèle, ce qui la rend très efficace pour les tâches pouvant être décomposées en de nombreuses opérations simultanées. Cette architecture a rendu les GPU indispensables non seulement pour les graphiques, mais aussi pour le calcul généraliste, en particulier dans des domaines tels que l'intelligence artificielle, la simulation scientifique et l'analyse de données.
La GPU moderne a évolué à partir des premiers accélérateurs graphiques des années 1980 et 1990. En 1999, Nvidia a introduit la GeForce 256, qu'elle a commercialisée comme la première GPU au monde, intégrant la transformation, l'éclairage et la configuration des triangles dans une seule puce. AMD a suivi avec sa gamme Radeon, et Intel a ensuite intégré des GPU dans de nombreux processeurs. Au fil du temps, les GPU sont devenues programmables, permettant aux développeurs de les utiliser pour des tâches non graphiques via des API comme CUDA (introduite par Nvidia en 2006) et OpenCL. Cette programmabilité a ouvert la voie au calcul généraliste sur GPU (GPGPU), devenu une pierre angulaire de l'informatique moderne.
Architecture et fonctionnement
L'architecture d'une GPU repose sur un vaste ensemble de multiprocesseurs de streaming (SM) ou d'unités de calcul, chacun contenant de nombreuses unités logiques arithmétiques (ALU) qui exécutent des instructions en parallèle. Par exemple, une GPU grand public haut de gamme peut avoir plus de 10 000 cœurs, tandis que les GPU de centre de données comme la Nvidia A100 ou H100 possèdent des milliers de cœurs optimisés pour l'arithmétique en virgule flottante. Le sous-système mémoire est également spécialisé, avec une mémoire à haute bande passante (HBM) ou GDDR6X offrant un accès rapide aux données. Les GPU utilisent un modèle à instruction unique, données multiples (SIMD) ou à instruction unique, threads multiples (SIMT), où de nombreux threads exécutent la même instruction sur différents éléments de données.
Cette conception excelle dans les opérations de multiplication matricielle et de convolution, fondamentales pour le rendu graphique et les réseaux neuronaux. Par exemple, une GPU peut traiter des millions de pixels ou d'éléments matriciels simultanément, atteignant un débit qu'une CPU ne peut égaler. Cependant, les GPU sont moins efficaces pour les tâches nécessitant des branchements complexes ou des dépendances séquentielles, c'est pourquoi les CPU restent essentielles pour les tâches généralistes du système d'exploitation.
Rôle dans l'intelligence artificielle et l'apprentissage automatique
L'essor de l'apprentissage profond dans les années 2010 a transformé le rôle de la GPU. L'entraînement des réseaux neuronaux implique des opérations matricielles massives, que les GPU accélèrent de plusieurs ordres de grandeur par rapport aux CPU. En 2012, des chercheurs de l'Université de Toronto ont utilisé des GPU pour entraîner AlexNet, un réseau neuronal convolutif qui a remporté le concours ImageNet et déclenché le boom moderne de l'IA. Depuis lors, les GPU sont devenues le matériel standard pour l'entraînement et l'inférence en apprentissage automatique.
Les principaux fournisseurs de cloud, notamment Amazon Web Services, Azure et Google Cloud, proposent des instances GPU pour les charges de travail d'IA. Des entreprises comme Groq et SambaNova ont développé des accélérateurs d'IA spécialisés, mais les GPU restent les plus utilisées en raison de leur flexibilité et de leur écosystème logiciel mature. Des frameworks comme TensorFlow et PyTorch sont optimisés pour l'exécution sur GPU, et Nvidia's CUDA est devenu le modèle de programmation dominant pour le calcul sur GPU. La demande de GPU a bondi avec la croissance des grands modèles de langage et de l'IA générative, entraînant des pénuries d'approvisionnement et une augmentation des investissements dans la capacité de fabrication par TSMC et d'autres.
Applications au-delà des graphiques
Au-delà de l'IA, les GPU sont utilisées en calcul scientifique, où elles accélèrent les simulations en physique, chimie et biologie. Par exemple, les simulations de dynamique moléculaire et la modélisation climatique reposent sur des grappes de GPU. Dans les services financiers, les GPU accélèrent l'analyse des risques et le trading algorithmique. Elles sont également utilisées en cryptographie, dans l'exploration pétrolière et gazière, et en imagerie médicale. L'industrie automobile utilise des GPU pour les systèmes avancés d'aide à la conduite et la conduite autonome, comme on le voit avec Tesla Autopilot et la technologie de conduite autonome de Waymo. De plus, les GPU alimentent les consoles de jeux vidéo et les casques de réalité virtuelle, et elles sont de plus en plus utilisées pour l'encodage et le décodage vidéo.
Principaux fabricants et paysage du marché
Le marché des GPU est dominé par Nvidia, AMD et Intel. Nvidia détient la plus grande part, en particulier dans le segment des centres de données, avec ses séries A100 et H100 conçues pour l'IA. AMD concurrence avec sa gamme Instinct, tandis que Intel est entré sur le marché des GPU discrètes avec sa série Arc. Apple conçoit ses propres GPU pour les Mac et les iPhones, et Qualcomm et Arm Holdings fournissent de la propriété intellectuelle GPU pour les appareils mobiles. Samsung Electronics et d'autres fabricants produisent des GPU pour l'électronique grand public. La fabrication des GPU avancées repose sur les fonderies de TSMC et de Samsung, qui produisent des puces avec des procédés de pointe comme les nœuds de 5 nanomètres et 3 nanomètres.
Orientations futures
Alors que les modèles d'IA deviennent plus grands, la demande de GPU plus puissantes continue de croître. La feuille de route de Nvidia inclut des architectures de nouvelle génération comme Blackwell, et les concurrents développent des alternatives. Cependant, les GPU sont confrontées à des défis tels que la consommation d'énergie et la bande passante mémoire. Des technologies émergentes comme les chiplets, le packaging avancé et les interconnexions optiques pourraient résoudre ces problèmes. De plus, les accélérateurs d'IA spécialisés, comme les TPU de Google DeepMind (bien que ce ne soient pas des GPU), gagnent du terrain, mais les GPU restent les processeurs parallèles les plus polyvalents et les plus largement adoptés. L'avenir implique probablement un mélange de GPU, d'accélérateurs personnalisés et d'informatique quantique, les GPU continuant à jouer un rôle central dans l'informatique pour un avenir prévisible.