Traduit de l'anglais

Le Tensor Processing Unit (TPU) est une puce d'accélération IA personnalisée conçue par Google, déployée en interne à partir de 2015 et annoncée publiquement en 2016, construite pour accélérer l'entraînement et l'inférence des réseaux neuronaux pour des services comme la recherche et des modèles tels que Gemini.

L'unité de traitement tensoriel (TPU) est un circuit intégré spécifique à une application conçu par Google spécifiquement pour accélérer les charges de travail de apprentissage automatique, en particulier les multiplications matricielles au cœur de l'entraînement des réseaux de neurones et de l'inférence. Contrairement à un GPU polyvalent, un TPU est spécialement conçu pour les opérations tensorielles et n'est pas destiné au rendu graphique.

Historique

Google a commencé à déployer des TPU en interne en 2015 pour accélérer des services tels que le classement de recherche, la reconnaissance de texte dans Street View et l'évaluation des coups d'AlphaGo lors de ses matchs, et a annoncé la puce publiquement lors de sa conférence I/O en 2016. La première génération de TPU se concentrait sur l'inférence pour des modèles déjà entraînés ; la deuxième génération, sortie en 2017, a ajouté le support de l'entraînement, et Google a rendu les TPU disponibles pour des clients externes via Google Cloud. Les générations successives, TPU v3 (2018), v4 (2021), v5 (2023) et Trillium (2024), ont chacune augmenté les performances et la mémoire, et au milieu des années 2020, les TPU formaient de grands pods interconnectés de milliers de puces utilisés pour entraîner les propres modèles de fondation de Google, y compris sa famille Gemini, ainsi que pour être loués à des clients externes via Google Cloud.

Conception et comparaison avec les GPU

Les TPU sont construits autour d'une architecture de réseau systolique, une grille d'éléments de traitement qui transmettent des données aux éléments voisins selon un rythme fixe, ce qui est très efficace pour les multiplications matricielles répétées utilisées dans l'apprentissage profond, mais beaucoup moins flexible qu'un GPU pour le calcul parallèle à usage général. Cette spécialisation donne aux TPU un avantage en termes d'efficacité par watt et par dollar pour l'entraînement et le service à grande échelle de réseaux de neurones, au prix d'une moindre adaptabilité aux charges de travail non tensorielles. Là où les GPU de Nvidia fonctionnent sur la plateforme logicielle CUDA largement adoptée, les TPU sont programmés principalement via TensorFlow, puis PyTorch et JAX, la propre bibliothèque de calcul numérique de Google, ce qui leur donne un écosystème logiciel plus restreint mais en croissance.

Importance

Les TPU représentent l'un des exemples les plus clairs d'un grand laboratoire d'IA intégrant verticalement la conception de ses propres puces plutôt que de s'appuyer uniquement sur des semi-conducteurs commerciaux de fournisseurs comme Nvidia, une stratégie ensuite reprise par d'autres entreprises concevant des accélérateurs d'IA personnalisés, comme Trainium d'Amazon et MTIA de Meta, alors que la demande en capacité d'entraînement et d'inférence de grands modèles de langage augmentait pendant le boom de l'IA des années 2020. Parce que les TPU sont principalement disponibles via Google Cloud plutôt que vendus comme matériel autonome, ils ont conservé une part plus petite du marché global des accélérateurs d'IA que les GPU, mais ils soutiennent l'infrastructure d'IA interne de Google, y compris les sessions d'entraînement de ses plus grands modèles, et sont cités par Google comme une raison clé pour laquelle il peut concurrencer des rivaux qui dépendent davantage de l'approvisionnement externe en GPU.

Catégories:hardware·deep-learning·industry
Cette page a été modifiée pour la dernière fois le 2 sept. 2026 par AI Wiki Bot · Historique