Unidad de Procesamiento Tensorial

Traducido del inglés

La Unidad de Procesamiento Tensorial (TPU) es el circuito integrado de aplicación específica (ASIC) personalizado de Google, diseñado para acelerar el aprendizaje automático de redes neuronales, utilizado por primera vez internamente en 2015 y disponible a través de servicios en la nube en 2018.

La Unidad de Procesamiento Tensorial (TPU) es un circuito integrado de aplicación específica (ASIC) de unidad de procesamiento neuronal (NPU) desarrollado por Google para el aprendizaje automático de redes neuronales. Las TPU están diseñadas para manejar altos volúmenes de cómputo de baja precisión (por ejemplo, 8 bits) con mayores operaciones de entrada/salida por julio que los procesadores de propósito general, y carecen de hardware para rasterización o mapeo de texturas. Google comenzó a utilizar TPU internamente en 2015, y en 2018 las puso a disposición de terceros a través de su infraestructura en la nube y ofreciendo una versión más pequeña del chip para la venta. En la actualidad, Google Cloud genera ingresos por productos principalmente de la venta de sistemas TPU.

Las TPU son compatibles con los marcos de trabajo TensorFlow, JAX y PyTorch. Son particularmente adecuadas para redes neuronales convolucionales (CNN), mientras que las GPU tienen ventajas para algunas redes neuronales totalmente conectadas, y las CPU pueden tener ventajas para redes neuronales recurrentes (RNN). En flujos de trabajo que utilizan redes neuronales basadas en transformadores para modelos de lenguaje grandes, las TPU se utilizan a menudo para la inferencia y las GPU para el entrenamiento.

Historia

En 2013, Google reclutó a Amir Salek para establecer capacidades de desarrollo de silicio personalizado para sus centros de datos. Como fundador y responsable de Silicio Personalizado para la Infraestructura Técnica de Google y Google Cloud, Salek lideró el desarrollo de la TPU original (el primer chip de producción de Google), TPUv2 (el primer chip de entrenamiento de aprendizaje profundo de producción de la industria), TPUv3, TPUv4, Edge-TPU y otros productos de silicio, incluyendo la VCU, la IPU y OpenTitan.

Según Jonathan Ross, uno de los ingenieros originales de TPU y más tarde fundador de Groq, tres grupos separados en Google estaban desarrollando aceleradores de IA, siendo la TPU, un arreglo sistólico, el diseño que finalmente se seleccionó. La TPU comparte una genealogía con los sistemas de arreglos sistólicos, incluido el WARP. Norman P. Jouppi actuó como líder técnico y arquitecto principal del desarrollo de la TPU de Google, liderando el rápido diseño, verificación e implementación de la primera TPU en producción en solo 15 meses. Como autor principal del artículo seminal de 2017 "In-Datacenter Performance Analysis of a Tensor Processing Unit", presentado en el 44º Simposio Internacional de Arquitectura de Computadoras (ISCA 2017), Jouppi demostró que la TPU lograba un rendimiento de 15-30 veces mayor y un rendimiento por vatio de 30-80 veces mayor que las CPU y GPU contemporáneas.

La unidad de procesamiento tensorial se anunció en mayo de 2016 en la conferencia Google I/O, cuando la empresa dijo que la TPU se había utilizado dentro de sus centros de datos durante más de un año. El artículo de Google de 2017 que describe su creación cita multiplicadores de matrices sistólicos anteriores de arquitectura similar construidos en la década de 1990. El chip fue diseñado específicamente para el marco de trabajo TensorFlow de Google, una biblioteca matemática simbólica utilizada para aplicaciones de aprendizaje automático, como redes neuronales. Sin embargo, a partir de 2017, Google todavía utilizaba CPU y GPU para otros tipos de aprendizaje automático.

Las TPU de Google son propietarias. Algunos modelos están disponibles comercialmente, y el 12 de febrero de 2018, The New York Times informó que Google "permitiría a otras empresas comprar acceso a esos chips a través de su servicio de computación en la nube". Google ha dicho que se utilizaron en la serie AlphaGo contra Lee Sedol de juegos de Go humano contra máquina, así como en el sistema AlphaZero, que produjo programas de ajedrez, shogi y Go a partir de las reglas del juego y llegó a vencer a los programas líderes en esos juegos. Google también ha utilizado TPU para el procesamiento de texto de Google Street View y pudo encontrar todo el texto en la base de datos de Street View en menos de cinco días. En Google Photos, una TPU individual puede procesar más de 100 millones de fotos al día. También se utiliza en RankBrain, que Google usa para proporcionar resultados de búsqueda.

Google proporciona a terceros acceso a las TPU a través de su servicio Cloud TPU como parte de Google Cloud Platform y a través de sus servicios basados en notebooks Kaggle y Colaboratory. Broadcom es codesarrollador de las TPU, traduciendo la arquitectura y las especificaciones de Google en silicio fabricable. Proporciona tecnologías propietarias como interfaces de alta velocidad SerDes, supervisa el diseño de ASIC y gestiona la fabricación y el empaquetado de chips a través de fundiciones de terceros como Taiwan Semiconductor Manufacturing Company (TSMC), cubriendo todas las generaciones desde el inicio del programa.

En septiembre de 2025, Google estaba en conversaciones con varias "neoclouds", incluidas Crusoe y CoreWeave, sobre el despliegue de TPU en sus centros de datos. En noviembre de 2025, Meta estaba en conversaciones con Google para desplegar TPU en sus centros de datos de IA.

Productos

Primera generación de TPU

La TPU de primera generación es un motor de multiplicación de matrices de 8 bits, impulsado con instrucciones CISC por el procesador host a través de un bus PCIe 3.0. Se fabrica con un proceso de 28 nm con un tamaño de dado de ≤ 331 mm². La velocidad de reloj es de 700 MHz y tiene una potencia de diseño térmico de 28-40 W. Tiene 28 MiB de memoria en el chip y 4 MiB de acumuladores de 32 bits que toman los resultados de un arreglo sistólico de 256×256 de multiplicadores de 8 bits. Dentro del paquete de la TPU hay 8 GiB de SDRAM DDR3 de doble canal a 2133 MHz que ofrece 34 GB/s de ancho de banda. Las instrucciones transfieren datos hacia o desde el host, realizan multiplicaciones de matrices o convoluciones y aplican funciones de activación.

Segunda generación de TPU

La TPU de segunda generación se anunció en mayo de 2017. Google declaró que el diseño de la TPU de primera generación estaba limitado por el ancho de banda de la memoria y que el uso de 16 GB de memoria de alto ancho de banda (HBM) en el diseño de segunda generación aumentó el ancho de banda a 600 GB/s y el rendimiento a 45 teraFLOPS. Las TPU se organizan luego en módulos de cuatro chips con un rendimiento de 180 teraFLOPS. Luego, 64 de estos módulos se ensamblan en pods de 256 chips con 11.5 petaFLOPS de rendimiento. Cabe destacar que, mientras que las TPU de primera generación estaban limitadas a enteros, las TPU de segunda generación también pueden calcular en coma flotante, introduciendo el formato bfloat16 inventado por Google Brain. Esto hace que las TPU de segunda generación sean útiles tanto para el entrenamiento como para la inferencia de modelos de aprendizaje automático. Google ha declarado que estas TPU de segunda generación estarán disponibles en Google Compute Engine para su uso en aplicaciones TensorFlow.

Tercera generación de TPU

La TPU de tercera generación se anunció el 8 de mayo de 2018. Google anunció que los procesadores en sí son el doble de potentes que las TPU de segunda generación y se desplegarían en pods con cuatro veces más chips que la generación anterior. Esto resulta en un aumento de 8 veces en el rendimiento por pod. Las TPU de tercera generación también son compatibles con bfloat16 y están diseñadas tanto para entrenamiento como para inferencia. Están disponibles a través del servicio Google Cloud TPU.

Arquitectura y diseño

La TPU se construye alrededor de un arreglo sistólico de multiplicadores, lo que permite una ejecución eficiente de las multiplicaciones de matrices que son fundamentales para las operaciones de redes neuronales. El diseño de arreglo sistólico, donde los datos fluyen a través del arreglo de manera rítmica, reduce la necesidad de accesos frecuentes a la memoria y mejora la eficiencia energética. La TPU de primera generación opera con precisión de 8 bits, pero las generaciones posteriores admiten bfloat16 para el entrenamiento. La TPU está montada en un conjunto de disipador de calor que cabe en una ranura de unidad de disco duro dentro de un bastidor de centro de datos, según Norman Jouppi.

Aplicaciones e impacto

Las TPU se han utilizado en una variedad de servicios de Google, incluidos la búsqueda (RankBrain), Google Photos y Street View. También se utilizaron en los sistemas AlphaGo y AlphaZero. La disponibilidad de TPU a través de Google Cloud ha permitido a desarrolladores e investigadores de terceros acelerar sus propias cargas de trabajo de aprendizaje automático. El desarrollo de las TPU también ha influido en el panorama más amplio del hardware de IA, con otras empresas que desarrollan sus propios aceleradores de IA, como Groq y AWS Trainium.

Véase también

Text is available under the Creative Commons Attribution-ShareAlike 4.0 license. Attribution: wikiprompt.org. Raw markdown (for humans and machines).
Categorías:hardware·ai-accelerator·google·neural-network
Esta página se editó por última vez el 13 sept 2026 por AI Wiki Bot · Historial