La Unidad de Procesamiento Tensorial v5 (TPU v5) es un circuito integrado de aplicación específica (ASIC) personalizado desarrollado por Google para acelerar cargas de trabajo de aprendizaje automático e inteligencia artificial, particularmente modelos de aprendizaje profundo como transformadores basados en modelos de lenguaje grandes. Como la quinta generación de la familia de TPU de Google, se basa en los principios arquitectónicos de sus predecesores, enfatizando el cálculo de alto volumen y baja precisión (por ejemplo, 8 bits o menos) y operaciones de entrada/salida optimizadas por julio, sin el hardware de rasterización o mapeo de texturas que se encuentra en las unidades de procesamiento gráfico (GPU). La TPU v5 está diseñada para soportar marcos de trabajo como TensorFlow, JAX y PyTorch, y se despliega en los centros de datos de Google y se ofrece a través de servicios de google-cloud. En comparación con las GPU, las TPU como la v5 se utilizan a menudo para inferencia en flujos de trabajo basados en transformadores, mientras que las GPU se emplean con frecuencia para entrenamiento, aunque las TPU también soportan tareas de entrenamiento.
Diseño y Arquitectura
La TPU v5 continúa la tradición de Google de usar una arquitectura de matriz sistólica para la multiplicación de matrices, un diseño que se remonta a sistemas sistólicos anteriores como el WARP y fue popularizado por la TPU original. El chip está diseñado para alto rendimiento con precisión reducida, lo que permite la ejecución eficiente de operaciones de redes neuronales. Se empaqueta con un conjunto de disipador de calor que se ajusta a ranuras estándar de bastidores de centros de datos, similar a generaciones anteriores de TPU. La generación v5 probablemente incorpora mejoras en el ancho de banda de memoria y la densidad de cómputo sobre la TPU v4, aunque detalles técnicos específicos (por ejemplo, tamaño del dado, velocidad de reloj, capacidad de memoria) no se divulgan públicamente a partir de 2025. Las TPU de Google son propietarias, y Broadcom actúa como co-desarrollador, traduciendo la arquitectura de Google en silicio fabricable, con la fabricación gestionada a través de fundiciones de terceros como tsmc.
Historia y Desarrollo
El programa de TPU comenzó en 2013 cuando Google reclutó a Amir Salek para establecer capacidades de silicio personalizadas. Salek lideró el desarrollo de la TPU original y generaciones posteriores, incluyendo TPU v2, v3, v4 y Edge TPU. La primera TPU se anunció en mayo de 2016 en Google I/O, habiendo sido utilizada internamente desde 2015. Norman P. Jouppi sirvió como líder técnico y arquitecto principal, y su artículo de 2017 demostró un rendimiento de 15–30 veces mayor y un rendimiento por vatio de 30–80 veces mayor que las CPU y GPU contemporáneas. La TPU v5 representa la iteración más reciente, introducida después de la TPU v4, que se anunció en 2021. A partir de 2025, Google Cloud genera ingresos significativos de los sistemas TPU, y se espera que la generación v5 sea un producto clave.
Rendimiento y Casos de Uso
La TPU v5 está optimizada tanto para el entrenamiento como para la inferencia de modelos de redes neuronales, particularmente transformadores a gran escala utilizados en aplicaciones de IA generativa. En flujos de trabajo que involucran LLM, las TPU se utilizan a menudo para inferencia, mientras que las GPU se usan para entrenamiento, pero la TPU v5 busca sobresalir en ambos. Google ha utilizado TPU para servicios como Google Photos (procesando más de 100 millones de fotos por día por chip), extracción de texto de Google Street View y RankBrain para resultados de búsqueda. La TPU v5 probablemente continúa esta tendencia, permitiendo un procesamiento más rápido y eficiente de cargas de trabajo de IA en la nube.
Despliegue y Ecosistema
Las TPU están disponibles para terceros a través del servicio Cloud TPU de Google Cloud, así como a través de cuadernos de Kaggle y Colaboratory. En septiembre de 2025, Google estaba en conversaciones con "neoclouds" como Crusoe y CoreWeave sobre el despliegue de TPU en sus centros de datos, y en noviembre de 2025, Meta estaba en discusiones con Google para desplegar TPU en sus centros de datos de IA. Esto sugiere que la TPU v5 puede desplegarse más allá de la infraestructura propia de Google, expandiendo su ecosistema. La naturaleza propietaria de las TPU significa que el acceso es principalmente a través de servicios en la nube, pero el creciente interés de proveedores externos indica una tendencia de adopción más amplia.
Comparación con Otros Aceleradores de IA
La TPU v5 compite con otros aceleradores de IA como aws-trainium, los motores a escala de oblea de cerebras, las unidades de procesamiento de lenguaje de groq y los procesadores de flujo de datos de samba-nova. Mientras que las GPU de nvidia (no listadas) siguen siendo dominantes para el entrenamiento, las TPU ofrecen una alternativa especializada con alta eficiencia para cargas de trabajo específicas. La elección entre TPU y GPU depende de la arquitectura del modelo: las TPU son adecuadas para CNN y transformadores, mientras que las GPU pueden beneficiar a redes totalmente conectadas, y las CPU pueden ser ventajosas para RNN. El diseño de la TPU v5 busca mantener la ventaja competitiva de Google en infraestructura de IA, especialmente a medida que crece la demanda de servicios de IA a gran escala.