TPU (Unidad de Procesamiento de Tensores)
Una TPU es un ASIC personalizado diseñado por Google específicamente para acelerar operaciones tensoriales — las multiplicaciones de matrices en el núcleo del entrenamiento e inferencia de redes neuronales — ofreciendo mayor rendimiento por vatio que las GPU de propósito general para esas cargas de trabajo.
Una Tensor Processing Unit (TPU) es un circuito integrado específico de aplicación desarrollado por Google para acelerar cargas de trabajo de aprendizaje automático, particularmente las operaciones de multiplicación-acumulación de matrices que dominan el cómputo de redes neuronales. A diferencia de las GPU, que se diseñan para cómputo paralelo general, las TPU se optimizan exclusivamente para álgebra lineal densa — la operación matemática central en el entrenamiento y ejecución de modelos grandes.
Las TPU se construyen alrededor de una arquitectura de matriz sistólica: una cuadrícula de unidades de multiplicación-acumulación que pasan datos entre vecinos sin almacenar resultados intermedios en memoria principal, reduciendo drásticamente la presión del ancho de banda de memoria. El TPU v1 de Google, desplegado internamente en 2015 y divulgado en ISCA 2017, entregaba 92 teraoperaciones por segundo (TOPS) en enteros de 8 bits. Las generaciones sucesivas agregaron memoria de alto ancho de banda (HBM), soporte bfloat16 e interconexiones multi-chip. TPU v5e y v5p, disponibles a través de Google Cloud a partir de 2024–2025, soportan pods de miles de chips vinculados por interconexiones personalizadas para entrenamiento distribuido a gran escala.
Las TPU importan porque reducen el costo y tiempo de entrenamiento y servicio de modelos de IA grandes. Google las acredita con hacer que sea económicamente viable entrenar AlphaGo, BERT y las familias de modelos PaLM y Gemini a escala. Para inferencia en volumen de producción — miles de millones de consultas por día en Google Search, Translate y Gemini — los clústeres de TPU proporcionan ventajas de latencia y costo sobre flotas de GPU, particularmente para cargas de trabajo de transformer con patrones de acceso a memoria predecibles.
A partir de 2026, Google ofrece TPU v5p y v5e a través de Google Cloud, mientras que la sexta generación (TPU Ironwood, anunciada en Google Cloud Next 2025) apunta a entrenamiento de IA a escala exaflop. Otros proveedores de nube principales y laboratorios de IA han introducido aceleradores personalizados competitivos, pero las TPU de Google siguen siendo los ASIC de IA de primera parte más ampliamente desplegados en producción, habiendo procesado la mayoría de las cargas de trabajo de ML interno de Google desde 2017.