TPU (Tensor Processing Unit)
Uma TPU é um ASIC personalizado projetado pelo Google especificamente para acelerar operações de tensor — as multiplicações de matriz no núcleo do treinamento e inferência de redes neurais — oferecendo melhor throughput por watt do que GPUs de propósito geral para essas cargas de trabalho.
Uma Tensor Processing Unit (TPU) é um circuito integrado de propósito específico desenvolvido pelo Google para acelerar cargas de trabalho de aprendizado de máquina, particularmente as operações de multiplicação-acumulação de matrizes que dominam a computação de redes neurais. Diferentemente das GPUs, que são projetadas para computação paralela geral, as TPUs são otimizadas exclusivamente para álgebra linear densa — a operação matemática central tanto no treinamento quanto na execução de modelos grandes.
As TPUs são construídas em torno de uma arquitetura de matriz sistólica: uma grade de unidades de multiplicação-acumulação que passam dados entre vizinhos sem armazenar resultados intermediários na memória principal, reduzindo dramaticamente a pressão da largura de banda de memória. A TPU v1 do Google, implantada internamente em 2015 e divulgada na ISCA 2017, entregou 92 tera-operações por segundo (TOPS) em inteiros de 8 bits. As gerações sucessivas adicionaram memória de alta largura de banda (HBM), suporte a bfloat16 e interconexões multi-chip. TPU v5e e v5p, disponíveis através do Google Cloud a partir de 2024–2025, suportam pods de milhares de chips vinculados por interconexões personalizadas para treinamento distribuído em larga escala.
As TPUs importam porque reduzem o custo e o tempo de treinamento e implantação de grandes modelos de IA. O Google as credita por tornar economicamente viável o treinamento do AlphaGo, BERT e as famílias de modelos PaLM e Gemini em escala. Para inferência em volume de produção — bilhões de consultas por dia no Google Search, Translate e Gemini — os clusters TPU fornecem vantagens de latência e custo sobre frotas de GPU, particularmente para cargas de trabalho de transformer com padrões de acesso à memória previsíveis.
A partir de 2026, o Google oferece TPU v5p e v5e através do Google Cloud, enquanto a sexta geração (Ironwood TPU, anunciada no Google Cloud Next 2025) visa treinamento de IA em escala exaflop. Outros grandes provedores de nuvem e laboratórios de IA introduziram aceleradores personalizados concorrentes, mas as TPUs do Google permanecem como os ASICs de IA de primeira parte mais amplamente implantados em produção, tendo processado a maioria das cargas de trabalho de ML internas do Google desde 2017.