Cluster de GPU
Um cluster de GPU é uma coleção de servidores, cada um contendo múltiplas GPUs, interconectadas por rede de alta velocidade para agir como um único recurso de computação paralela para treinamento ou serviço de modelos de IA que excedem a capacidade de qualquer máquina individual.
Um cluster de GPU agrega a computação, memória e armazenamento de muitos servidores para que cargas de trabalho de IA muito grandes para uma máquina possam ser distribuídas entre todos eles. Cada servidor (nó) típicamente contém 4–16 GPUs ligadas por interconexões intra-nó de alta largura de banda, como NVLink, enquanto nós se conectam um ao outro e ao armazenamento compartilhado através de InfiniBand ou Ethernet de alta velocidade. Um agendador de trabalhos — Slurm, Kubernetes ou equivalentes proprietários — aloca recursos de cluster, monitora saúde de hardware e reinicia trabalhos falhados.
A motivação primária para clustering é que o treinamento de modelo de fronteira requer memória e computação muito além de um único nó. Execuções de treinamento para modelos em escala de GPT-4 estima-se terem usado dezenas de milhares de GPUs equivalentes a A100 por meses. Frameworks de treinamento distribuído — DeepSpeed, Megatron-LM, PyTorch FSDP — dividem o trabalho via paralelismo de dados (diferentes lotes em diferentes GPUs), paralelismo de tensor (matrizes de peso fragmentadas através de GPUs) e paralelismo de pipeline (diferentes camadas de modelo em diferentes GPUs). Utilização de FLOP de modelo (MFU) — a fração de FLOPs teóricos de pico realmente usados para computação — é uma métrica de eficiência chave; valores de 30–50% são considerados bons para clusters grandes devido a overhead de comunicação.
Clusters de GPU se tornaram o ativo de capital central do desenvolvimento de IA. Provedores de nuvem (AWS, Google Cloud, Azure) oferecem acesso sob demanda a pools de milhares de GPUs; principais laboratórios de IA operam clusters proprietários em escala maior. Exemplos notáveis incluem Research SuperCluster da Meta (16.000 A100s, 2022) e instalação Memphis da xAI (reportada em aproximadamente 100.000 H100s, 2024). Um cluster de 10.000 GPUs H100 representa uma despesa de capital de hardware de aproximadamente $300–500 milhões antes de infraestrutura de energia, resfriamento e rede.
A partir de 2026, clusters de 100.000 ou mais GPUs estão em operação ou construção ativa em vários laboratórios de IA e provedores de nuvem. Desafios de engenharia chave nessa escala incluem congestionamento de rede all-reduce durante sincronização de gradiente, tolerância a falhas (uma única falha de GPU pode paralisar um trabalho de treinamento abrangendo milhares de nós) e entrega de potência sustentada. Serviço desagregado — onde prefill (processamento de prompt) e decode (geração de token) executam em pools de GPU separados e independentemente dimensionados — emergiu como um padrão arquitetural líder para inferência em larga escala eficiente em custo.