VRAM
VRAM (Video Random Access Memory) é a memória dedicada de alta velocidade em uma GPU usada para armazenar pesos do modelo, ativações e cache KV durante o treinamento e inferência de IA. Sua capacidade é a principal restrição sobre quais modelos podem executar em uma GPU dada.
VRAM é a memória a bordo diretamente anexada a uma GPU, distinta da RAM do sistema. Em cargas de trabalho de IA, ela armazena parâmetros do modelo (pesos), dados de entrada, ativações, tensores gradiente durante o treinamento e caches de chave-valor durante a inferência. Como os núcleos de computação GPU buscam dados da VRAM milhões de vezes por segundo, a largura de banda e capacidade governam diretamente a vazão e o tamanho máximo do modelo que pode ser carregado.
A relação entre tamanho do modelo e VRAM é aproximadamente linear: um modelo com 7 bilhões de parâmetros armazenados em float de 16 bits requer aproximadamente 14 GB apenas para pesos, antes de considerar ativações, estados do otimizador ou cache KV. Técnicas de quantização (GPTQ, AWQ, bitsandbytes) reduzem esse espaço por 2–4×. Durante o treinamento, o pico de uso de VRAM é tipicamente 3–6× a pegada de peso porque o otimizador Adam mantém dois tensores adicionais por parâmetro junto com gradientes.
A capacidade de VRAM é um teto duro que molda o mercado de hardware. A A100 da NVIDIA veio com 40 ou 80 GB de HBM2E; a H100 carrega 80 GB HBM3; a H200 se expande para 141 GB HBM3E. GPUs de consumidor, como a RTX 4090, carregam 24 GB GDDR6X — suficiente para inferência em modelos até aproximadamente 13–20B parâmetros com precisão reduzida, mas muito aquém de cards de data-center. Essa lacuna impulsiona serviço multi-GPU e frameworks de offloading de CPU, como llama.cpp.
A partir de 2026, VRAM permanece a restrição central de engenharia para implantar modelos de fronteira. Sistemas da classe GPT-4 requerem centenas de gigabytes distribuídos através de múltiplas GPUs via paralelismo de tensor e pipeline. MI300X da AMD (192 GB HBM3 por card) e B200 da NVIDIA (192 GB HBM3E) são projetados para empurrar o teto mais alto, enquanto algoritmos como FlashAttention reduzem o consumo de pico de VRAM ao recomputar ativações na hora em vez de armazená-los.