VRAM
VRAM (Memoria de Acceso Aleatorio de Vídeo) es la memoria dedicada de alta velocidad en una GPU utilizada para almacenar pesos del modelo, activaciones y caché KV durante el entrenamiento e inferencia de IA. Su capacidad es la restricción principal sobre qué modelos pueden ejecutarse en una GPU determinada.
VRAM es la memoria integrada directamente conectada a una GPU, distinta de la RAM del sistema. En cargas de trabajo de IA almacena parámetros del modelo (pesos), datos de entrada, activaciones, tensores de gradiente durante el entrenamiento y cachés de clave-valor durante la inferencia. Debido a que los núcleos de cálculo de la GPU obtienen datos de VRAM millones de veces por segundo, el ancho de banda y la capacidad rigen directamente el rendimiento y el tamaño máximo del modelo que se puede cargar.
La relación entre el tamaño del modelo y VRAM es aproximadamente lineal: un modelo con 7 mil millones de parámetros almacenados en punto flotante de 16 bits requiere aproximadamente 14 GB solo para pesos, antes de contar activaciones, estados del optimizador o caché KV. Las técnicas de cuantización (GPTQ, AWQ, bitsandbytes) reducen esta huella en 2–4×. Durante el entrenamiento, el uso máximo de VRAM es típicamente 3–6× la huella de pesos porque el optimizador Adam mantiene dos tensores adicionales por parámetro junto a los gradientes.
La capacidad de VRAM es un techo duro que moldea el mercado de hardware. NVIDIA's A100 llegó con 40 u 80 GB de HBM2E; el H100 lleva 80 GB HBM3; el H200 se expande a 141 GB HBM3E. Las GPU de consumidor como la RTX 4090 llevan 24 GB GDDR6X — suficientes para inferencia en modelos de hasta aproximadamente 13–20B parámetros a precisión reducida, pero muy por debajo de las tarjetas de centro de datos. Esta brecha impulsa servidores multi-GPU y marcos de desplazamiento a CPU como llama.cpp.
A partir de 2026, VRAM sigue siendo la restricción de ingeniería central para desplegar modelos de frontera. Los sistemas de clase GPT-4 requieren cientos de gigabytes distribuidos a través de múltiples GPU a través de paralelismo de tensor y tubería. AMD's MI300X (192 GB HBM3 por tarjeta) y NVIDIA's B200 (192 GB HBM3E) están diseñados para elevar el techo más alto, mientras que algoritmos como FlashAttention reducen el consumo máximo de VRAM recomputando activaciones sobre la marcha en lugar de almacenarlas.