Hardware

FLOPS

FLOPS (Operaciones de Punto Flotante por Segundo) mide cuántas operaciones aritméticas de punto flotante un procesador ejecuta cada segundo. Es el benchmark primario para comparar hardware de IA, con GPUs de gama alta modernas entregando miles de teraFLOPS en los formatos de precisión reducida usados en entrenamiento de IA.

FLOPS es una unidad de rendimiento computacional igual a una operación de punto flotante por segundo. Los prefijos de orden superior son estándar: un teraFLOPS (TFLOPS) es igual a 10^12 operaciones por segundo, un petaFLOPS es igual a 10^15, y un exaFLOPS es igual a 10^18. La métrica se aplica a CPUs, GPUs, y aceleradores de IA especializados por igual, aunque las cargas de trabajo de IA se basan casi exclusivamente en GPUs y silicio personalizado donde las cifras de FLOPS son las más altas.

Las operaciones de punto flotante implican aritmética en números con precisión decimal. El hardware de IA moderno frecuentemente opera en formatos de precisión reducida — FP16, BF16, o FP8 — en lugar de FP32 completo, multiplicando el rendimiento efectivo mientras acepta compromisos de precisión menores. Los fabricantes por lo tanto publican múltiples cifras de FLOPS para el mismo chip dependiendo del tipo de datos. El H100 SXM de NVIDIA entrega aproximadamente 2.000 TFLOPS en BF16 denso e aproximadamente 67 TFLOPS en FP32; el Blackwell B200 aproximadamente duplica el rendimiento de BF16 relativo al H100 y ofrece rendimiento sustancialmente más alto en FP8. Comparar chips sin especificar el tipo de dato es engañoso.

Las cifras de FLOPS directamente determinan la velocidad a la que los modelos de IA pueden ser entrenados y servidos. Los modelos de lenguaje más grandes requieren más aritmética por token de entrenamiento, por lo que los investigadores también expresan el costo de entrenamiento total como un recuento de FLOPS agregado — un total adimensional en lugar de una tasa. Las leyes de escalado documentadas por OpenAI y DeepMind en los primeros años 2020 mostraron que el rendimiento del modelo mejora predeciblemente con la computación de entrenamiento total, haciendo de FLOPS una variable central de planificación para los laboratorios de IA frontera. El costo de entrenamiento estimado de GPT-4 corrió en decenas de millones de dólares, impulsado principalmente por las horas-GPU consumidas.

Para 2026, los clústeres de entrenamiento de IA grandes agregan decenas de miles de GPUs NVIDIA B200 o H200 o aceleradores personalizados equivalentes de Google, Amazon, y Microsoft, alcanzando rendimiento agregado multi-exaFLOPS. Las ejecuciones de entrenamiento para los modelos frontera líderes rutinariamente consumen entre 10^24 y 10^25 FLOPS totales. Las mejoras algorítmicas — incluyendo arquitecturas mixture-of-experts y mejor curación de datos — han compensado parcialmente la demanda de computación cruda por unidad de calidad de modelo, pero la inversión de hardware total a nivel de clúster continúa creciendo.

Ejemplo

Cuando se evalúan ofertas de GPU en nube para un trabajo de entrenamiento distribuido, un ingeniero de ML verifica que el clúster reservado entrega TFLOPS suficientes en precisión BF16 para completar el entrenamiento dentro del plazo y presupuesto del proyecto antes de comprometerse a una reserva de capacidad.

Términos relacionados

Últimas noticias sobre el tema

← Glosario