FLOPS
FLOPS (Operações de Ponto Flutuante Por Segundo) mede quantas operações aritméticas de ponto flutuante um processador executa a cada segundo. É o benchmark primário para comparar hardware de IA, com GPUs de ponta moderna entregando milhares de teraFLOPS nos formatos de precisão reduzida usados no treinamento de IA.
FLOPS é uma unidade de throughput computacional igual a uma operação de ponto flutuante por segundo. Prefixos de ordem superior são padrão: um teraFLOPS (TFLOPS) equivale a 10^12 operações por segundo, um petaFLOPS equivale a 10^15, e um exaFLOPS equivale a 10^18. A métrica se aplica a CPUs, GPUs e aceleradoras de IA especializadas igualmente, embora cargas de trabalho de IA dependam quase exclusivamente de GPUs e silício customizado onde os números de FLOPS são mais altos.
Operações de ponto flutuante envolvem aritmética em números com precisão decimal. Hardware de IA moderno frequentemente opera em formatos de precisão reduzida — FP16, BF16 ou FP8 — em vez de FP32 completo, multiplicando throughput efetivo enquanto aceita pequenas compensações de precisão. Fabricantes portanto publicam múltiplas figuras de FLOPS para o mesmo chip dependendo do tipo de dado. O H100 SXM da NVIDIA entrega aproximadamente 2.000 TFLOPS em BF16 denso e aproximadamente 67 TFLOPS em FP32; o Blackwell B200 aproximadamente duplica o throughput BF16 relativo ao H100 e oferece throughput substancialmente mais alto em FP8. Comparar chips sem especificar o tipo de dado é enganoso.
Os números de FLOPS determinam diretamente a velocidade em que modelos de IA podem ser treinados e servidos. Modelos de linguagem maiores exigem mais aritmética por token de treinamento, portanto pesquisadores também expressam custo total de treinamento como uma contagem agregada de FLOPs — um total adimensional em vez de uma taxa. Leis de escalonamento documentadas por OpenAI e DeepMind no início dos anos 2020 mostraram que o desempenho do modelo melhora previsivamente com computação total de treinamento, tornando FLOPS uma variável de planejamento central para laboratórios de IA de fronteira. O custo de treinamento estimado de GPT-4 chegou a dezenas de milhões de dólares, impulsionado principalmente por GPU-horas consumidas.
Em 2026, grandes clusters de treinamento de IA agregam dezenas de milhares de GPUs NVIDIA B200 ou H200 ou aceleradoras customizadas equivalentes de Google, Amazon e Microsoft, alcançando throughput agregado multi-exaFLOPS. Execuções de treinamento para modelos de fronteira líderes rotineiramente consomem entre 10^24 e 10^25 FLOPs totais. Melhorias algorítmicas — incluindo arquiteturas de mixture-of-experts e curadoria de dados melhor — compensaram parcialmente a demanda de computação bruta por unidade de qualidade do modelo, mas o investimento total em hardware de nível de cluster continua a crescer.