NVIDIA Developer Blog→ original

NVIDIA descreveu paralelismo tensorial não uniforme para treinamento de LLM em GPUs

NVIDIA discutiu em seu Developer Blog a técnica de paralelismo tensorial não uniforme para treinamento de modelos de linguagem grande em clusters de milhares de GPUs. O método visa aumentar o goodput - a proporção de trabalho computacional útil - selecionando individualmente o grau de paralelismo para diferentes partes do modelo.

Processado por IA de NVIDIA Developer Blog; editado por Hamidun News
NVIDIA descreveu paralelismo tensorial não uniforme para treinamento de LLM em GPUs
Fonte: NVIDIA Developer Blog. Colagem: Hamidun News.
◐ Ouvir artigo

NVIDIA publicou um artigo em seu Developer Blog corporativo sobre paralelismo de tensor não uniforme — uma abordagem projetada para aumentar o goodput, ou seja, a fração de trabalho computacional útil, ao treinar grandes modelos de linguagem em clusters de milhares de GPU.

O Que É Goodput No Treinamento De LLM

O treinamento de grandes modelos de linguagem modernos é cada vez mais realizado em clusters de milhares de processadores gráficos e se estende por semanas e às vezes até meses de operação contínua. Com tal duração, o custo das falhas aumenta acentuadamente: a falha de um único nó, travamento de um GPU "retardatário" ou a necessidade de reiniciar a partir de um ponto de verificação consomem parte do tempo computacional total. Goodput é uma métrica que reflete não apenas a carga total de GPU, mas a fração de trabalho genuinamente útil e produtivo ajustado para essas perdas.

Entre as causas típicas de sua redução estão congestão de rede entre nós, carga desigual em GPUs individuais e tempo gasto salvando e recuperando pontos de verificação intermediários após uma falha.

  • O material foi publicado no NVIDIA Developer Blog e é dedicado especificamente a aumentar o goodput no treinamento de LLM
  • Isso se refere à infraestrutura projetada para tarefas que abrangem milhares de GPU simultaneamente
  • Tais execuções de treinamento podem durar muito tempo sem parar
  • O método proposto é chamado de paralelismo de tensor não uniforme — "paralelismo de tensor não uniforme"

Como Funciona O Paralelismo De Tensor Não Uniforme

O paralelismo de tensor é um dos métodos básicos de treinamento distribuído: operações de matriz individual dentro das camadas do modelo são divididas em partes e calculadas simultaneamente em diferentes GPUs, permitindo que você treine modelos que fisicamente não cabem na memória de uma placa gráfica. A abordagem clássica aplica o mesmo grau de partição a todas as camadas do modelo sem discriminação. A variante não uniforme descrita pela NVIDIA seleciona o grau de paralelismo individualmente para diferentes partes do modelo — levando em conta sua carga computacional e o volume de dados que precisam ser trocados entre GPUs.

O objetivo é reduzir o tempo ocioso e a sobrecarga de comunicação entre dispositivos, aumentando o goodput geral sem comprar hardware adicional. Essas técnicas são geralmente implementadas em conjunto com bibliotecas de treinamento distribuído como Megatron-LM e a plataforma NeMo, que a NVIDIA desenvolve especificamente para treinar grandes modelos em suas GPUs.

O paralelismo de tensor não é a única forma de distribuir o treinamento entre GPUs: ao lado dele, o paralelismo de pipeline é usado, onde diferentes camadas do modelo são anexadas a diferentes GPUs e processadas de forma similar a um pipeline, e o paralelismo de dados, onde cada GPU armazena uma cópia completa do modelo, e apenas os exemplos de treinamento em si são compartilhados entre dispositivos. Na prática, grandes clusters de treinamento combinam todas as três abordagens simultaneamente, e quão bem essa combinação é selecionada para uma arquitetura de modelo particular determina diretamente o goodput geral.

Por Que Isso Importa Para a Infraestrutura de IA

Até mesmo um pequeno ganho percentual em eficiência se traduz em economias significativas ao contar milhares de GPUs e semanas de treinamento contínuo. Treinar um verdadeiro modelo moderno grande requer recursos computacionais custando dezenas e centenas de milhões de dólares, então até um ganho de um por cento em goodput se traduz em economias significativas em tempo, eletricidade e dinheiro. A NVIDIA, como o maior fornecedor de aceleradores para IA, regularmente publica tais análises de engenharia para que seus clientes — empresas treinando seus próprios LLMs em infraestrutura NVIDIA — possam extrair mais eficiência de clusters já existentes sem expandir sua frota de equipamentos.

O Que Isso Significa

Conforme a escala do treinamento de grandes modelos de linguagem cresce, não apenas a quantidade e o poder dos chips importam, mas também a engenharia de software de sistemas — quão eficientemente a infraestrutura distribuída usa as GPUs já compradas.

ZK
Hamidun News
Notícias de AI sem ruído. Seleção editorial diária de mais de 50 fontes. Produto de Zhemal Khamidun, Head of AI na Alpina Digital.

Quer parar de ler sobre IA e começar a usar?

AI News é um feed curado de notícias de IA. A Hamidun Academy ensina você a usar IA no trabalho.

O que você acha?
Carregando comentários…